贝叶斯定理

贝叶斯定理是通过对观测值概率分布的主观判断（即先验概率）进行修正的定理，在概率论中具有重要地位。

先验概率分布(边缘概率)是指基于主观判断而非样本分布的概率分布，后验概率(条件概率)是根据样本分布和未知参数的先验概率分布求得的条件概率分布。

贝叶斯公式：

P(A∩B) = P(A)*P(B|A) = P(B)*P(A|B)

变形得：

P(A|B)=P(B|A)*P(A)/P(B)

其中

P(A)是A的先验概率或边缘概率，称作"先验"是因为它不考虑B因素。
P(A|B)是已知B发生后A的条件概率，也称作A的后验概率。
P(B|A)是已知A发生后B的条件概率，也称作B的后验概率，这里称作似然度。
P(B)是B的先验概率或边缘概率，这里称作标准化常量。
P(B|A)/P(B)称作标准似然度。

朴素贝叶斯分类(Naive Bayes)

朴素贝叶斯分类器在估计类条件概率时假设属性之间条件独立。

首先定义

x = {a1,a2,...}为一个样本向量，a为一个特征属性
div = {d1 = [l1,u1],...} 特征属性的一个划分
class = {y1,y2,...}样本所属的类别

算法流程：

(1) 通过样本集中类别的分布，对每个类别计算先验概率p(y[i])

(2) 计算每个类别下每个特征属性划分的频率p(a[j] in d[k] | y[i])

(3) 计算每个样本的p(x|y[i])

p(x|y[i]) = p(a[1] in d | y[i]) * p(a[2] in d | y[i]) * ...

样本的所有特征属性已知，所以特征属性所属的区间d已知。

可以通过(2)确定p(a[k] in d | y[i])的值，从而求得p(x|y[i])。

(4) 由贝叶斯定理得：

p(y[i]|x) = ( p(x|y[i]) * p(y[i]) ) / p(x)

因为分母相同，只需计算分子。

p(y[i]|x)是观测样本属于分类y[i]的概率，找出最大概率对应的分类作为分类结果。

示例：

导入数据集

{a1 = 0, a2 = 0, C = 0} {a1 = 0, a2 = 0, C = 1}

{a1 = 1, a2 = 0, C = 0} {a1 = 0, a2 = 0, C = 1}

{a1 = 1, a2 = 0, C = 0} {a1 = 1, a2 = 0, C = 1}

{a1 = 1, a2 = 1, C = 0} {a1 = 1, a2 = 0, C = 1}

{a1 = 1, a2 = 1, C = 0} {a1 = 1, a2 = 1, C = 1}

计算类别的先验概率

P(C = 0) = 0.5

P(C = 1) = 0.5

计算每个特征属性条件概率：

P(a1 = 0 | C = 0) = 0.3

P(a1 = 1 | C = 0) = 0.7

P(a2 = 0 | C = 0) = 0.4

P(a2 = 1 | C = 0) = 0.6

P(a1 = 0 | C = 1) = 0.5

P(a1 = 1 | C = 1) = 0.5

P(a2 = 0 | C = 1) = 0.7

P(a2 = 1 | C = 1) = 0.3

测试样本：

x = { a1 = 1, a2 = 2}

p(x | C = 0) = p(a1 = 1 | C = 0) * p( 2 = 2 | C = 0) = 0.3 * 0.6 = 0.18

p(x | C = 1) = p(a1 = 1 | C = 1) * p (a2 = 2 | C = 1) = 0.5 * 0.3 = 0.15

计算P(C | x) * p(x):

P(C = 0) * p(x | C = 1) = 0.5 * 0.18 = 0.09

P(C = 1) * p(x | C = 2) = 0.5 * 0.15 = 0.075

所以认为测试样本属于类型C1

Python实现

朴素贝叶斯分类器的训练过程为计算(1),(2)中的概率表，应用过程为计算(3),(4)并寻找最大值。

还是使用原来的接口进行类封装：

from numpy import *

class NaiveBayesClassifier(object):

	def __init__(self):

        self.dataMat = list()

        self.labelMat = list()

        self.pLabel1 = 0

        self.p0Vec = list()

        self.p1Vec = list()

    def loadDataSet(self,filename):

        fr = open(filename)

        for line in fr.readlines():

            lineArr = line.strip().split()

            dataLine = list()

            for i in lineArr:

                dataLine.append(float(i))

            label = dataLine.pop() # pop the last column referring to  label

            self.dataMat.append(dataLine)

            self.labelMat.append(int(label))

    def train(self):

        dataNum = len(self.dataMat)

        featureNum = len(self.dataMat[0])

        self.pLabel1 = sum(self.labelMat)/float(dataNum)

        p0Num = zeros(featureNum)

        p1Num = zeros(featureNum)

        p0Denom = 1.0

        p1Denom = 1.0

        for i in range(dataNum):

            if self.labelMat[i] == 1:

                p1Num += self.dataMat[i]

                p1Denom += sum(self.dataMat[i])

            else:

                p0Num += self.dataMat[i]

                p0Denom += sum(self.dataMat[i])

        self.p0Vec = p0Num/p0Denom

        self.p1Vec = p1Num/p1Denom

    def classify(self, data):

        p1 = reduce(lambda x, y: x * y, data * self.p1Vec) * self.pLabel1

        p0 = reduce(lambda x, y: x * y, data * self.p0Vec) * (1.0 - self.pLabel1)

        if p1 > p0:

            return 1

        else:

            return 0

    def test(self):

        self.loadDataSet('testNB.txt')

        self.train()

        print(self.classify([1, 2]))

if __name__ == '__main__':

    NB =  NaiveBayesClassifier()

    NB.test()

Matlab

Matlab的标准工具箱提供了对朴素贝叶斯分类器的支持：

trainData = [0 1; -1 0; 2 2; 3 3; -2 -1;-4.5 -4; 2 -1; -1 -3];

group = [1 1 -1 -1 1 1 -1 -1]';

model = fitcnb(trainData, group)

testData = [5 2;3 1;-4 -3];

predict(model, testData)

fitcnb用来训练模型，predict用来预测。

朴素贝叶斯分类器及Python实现的更多相关文章

（数据科学学习手札30）朴素贝叶斯分类器的原理详解&amp&semi;Python与R实现
一.简介要介绍朴素贝叶斯(naive bayes)分类器,就不得不先介绍贝叶斯决策论的相关理论: 贝叶斯决策论(bayesian decision theory)是概率框架下实施决策的基本方法.对分 ...
用scikit-learn实现朴素贝叶斯分类器转
原文:http://segmentfault.com/a/1190000002472791 朴素贝叶斯(Naive Bayes Classifier)是一种「天真」的算法(假定所有特征发生概率是独立的 ...
朴素贝叶斯分类器（Naive Bayes）
1. 贝叶斯定理如果有两个事件,事件A和事件B.已知事件A发生的概率为p(A),事件B发生的概率为P(B),事件A发生的前提下.事件B发生的概率为p(B|A),事件B发生的前提下.事件A发生的概率为 ...
朴素贝叶斯分类器基本代码 &amp&semi;&amp&semi; n折交叉优化
自己也是刚刚入门.. 没脸把自己的代码放上去,先用别人的. 加上自己的解析,挺全面的,希望有用. import re import pandas as pd import numpy as np fr ...
数据挖掘十大经典算法(9) 朴素贝叶斯分类器 Naive Bayes
贝叶斯分类器贝叶斯分类器的分类原理是通过某对象的先验概率,利用贝叶斯公式计算出其后验概率,即该对象属于某一类的概率,选择具有最大后验概率的类作为该对象所属的类.眼下研究较多的贝叶斯分类器主要有四种, ...
十大经典数据挖掘算法(9) 朴素贝叶斯分类器 Naive Bayes
贝叶斯分类器贝叶斯分类分类原则是一个对象的通过先验概率.贝叶斯后验概率公式后计算,也就是说,该对象属于一类的概率.选择具有最大后验概率的类作为对象的类属.现在更多的研究贝叶斯分类器,有四个,每间:N ...
机器学习---朴素贝叶斯分类器（Machine Learning Naive Bayes Classifier）
朴素贝叶斯分类器是一组简单快速的分类算法.网上已经有很多文章介绍,比如这篇写得比较好:https://blog.csdn.net/sinat_36246371/article/details/6014 ...
朴素贝叶斯分类器的应用 Naive Bayes classifier
一.病人分类的例子让我从一个例子开始讲起,你会看到贝叶斯分类器很好懂,一点都不难. 某个医院早上收了六个门诊病人,如下表. 症状职业疾病打喷嚏护士感冒打喷嚏农夫过敏头痛建筑工 ...
PGM学习之三朴素贝叶斯分类器（Naive Bayes Classifier）
介绍朴素贝叶斯分类器的文章已经很多了.本文的目的是通过基本概念和微小实例的复述,巩固对于朴素贝叶斯分类器的理解. 一朴素贝叶斯分类器基础回顾朴素贝叶斯分类器基于贝叶斯定义,特别适用于输入数据维数较 ...

随机推荐

Android深度探索--HAL与驱动开发----第一章读书笔记
1. Android的系统架构有四层,它的发展目前来说是比较成熟的,流行于目前的市场.其架构包括四层(linux内核.C/C++代码库.Android SDK API.应用程序). 2. 驱动是直接 ...
Linux nginx 配置 location 语法正则表达式
location语法:location [=|~|~*|^~] /uri/ { - }默认:否上下文:server这个指令随URL不同而接受不同的结构.你可以配置使用常规字符串和正则表达式.如果使用正 ...
Sql Server 相关错误问题及解决方法
1.首当其冲是登陆问题, SQL Server 2008选择Windows身份验证无法登录 (Microsoft Sql Server,错误:18456) 就是在连接SQL Server 2008时, ...
CodeForces Round 200 Div2
这次比赛出的题真是前所未有的水!只用了一小时零十分钟就过了前4道题,不过E题还是没有在比赛时做出来,今天上午我又把E题做了一遍,发现其实也很水.昨天晚上人品爆发,居然排到Rank 55,运气好的话没准 ...
用彩虹表破解MD5、LM Hash等复杂加密密码
http://zhaoxiaobu.blog.51cto.com/878176/461016/
Linux下自动备份MySQL数据库并上传到远程FTP服务器
Linux下自动备份MySQL数据库并上传到远程FTP服务器且删除指定日期前的备份Shell脚本说明: 1.备份MySQL数据库存放目录/var/lib/mysql下面的xshelldata数据库 ...
mybatis 一对多和多对一关联查询
首先数据库量表之间字段关系(没有主外键) studentmajor表的id字段对应student表里major字段两个实体类 package com.model; import java.uti ...
matlab程序设计
一.M文件 1.脚本文件 (1)英文字母开头命名 (2)所产生的所有变量驻留在base workspace,只要不用clear,就只有关闭MATLAB,才会被删除 2.函数文件 (1)function ...
CTR预估中GBDT与LR融合方案
1. 背景 CTR预估(Click-Through Rate Prediction)是互联网计算广告中的关键环节,预估准确性直接影响公司广告收入.CTR预估中用的最多的模型是LR(Logistic R ...
oracle插入数据问题
这个是我的表结构:desc T_STUDENT;Name Type Nullable Default Comments ------------ ----------- ...