更新于 2026年8月10日

贝叶斯定理#


术语解释#

贝叶斯定理(Bayes’ Theorem) 是概率论中的一个基本定理,它描述了在已知一些条件下,某事件发生的概率如何随新证据的出现而更新。在机器学习中,它常被用于构造分类器,即通过先验概率和条件概率来推断样本属于某个类别的后验概率。

贝叶斯定理通过已知事件 $B$ 发生的先验概率,以及在 $B$ 发生的条件下事件 $A$ 发生的概率(条件概率),来计算在事件 $A$ 发生的条件下 $B$ 发生的概率(后验概率)。

这里的两个核心

贝叶斯定理数学表达式为

$$ P(B|A)=\frac{P(AB)}{P(A)}\tag{1} $$

在分类任务中,$B$ 通常表示类别标签,$A$ 表示特征属性。

由此可知,贝叶斯定理提供了一种根据历史经验(先验知识)和当前观察到的证据来推断未知事实的方法。


示例说明#

假如现在办公室失窃了,理论上每个人都可能是小偷。但是,我们可以根据对每个人的了解以及历史情况(比如去年也发生过几起失窃事件)先得出一个可能性。例如张三偷窃的可能性为 $20\%$,李四偷窃的可能性为 $30\%$,王五偷窃的可能性为 $50\%$,而这就被称为先验概率,它是通过历史经验得来的。

但是,我们不能因为王五偷窃的可能性最大就判定每次办公室失窃都是由他所为,那此时应该怎么计算呢?

设张三、李四、王五实施盗窃这三种情况分别为事件 $A$、$B$、$C$, 三人偷窃的先验概率分别为 $P(A)$、$P(B)$ 和 $P(C)$;办公室失窃定义为事件 $O$,办公室失窃的概率为 $P(O)$。

此时,三人为小偷的后验概率则为

$$ \begin{aligned} P(A|O)&=\frac{P(AO)}{P(O)}=\frac{P(A)P(O|A)}{P(O)}\\[3ex] P(B|O)&=\frac{P(BO)}{P(O)}=\frac{P(B)P(O|B)}{P(O)}\\[3ex] P(C|O)&=\frac{P(CO)}{P(O)}=\frac{P(C)P(O|C)}{P(O)} \end{aligned}\tag{2} $$

其中 $P(A|O)$ 表示办公室失窃了,那么张三去偷的概率是多大; $P(A)P(O|A)$ 表示(张三偷窃的概率)乘以(在张三去偷的情况下成功的概率)。

由此可以看出,尽管先验概率告诉我们王五偷窃的概率最高,但是王五去偷的情况下成功的概率不一定高,例如昨天他刚摔断了腿,那么 $P(O|A)$ 几乎为0。

因此,最终到底是谁偷窃的,根据贝叶斯定理,我们可以选择后验概率中的最大者。

反过来说,办公室还没失窃,但是我们根据日常收集的数据,也可以计算得到办公室失窃的概率。想象一下,如果你家周围住的都是小偷,那么你家失窃的概率是不是很大?

此时,根据贝叶斯定理有

$$ P(O) = P(A)P(O|A) + P(B)P(O|B) + P(C)P(O|C)\tag{3} $$

它表示失窃可能由张三造成,也可能由李四或王五造成,因此偷窃的总概率,等于所有可能情况发生概率之和。


相关术语#

  • 朴素贝叶斯
阅读 --

6.1 词袋模型

在本节中,我们首先介绍了第1种将文本转化为向量的词袋模型,接着介绍了一款常用的中文分词工具jieba库,并演示了如何通过jieba进行分词处理并进行词频统计;然后介绍了如何实现词袋模型的最后一步——向量化表示;

7.2 时序数据

时序数据建模入门,讲清什么是时序数据、RNN 适合处理哪些序列任务,以及典型应用场景。

10.8 BERT文本分类模型

经过前面两节内容的介绍,我们对于BERT模型的原理及其实现过程已经有了比较清晰的理解。同时,由于BERT是一个强大的预训练模型,因此我们可以直接基于谷歌发布的预训练参数将模型迁移到各个下游任务中进行微调学习。在这节内容中,我们将开始介绍第1 …

3.4 Qwen3 Embedding 模型介绍

本节围绕Qwen3 Embedding 模型介绍展开,重点介绍DashScopeEmbeddings 使用示例、Qwen3 Embedding 原理和Dashscope 使用示例等内容。