贝叶斯定理是概率论中的一个恒等式,它用反向条件概率以及两个事件各自的概率,来表示在一个事件发生的条件下另一个事件发生的概率。它为贝叶斯推断提供了数学基础:在贝叶斯推断中,赋予假设或未知量的概率会根据观测到的证据进行更新。尽管贝叶斯定理与贝叶斯统计学密切相关,但定理本身可由通常的概率规则推出,并不依赖于对概率的某种特定解释。(online.stat.psu.edu)
数学表述与推导
对于事件 和 ,若 ,则贝叶斯定理表述为
这里, 是已知 发生时 发生的条件概率。在基于事件的初等表述中,右侧表达式还要求 ,以保证 有定义。该定理将条件关系的方向反转,并不是说 与 相等。(ma.imperial.ac.uk)
其数学证明只需将交集的概率写成两种形式:
两边除以 ,即可得到上述公式。因此,该定理描述的是同一个联合概率的两种相容的分解方式,而不是对事件之间的关系引入额外假设。(ma.imperial.ac.uk)
若 构成样本空间的一个划分,即它们两两互斥且合起来涵盖整个样本空间,则可用全概率公式计算分母:
这一形式明确表明,计算证据的概率时,必须考虑划分中的所有可能情况,而不能只考虑正在检验的假设。(online.stat.psu.edu)
先验、似然与后验
当 表示假设、 表示证据时,通常从三个组成部分来理解该公式。先验概率 描述纳入 之前的不确定性。似然 描述在 成立的条件下,证据出现的可能性。后验概率 描述以证据为条件之后的不确定性。分母起归一化作用。似然本身并不是赋予假设的概率。(plato.stanford.edu)
对于未知的连续参数 ,相应的密度公式为
先验分布 和似然函数 共同确定后验分布。分母是数据的边际似然。这些表达式在适用时使用概率密度函数:对于连续随机变量,某一点的密度值并不是取值恰好为该点的概率。参数落在某一区间内的概率,需要通过积分求得,而不是通过计算某一点的密度值求得。(pmc.ncbi.nlm.nih.gov)
计算示例
考虑一个假设的生产系统,其中工厂 A 供应全部产品的 30%,工厂 B 供应 70%。假设两家工厂的次品率分别为 4% 和 1%。这些数值是预先设定的,并非对实际工厂的观测结果。
随机抽取一件产品,已知它是次品,则它来自 A 的概率为
在一个假设的、恰好符合上述比例的 10,000 件产品批次中,A 会提供 120 件次品,B 会提供 70 件次品。因此,190 件次品中有 120 件来自 A。这个计算展示了贝叶斯定理在制造业示例中所使用的反向条件推断结构。(online.stat.psu.edu)
因此,A 的次品率为 4%,与一件次品来自 A 的概率约为 63.2%,是两个不同的概念。计算后者时,两家工厂的供货占比和次品率都必须纳入考虑。
几率与序贯更新
对于假设 及其补事件 ,该定理可表示为
用文字来说,后验几率等于先验几率乘以似然比。在模型比较中,相应的边际似然之比称为贝叶斯因子。如果某项证据在第一种备选假设下比在另一种假设下更可能出现,那么这项证据就相对更支持第一种假设。(plato.stanford.edu)
更新可以依次进行:根据先前观测得到的后验,成为后续观测的先验。下一步的似然必须以已经纳入的信息为条件。如果不以这些信息为条件,而直接将各个似然相乘,就需要适当的条件独立假设;序贯更新本身并不能确立独立性。(pmc.ncbi.nlm.nih.gov)
统计与计算应用
在机器学习中,朴素贝叶斯分类器利用该定理,根据类别的先验概率和特征的似然来推导类别概率。其标志性的简化假设是:给定类别后,各特征相互条件独立。这一假设属于分类器的模型,而不属于贝叶斯定理。由此得到的分类器可以选择后验概率最大的类别。(scikit-learn.org)
贝叶斯分析可以保留完整的后验分布,而不只是给出一个点估计。最大后验估计选取后验分布的一个众数。当直接计算较为困难时,马尔可夫链蒙特卡洛方法生成以后验分布为目标分布的相依样本,而变分推断则构造近似分布。数值精度和收敛性问题,与定理本身是否成立是不同的问题。(mc-stan.org)
历史起源
该定理以托马斯·贝叶斯的名字命名。他去世后发表的论文《试论求解机遇学说中的一个问题》,由理查德·普赖斯提交,刊登于英国皇家学会《哲学汇刊》第 53 卷,该卷标注的年份为 1763 年。这篇论文研究了逆概率问题:如何利用观测到的成功与失败,来认识未知成功概率的不确定性。论文处理的是一个特定的统计问题,而不是这一一般恒等式在现代的全部应用。(sites.socsci.uci.edu)