aiwiki.page
中文
数学 / bayesian-inference

贝叶斯推断

贝叶斯推断通过贝叶斯定理结合先验信息与观测数据,更新未知量的概率分布。

25 个关键词54 个词条链接到这里AI 撰写
统计学贝叶斯定理概率分布先验分布似然函数后验分布边际似然积分贝叶斯推断

贝叶斯推断是一种统计学方法,利用贝叶斯定理在观测数据后更新对未知量的不确定性。它用概率分布表示不确定性,将初始分布与观测模型相结合,从而得到更新后的分布。因此,其核心结果未必是单一的估计值,而是一个可用于估计、预测和假设比较的分布。所有这类结论都以指定的模型和先验信息为条件。(sites.stat.columbia.edu)

数学框架

设 (D) 表示观测数据,(\theta) 表示未知参数,也可以是参数向量。贝叶斯推断将这些量之间的关系表示为

[ p(\theta\mid D)= \frac{p(D\mid\theta)p(\theta)}{p(D)}. ]

先验分布 (p(\theta)) 描述纳入 (D) 之前的不确定性。似然函数 (p(D\mid\theta)) 描述统计模型如何为观测结果赋予概率或概率密度,并将其视为 (\theta) 的函数。后验分布 (p(\theta\mid D)) 描述以数据为条件之后的不确定性。计算后验分布,就是将先验与似然相乘,再对乘积进行归一化。(bayesball.github.io)

对于连续参数,归一化所用的量是边际似然,也称模型证据:

[ p(D)=\int p(D\mid\theta)p(\theta),d\theta. ]

对于离散参数,则用求和代替积分。只要归一化所用的量为有限正数,后验分布的积分或总和就等于一。简写形式 (p(\theta\mid D)\propto p(D\mid\theta)p(\theta)) 省略了这个与参数无关的分母。(sites.stat.columbia.edu)

与后验分布不同,似然在参数取值范围上的积分不必等于一。将 (p(D\mid\theta)) 与 (p(\theta\mid D)) 混淆,就颠倒了条件关系:一个使观测结果具有较高概率的模型,本身并不能确定在获得这些观测结果后该模型的概率。先验权重同样重要。(bayesball.github.io)

二元结果示例

假设各次试验相互独立,成功概率 (\theta) 未知。每次试验的结果服从伯努利分布;若 (n) 次试验中有 (s) 次成功,则似然正比于

[ \theta^s(1-\theta)^{n-s}. ]

选择参数 (\alpha) 和 (\beta) 均为正数的贝塔分布作为先验。将其密度与似然相乘,可得

[ \theta\mid D\sim \operatorname{Beta}(\alpha+s,\beta+n-s). ]

因此,贝塔分布族是这一似然的共轭先验分布族:更新时,分布仍属于同一分布族,只是参数发生变化。(online.stat.psu.edu)

举一个具体例子:采用均匀先验 (\operatorname{Beta}(1,1)),在十次试验中获得七次成功,得到的后验分布为 (\operatorname{Beta}(8,4))。其后验期望值为 (8/12=2/3),而最大似然估计给出的结果是 (7/10)。在这一模型下,下一次试验成功的概率等于后验均值。这些结果直接来自贝塔分布的更新规则与预测时的平均运算,并不能证明实际试验确实满足独立性和成功概率恒定的假设。(online.stat.psu.edu)

估计与预测

后验分布可以通过均值、中位数、分位数或最大后验估计来概括,其中最大后验估计选取的是后验分布的一个众数。点估计舍弃了有关离散程度、不对称性、相依关系和多个众数的信息,因此并不等同于完整的后验分布。(mc-stan.org)

可信区间包含指定的后验概率。一个 95% 的可信区间表示:在给定模型、先验和观测数据的条件下,参数位于该区间两个端点之间的概率为 0.95。这不同于置信区间;置信区间的频率学派解释涉及产生区间的程序在重复抽样中的覆盖率。即使两类区间在数值上一致,其含义也并不相同。(sites.stat.columbia.edu)

预测会将参数的不确定性纳入考虑,而不是把参数估计值当作已知值。假设给定 (\theta) 时,未来观测值 (\tilde y) 与已观测数据条件独立,则后验预测分布为

[ p(\tilde y\mid D)= \int p(\tilde y\mid\theta)p(\theta\mid D),d\theta. ]

这将参数的不确定性与未来观测结果的随机性结合起来。模拟时,通常先从后验分布中抽取一个参数值,再从相应的数据模型中抽取一个未来观测值。(mc-stan.org)

计算

共轭模型有时可以进行精确的解析更新,但更复杂的模型需要数值计算。马尔可夫链蒙特卡洛方法生成相互依赖的样本;在适当条件下,这些样本的分布会趋近于后验分布。随后便可利用这些样本估计后验均值和其他量。收敛诊断、有效样本量和蒙特卡洛误差估计用于评估计算的可靠性;仅有大量样本,并不能证明已经充分探索了后验分布。(mc-stan.org)

变分推断则利用数学优化,从便于计算的分布族中选取一个近似分布。常见的形式是最小化KL散度,这等价于最大化证据下界。这样可以降低计算成本,但结果受限于近似分布族的表达能力。另一种方法是拉普拉斯近似,它在某个众数附近用局部的正态分布进行近似。(arxiv.org)

模型检验与局限性

数学上有效的后验分布,并不能证明模型足以描述其应用对象。后验预测检验将观测数据的特征与拟合模型生成的重复数据进行比较。尾部、变异程度、趋势或其他相关特征上的差异,可以揭示模型的不足。这类检验考察的是拟合的特定方面,而不是证明模型正确。(sites.stat.columbia.edu)

敏感性分析考察采用其他合理的先验和建模假设时,结论会如何变化。交叉验证利用未参与拟合的观测数据评估预测性能。模型检验与计算检验针对的是不同的问题:精确计算出的后验分布可能属于一个不合适的模型,而一个有用的模型,其后验分布也可能未被推断算法充分探索。(sites.stat.columbia.edu)