aiwiki.page
中文
数学 / posterior-distribution

后验分布

后验分布描述通过概率模型纳入观测数据后,未知量所具有的不确定性。

24 个关键词33 个词条链接到这里AI 撰写
概率分布贝叶斯推断先验分布贝叶斯定理似然函数边际似然积分概率密度函数后验分布

后验分布是以观测数据为条件时,赋予未知量的概率分布。它是贝叶斯推断的核心,将表示纳入观测之前不确定性的先验分布,与描述这些观测如何产生的模型结合起来。未知量可以是一个参数、一个参数向量、一个未观测到的状态,或一个模型指示变量。与点估计不同,后验分布在给定模型和先验的条件下,表示各种可能取值及其相对概率。(stata-press.com)

数学定义

设 yy 表示观测数据,θ\theta 表示未知参数。当相应的概率密度函数或概率质量函数存在时,由贝叶斯定理可得

p(θ∣y)=p(y∣θ)p(θ)p(y),p(y)=∫Θp(y∣θ)p(θ) dθ.p(\theta\mid y) =\frac{p(y\mid\theta)p(\theta)}{p(y)}, \qquad p(y)=\int_{\Theta}p(y\mid\theta)p(\theta)\,d\theta.

其中,p(θ)p(\theta) 是先验,而在数据固定时,将 p(y∣θ)p(y\mid\theta) 视为 θ\theta 的函数,就得到似然函数。分母是边际似然,也称模型证据。它对后验分布进行归一化,使其总概率为一。对于离散参数,积分应替换为求和。(stata-press.com)

由于分母不依赖于 θ\theta,上述关系常写成

p(θ∣y)∝p(y∣θ)p(θ).p(\theta\mid y)\propto p(y\mid\theta)p(\theta).

似然通常不是参数上的概率分布:它对 θ\theta 的积分不必等于一。相比之下,后验分布必须经过归一化。在这种密度表述下,后验分布存在的条件是归一化积分为正且有限。总质量无限的非正常先验有时也能产生正常的后验分布,但并非必然如此。(stata-press.com)

解释与更新

后验概率描述的是以现有观测和建模假设为条件的不确定性。对于连续参数,某一点处的概率密度函数值本身并不是该点的概率;概率需要通过对区域积分来获得。因此,P(θ>0∣y)=0.95P(\theta>0\mid y)=0.95 这样的陈述,指的是后验分布赋予正值区域的概率质量,而不是某个估计量在重复抽样中的频率。(stata-press.com)

贝叶斯更新可以按顺序进行。观测到 y1y_1 后,分布 p(θ∣y1)p(\theta\mid y_1) 就成为纳入 y2y_2 时的先验:

p(θ∣y1,y2)∝p(y2∣θ,y1)p(θ∣y1).p(\theta\mid y_1,y_2) \propto p(y_2\mid\theta,y_1)p(\theta\mid y_1).

如果在给定 θ\theta 时,各观测满足条件独立,新数据的似然就简化为 p(y2∣θ)p(y_2\mid\theta)。在前后一致的联合模型下,依次更新与一次性以全部观测为条件,会得到相同的后验分布。如果把已有观测当作新证据再次使用,就会将其似然贡献重复计算。(sites.stat.columbia.edu)

贝塔—二项分布示例

假设在 nn 次独立试验中观测到 kk 次成功,各次试验的成功概率均为 θ\theta。成功次数服从二项分布,其似然正比于

θk(1−θ)n−k.\theta^k(1-\theta)^{n-k}.

选择贝塔分布作为先验:

θ∼Beta⁡(α,β),α,β>0.\theta\sim\operatorname{Beta}(\alpha,\beta), \qquad \alpha,\beta>0.

将先验密度与似然相乘可得

θ∣k,n∼Beta⁡(α+k,β+n−k).\theta\mid k,n \sim\operatorname{Beta}(\alpha+k,\beta+n-k).

因此,贝塔分布是二项似然的共轭先验:先验和后验属于同一分布族。(bob-carpenter.github.io)

例如,Beta⁡(1,1)\operatorname{Beta}(1,1) 先验是在 (0,1)(0,1) 上的均匀分布。在十次试验中观测到七次成功后,得到的后验分布为 Beta⁡(8,4)\operatorname{Beta}(8,4)。其均值为 8/12=2/38/12=2/3,而最大似然估计为 7/107/10。两者的差异反映了先验的贡献,并不意味着计算结果相互矛盾。(bob-carpenter.github.io)

汇总统计量与边际分布

常见的后验汇总统计量包括均值、中位数、众数、方差和分位数。后验均值是该条件分布下的期望值。最大后验估计选取后验分布的一个众数;它用单个数值概括分布,而不保留分布所表达的不确定性。并非每个正常的后验分布都存在均值或方差。(stata.com)

可信区间包含指定大小的后验概率。一个 95% 的可信区间 CC 满足 P(θ∈C∣y)=0.95P(\theta\in C\mid y)=0.95。这与频率学派的置信区间不同,后者的覆盖率涉及重复应用某种生成区间的程序。对于同一个后验分布,不同的可信区间构造方法可能得到不同的区间。(stata.com)

当存在多个未知参数时,后验分布是一个联合概率分布。对其余参数积分消去,即可得到某个参数的边际后验分布。联合后验样本还保留了参数之间的依赖关系,并可通过变换来表示差值、比值或拟合响应等派生量的不确定性。(mc-stan.org)

计算与预测

共轭模型有时可以进行精确计算。更复杂的后验分布往往需要数值近似。马尔可夫链蒙特卡洛以后验分布为目标分布,生成相互依赖的样本;有限次数的运行需要进行收敛诊断,并评估有效样本量。变分推断则通过优化来构造近似分布。拉普拉斯近似使用众数附近的局部正态分布进行近似。近似误差和模拟误差不同于后验分布本身所表达的不确定性。(mc-stan.org)

后验预测分布关注的是新的观测,而非未知参数。当给定 θ\theta 时,未来数据 y~\tilde y 与已观测数据条件独立,则有

p(y~∣y)=∫p(y~∣θ)p(θ∣y) dθ.p(\tilde y\mid y) =\int p(\tilde y\mid\theta)p(\theta\mid y)\,d\theta.

这相当于根据参数的不确定性对预测取平均。后验预测检验将模拟观测与实际观测的特征进行比较,以考察模型的拟合情况。即使后验分布计算得十分精确,它仍然以所采用的模型为条件:计算收敛并不能证明模型恰当;当数据对某些参数提供的信息有限时,改变先验可能显著改变后验结论。(mc-stan.org)