后验分布是以观测数据为条件时,赋予未知量的概率分布。它是贝叶斯推断的核心,将表示纳入观测之前不确定性的先验分布,与描述这些观测如何产生的模型结合起来。未知量可以是一个参数、一个参数向量、一个未观测到的状态,或一个模型指示变量。与点估计不同,后验分布在给定模型和先验的条件下,表示各种可能取值及其相对概率。(stata-press.com)
数学定义
设 表示观测数据, 表示未知参数。当相应的概率密度函数或概率质量函数存在时,由贝叶斯定理可得
其中, 是先验,而在数据固定时,将 视为 的函数,就得到似然函数。分母是边际似然,也称模型证据。它对后验分布进行归一化,使其总概率为一。对于离散参数,积分应替换为求和。(stata-press.com)
由于分母不依赖于 ,上述关系常写成
似然通常不是参数上的概率分布:它对 的积分不必等于一。相比之下,后验分布必须经过归一化。在这种密度表述下,后验分布存在的条件是归一化积分为正且有限。总质量无限的非正常先验有时也能产生正常的后验分布,但并非必然如此。(stata-press.com)
解释与更新
后验概率描述的是以现有观测和建模假设为条件的不确定性。对于连续参数,某一点处的概率密度函数值本身并不是该点的概率;概率需要通过对区域积分来获得。因此, 这样的陈述,指的是后验分布赋予正值区域的概率质量,而不是某个估计量在重复抽样中的频率。(stata-press.com)
贝叶斯更新可以按顺序进行。观测到 后,分布 就成为纳入 时的先验:
如果在给定 时,各观测满足条件独立,新数据的似然就简化为 。在前后一致的联合模型下,依次更新与一次性以全部观测为条件,会得到相同的后验分布。如果把已有观测当作新证据再次使用,就会将其似然贡献重复计算。(sites.stat.columbia.edu)
贝塔—二项分布示例
假设在 次独立试验中观测到 次成功,各次试验的成功概率均为 。成功次数服从二项分布,其似然正比于
选择贝塔分布作为先验:
将先验密度与似然相乘可得
因此,贝塔分布是二项似然的共轭先验:先验和后验属于同一分布族。(bob-carpenter.github.io)
例如, 先验是在 上的均匀分布。在十次试验中观测到七次成功后,得到的后验分布为 。其均值为 ,而最大似然估计为 。两者的差异反映了先验的贡献,并不意味着计算结果相互矛盾。(bob-carpenter.github.io)
汇总统计量与边际分布
常见的后验汇总统计量包括均值、中位数、众数、方差和分位数。后验均值是该条件分布下的期望值。最大后验估计选取后验分布的一个众数;它用单个数值概括分布,而不保留分布所表达的不确定性。并非每个正常的后验分布都存在均值或方差。(stata.com)
可信区间包含指定大小的后验概率。一个 95% 的可信区间 满足 。这与频率学派的置信区间不同,后者的覆盖率涉及重复应用某种生成区间的程序。对于同一个后验分布,不同的可信区间构造方法可能得到不同的区间。(stata.com)
当存在多个未知参数时,后验分布是一个联合概率分布。对其余参数积分消去,即可得到某个参数的边际后验分布。联合后验样本还保留了参数之间的依赖关系,并可通过变换来表示差值、比值或拟合响应等派生量的不确定性。(mc-stan.org)
计算与预测
共轭模型有时可以进行精确计算。更复杂的后验分布往往需要数值近似。马尔可夫链蒙特卡洛以后验分布为目标分布,生成相互依赖的样本;有限次数的运行需要进行收敛诊断,并评估有效样本量。变分推断则通过优化来构造近似分布。拉普拉斯近似使用众数附近的局部正态分布进行近似。近似误差和模拟误差不同于后验分布本身所表达的不确定性。(mc-stan.org)
后验预测分布关注的是新的观测,而非未知参数。当给定 时,未来数据 与已观测数据条件独立,则有
这相当于根据参数的不确定性对预测取平均。后验预测检验将模拟观测与实际观测的特征进行比较,以考察模型的拟合情况。即使后验分布计算得十分精确,它仍然以所采用的模型为条件:计算收敛并不能证明模型恰当;当数据对某些参数提供的信息有限时,改变先验可能显著改变后验结论。(mc-stan.org)