边际似然是贝叶斯推断中的一个量,用于衡量在统计模型下,对不确定参数取平均后观测数据的概率或概率密度。它也称为模型证据,将模型的似然函数与先验分布结合起来。它既用于归一化参数的后验分布,也是通过贝叶斯因子比较模型的基础。与最大化后的似然不同,边际似然考察模型在整个参数空间中的预测,而不只是考察拟合最优的参数值所对应的预测。(pmc.ncbi.nlm.nih.gov)
定义与解释
设 表示观测数据, 表示模型, 表示模型参数。对于连续参数,边际似然为
通过积分,可以从数据与参数的联合概率分布中消去 ,这一过程称为边际化。对于离散参数,积分变为求和;对于混合参数空间,则需要同时使用这两种运算。等价地,边际似然是似然在先验分布下的期望值:
将其视为可能数据集的函数时,它就是模型的先验预测分布。对于连续观测,它是概率密度函数的值,而不是观测到某个确切数据向量的概率,因此可以大于一。(arxiv.org)
前提是分母有限且为正。因此,模型证据就是将似然与先验的乘积转化为概率分布所需的归一化常数。(gaussianprocess.org)
模型比较与复杂度
对于模型 和 ,其贝叶斯因子为
模型的后验优势比等于这一比值乘以模型的先验优势比。因此,模型证据本身并不是模型的后验概率。存在多个候选模型时,
这些概率也可以作为贝叶斯模型平均的权重,从而在估计和预测中纳入模型结构的不确定性。参与比较的模型不必具有嵌套关系。(stat.cmu.edu)
边际似然体现了拟合程度与预测范围之间的权衡。灵活的模型可能拟合许多可能的数据集,但其先验预测概率必须分配到这些数据集上。因此,如果高似然仅集中在先验概率很小的区域,它对模型证据的贡献可能低于在较大先验概率区域内普遍达到中等偏高水平的似然。这通常被称为贝叶斯奥卡姆因子。它并非简单地施加与参数数量成正比的惩罚,也不保证最简单的模型一定胜出。与最大似然估计不同,边际似然是对参数取平均,而不是求最大值。(gaussianprocess.org)
共轭模型示例
考虑 个服从伯努利分布的观测,其中有 次成功;给定成功概率 后,各观测条件独立。选取形状参数 均为正的贝塔分布作为共轭先验。对于某个特定的有序序列,
直接积分可得
其中 为贝塔函数。如果记录的观测是成功次数 ,而不是具体序列,那么二项分布的抽样似然还包含产生该成功次数的序列数量:
这一区别说明,模型证据取决于观测数据的具体定义。公共因子可能在贝叶斯因子中相互抵消,但仍然是各个边际似然的组成部分。(pmc.ncbi.nlm.nih.gov)
计算与近似
某些共轭模型的模型证据具有闭式表达式,但高维积分通常很难计算。在维数足够低时,数值求积是可行的。拉普拉斯近似利用众数附近的曲率,以高斯分布近似局部集中的后验分布。对于高度偏斜或多峰的分布,其精度可能下降。(arxiv.org)
模拟方法包括重要性采样、桥采样和嵌套采样。桥采样将后验样本与辅助分布的样本结合起来,以估计归一化常数。普通的马尔可夫链蒙特卡洛可以在不计算模型证据的情况下生成后验样本,因此成功的后验采样并不会自动给出模型证据的估计。简单的调和平均估计量可能极不稳定。(pmc.ncbi.nlm.nih.gov)
嵌套采样利用似然阈值所界定区域内的先验概率质量,重新表述模型证据的计算问题。它在估计模型证据的同时,也提供后验分布的信息;如何从受似然约束的先验分布中准确采样,是其核心计算难题。(arxiv.org)
由于KL散度非负,证据下界不会超过对数模型证据。比较下界不一定等价于比较精确的模型证据,因为不同模型的近似误差可能不同。(cs.columbia.edu)
先验依赖性与机器学习
模型证据依赖于归一化的参数先验分布。扩大先验分布的范围,可能会把更多概率分配给拟合较差的参数值,从而降低模型证据。使用非正常先验时,即使后验分布是正常的,模型证据通常仍带有任意的乘法常数,因而无法唯一确定。因此,除非采用能够消除这种歧义的特殊构造,常规的基于模型证据的模型比较都需要谨慎指定正常先验。(stat.cmu.edu)
在机器学习中,可以对低层参数或潜变量进行积分消去,同时针对超参数优化模型证据。这通常称为经验贝叶斯或第二类最大似然。在具有高斯观测噪声的高斯过程回归中,边际似然具有解析表达式,可用于估计协方差和噪声的超参数。对这些超参数进行优化,与在完全贝叶斯分析中对其不确定性进行积分,是不同的做法。(gaussianprocess.org)