最大后验估计通常简称为 MAP 估计,是一种贝叶斯推断方法,以使后验分布达到最大值的参数值作为未知参数的估计。它将观测提供的证据与可能参数值上的先验分布相结合。与保留整个后验分布的方法不同,MAP 给出的是点估计。它与最大似然估计密切相关,但在优化目标中纳入了先验。(cs.cmu.edu)
数学定义
设 表示观测数据, 是属于参数空间 的参数。根据贝叶斯定理,
这里,将 视为 的函数时,它就是似然函数;而 是边际似然。只要后验分布有明确定义,MAP 估计就满足
使用集合归属符号,是为了允许存在多个同样达到最大值的参数值。由于分母与 无关,最大化时可以将其省略。在相关密度均为正的地方,取对数可得到等价的目标函数:
对于离散参数,MAP 最大化的是后验概率质量。对于连续参数,它最大化的是概率密度函数,而不是参数恰好取某个值的概率:单个点的概率通常为零。因此,该估计确定的是密度的峰值位置,而不是包含大部分后验概率的区域。(mc-stan.org)
与最大似然及正则化的关系
最大似然估计仅依据 选择参数,MAP 则依据乘积 选择参数。如果先验在相关参数空间内处处为常数,使目标达到最大值的参数值就不会改变。不过,无界空间上的常数密度通常不是正规的概率分布,因此讨论两者的等价性时,必须仔细考虑先验的支撑集及归一化问题。(cs229.stanford.edu)
将负对数后验最小化,可以清楚地看出 MAP 与正则化的联系:
第一项衡量模型与观测的不一致程度;第二项则充当参数惩罚项。各分量相互独立、均值为零的正态分布先验会产生平方 惩罚项。相互独立、以零为中心的拉普拉斯分布先验会产生 惩罚项。因此,在特定概率假设下,机器学习中常见的正则化目标可以解释为 MAP 估计。(cs229.stanford.edu)
例如,在线性回归中,若噪声相互独立且服从正态分布,已知其方差为 ,并为回归系数设置协方差为 的正态先验,则有
这就是岭回归,其惩罚强度由噪声方差与先验方差的比值决定。如果数据拟合项采用平均值而不是总和,惩罚系数的数值还会取决于样本量。若改为对系数设置拉普拉斯先验,则会得到套索回归。(www2.stat.duke.edu)
示例:估计伯努利成功概率
假设 个相互独立的观测服从成功概率为 的伯努利分布,其中观察到 次成功。为 指定一个贝塔分布先验:
这是一个共轭先验:后验仍属于同一分布族,
当后验的两个形状参数都大于 1 时,其唯一的内部众数为
这一公式可通过对数后验求导得到;若不满足上述条件,则需要考虑边界处的行为或众数不唯一的情况。(cs.cmu.edu)
若先验为 ,且十次试验中有八次成功,则该公式给出 ,而最大似然估计为 。后验均值则为
得到 ,约为 。这些数值说明,后验分布的众数与期望值不一定相同。(cs.cmu.edu)
计算与解释
MAP 估计是一个数学优化问题。简单的共轭模型可能有解析解;较复杂的模型则需要数值方法。对于光滑的目标函数,可以使用牛顿法,或 BFGS、L-BFGS 等拟牛顿算法进行优化。数值算法终止本身并不能证明已经找到全局最大值,尤其是在后验分布具有多个峰的情况下。(mc-stan.org)
在决策理论中,何种点估计最优取决于损失函数。对于离散参数,在零—一损失下,选择后验众数可以使后验期望损失最小。在平方误差损失下,使损失最小的估计是后验均值,通常并非 MAP。对于连续参数,严格的零—一损失无法区分各个候选值;要通过不断缩小的邻域来解释 MAP,还需要额外的正则性条件。(hsong1.github.io)
局限性
连续参数的 MAP 估计依赖于参数化方式。对于可逆且可微的变换 ,变换后的后验密度包含一个涉及雅可比矩阵的因子:
因此,即使底层的后验概率测度没有改变,对 MAP 估计进行变换,也不一定能得到新坐标下的 MAP 估计。(mc-stan.org)
单个众数还会遗漏后验分布的离散程度、不对称性、依赖关系以及其他众数。将 MAP 参数代入预测模型,通常不同于计算后验预测分布;后者会对参数的不确定性进行积分,得到平均预测。因此,MAP 提供的是一种特定的点概括,而不是对贝叶斯不确定性的完整描述。(cs229.stanford.edu)