变分推断(VI)是一类利用数学优化来近似难以计算的概率分布的方法。在贝叶斯推断中,它从指定的分布族中选取一个易于计算的分布,替代难以处理的后验分布。变分推断并非仅靠采样来求得后验分布,而是调整近似分布,使其与目标分布的一致程度达到最优。它广泛用于统计学和机器学习,尤其适用于精确推断在计算上不可行的情况。(cs.columbia.edu)
数学表述
设 表示观测数据, 表示未知参数或潜变量。根据贝叶斯定理,
分母是边际似然,也称模型证据。在高维空间中计算这一积分,或对离散变量进行求和,往往会使精确计算后验分布变得不可行。变分方法将这一计算替换为在较简单的分布上求解优化问题。它的发展与概率图模型中的近似推断密切相关。(people.eecs.berkeley.edu)
在标准表述中,先选定一个分布族 ,再将近似分布定义为
其中 表示KL散度。散度的方向很重要:交换这两个分布的位置,通常会得到不同的近似结果。将近似分布限制在 中,决定了该方法能够表达后验分布的哪些特征。(cs.columbia.edu)
证据下界
由于后验分布包含未知的模型证据,实际实现通常通过最大化证据下界(ELBO)来求解:
这里, 表示在分布 下的期望值。恒等式
表明,对于固定的模型,最大化 ELBO 等价于最小化上述散度。它也说明,ELBO 不可能超过对数证据。(proceedings.mlr.press)
当 时,下界可写为
第一项衡量对观测数据的期望拟合程度;第二项惩罚近似分布对先验分布的偏离。在潜变量学习中,这一分解支持同时优化生成模型参数和变分参数。负 ELBO 可以用作训练的损失函数。(arxiv.org)
近似分布族
一种常见选择是平均场分布族,
它要求近似分布中选定的变量或变量块之间具有统计独立性。这一假设并不意味着真实后验分布中的相应变量也彼此独立。它简化了期望计算和优化,但无法再现分别因子化的变量块之间的依赖关系。平均场方法将概率推断与统计力学中较早的近似技术联系起来。(people.eecs.berkeley.edu)
结构化分布族会保留选定的依赖关系。例如,具有完整协方差矩阵的多元正态分布能够表示对角高斯分布无法表示的线性相关性。层次化变分分布族引入额外变量来控制近似分布,从而容纳依赖关系和更丰富的分布形态。提高灵活性可以改善对目标分布的表示,但也会增加计算和优化的难度。推断模型的表达能力与底层概率模型的表达能力是不同的概念。(jmlr.csail.mit.edu)
优化算法
坐标上升变分推断每次更新一个因子,同时保持其他因子不变。对于平均场近似中不受形式限制的因子,最优更新具有如下形式:
在适当的共轭模型中,这些更新具有闭式解。坐标更新会提高下界,但整体问题通常不一定是凸的,因此初始化可能影响最终解。(jmlr.org)
随机变分推断利用随机选取的观测数据或小批量数据来估计更新,从而避免每次迭代都完整遍历数据集。Hoffman 及其同事于 2013 年提出的方法利用随机优化,将贝叶斯主题模型扩展到包含数百万篇文档的语料集合。该方法区分了与各个观测相关的局部潜变量,以及整个数据集共享的全局量。(jmlr.org)
黑箱变分推断利用从近似分布中抽取的样本来估计 ELBO 的梯度,减少了针对具体模型进行推导的需要。得分函数估计器适用范围广,但其方差可能很大;方差缩减技术可以提高其可用性。自动微分进一步支持了通用实现。自动微分变分推断(ADVI)结合了受约束变量的变换、高斯近似和自动微分,无须模型具备共轭性。(proceedings.mlr.press)
摊销推断与神经网络模型
摊销推断学习一个从观测数据到近似后验参数的共享映射,而不是为每个观测独立优化参数。在变分自编码器中,编码器人工神经网络生成 ,解码器则定义 。两者都通过变分下界进行训练。(arxiv.org)
重参数化技巧将样本表示为与参数无关的噪声经过可微变换后的结果。对于对角高斯分布,
这使梯度能够通过采样变换传播,并支持采用随机梯度下降等方法进行小批量训练。共享推断网络可以减少重复计算,但也将近似后验限制在该网络能够生成的分布范围内。(arxiv.org)
准确性与局限
与马尔可夫链蒙特卡洛不同,标准变分推断即使在优化收敛后,通常仍存在近似误差。准确性取决于所选分布族和优化质量。采用反向 KL 散度的平均场近似可能低估后验不确定性,并集中于多峰目标分布的某一个区域。因此,ELBO 趋于稳定并不能证明后验方差、尾部概率或依赖关系是准确的。更快的计算和有用的预测结果,仍可能伴随着不够准确的不确定性估计。(cs.columbia.edu)