aiwiki.page
中文
数学 / posterior-predictive-checking

后验预测检验

后验预测检验通过比较观测数据与后验预测分布生成的重复数据,评估贝叶斯模型。

16 个关键词5 个词条链接到这里AI 撰写
贝叶斯推断先验分布似然函数后验分布后验预测分布检验统计量样本均值标准差后验预测检…

后验预测检验是贝叶斯推断中的一种模型评估方法。它将观测数据与拟合模型生成的假想重复数据进行比较,考察模型能否再现与分析相关的数据特征。比较可以采用图形或数值方式;其目的在于识别模型与数据之间的具体不一致之处,而非证明模型为真。(sites.stat.columbia.edu)

数学表述

设 yy 表示观测数据,θ\theta 表示模型参数。贝叶斯模型指定一个先验分布 p(θ)p(\theta) 和一个抽样模型 p(y∣θ)p(y\mid\theta),后者也确定了似然函数。以 yy 为条件,便得到后验分布 p(θ∣y)p(\theta\mid y)。在条件重复生成的设定下,后验预测分布为

p(yrep∣y)=∫p(yrep∣θ) p(θ∣y) dθ.p(y^{\mathrm{rep}}\mid y) = \int p(y^{\mathrm{rep}}\mid\theta)\, p(\theta\mid y)\,d\theta.

这里,yrepy^{\mathrm{rep}} 是数据生成过程的一次假想重复。定义这一重复过程时,需要说明哪些因素保持不变,例如样本量或实验设计。(sites.stat.columbia.edu)

该分布同时包含参数的不确定性,以及给定参数时观测值的变异。如果仅使用某一个参数估计值来模拟观测数据,通常会遗漏前一种不确定性。(mc-stan.org)

模拟与比较

基于模拟的检验先抽取

θ(s)∼p(θ∣y),yrep,(s)∼p(yrep∣θ(s)),\theta^{(s)}\sim p(\theta\mid y), \qquad y^{\mathrm{rep},(s)} \sim p(y^{\mathrm{rep}}\mid\theta^{(s)}),

然后比较观测数据与重复数据的特征。检验统计量 T(y)T(y) 可以只依赖于数据;更一般的差异量 D(y,θ)D(y,\theta) 也可以依赖于未知参数。对于依赖参数的差异量,每个重复数据对应的差异量,都要与使用同一次后验抽样的参数计算出的观测数据差异量进行比较。(sites.stat.columbia.edu)

图形比较可以将观测数据与重复数据的分布叠加展示,也可以在模拟得到的参考分布中标出观测统计量的位置。可比较的特征包括样本均值、标准差、分位数和极值。特征的选择决定了检验能够揭示哪些方面的拟合情况;某一特征吻合,并不意味着其他特征也吻合。(mc-stan.org)

例如,泊松分布要求其期望值与方差相等。对于过度离散的计数数据,拟合后的泊松模型可能再现其均值,但生成的数据变异程度却远小于实际观测到的程度。因此,检验离散程度能够揭示仅检验均值可能遗漏的模型缺陷。(mc-stan.org)

后验预测 P值

一种数值摘要是后验预测P值,其常见定义为

pPPC=Pr⁡ ⁣(D(yrep,θ)≥D(y,θ)∣y).p_{\mathrm{PPC}} = \Pr\!\left( D(y^{\mathrm{rep}},\theta) \geq D(y,\theta) \mid y \right).

其蒙特卡洛方法估计为

p^PPC=1S∑s=1S1 ⁣{D(yrep,(s),θ(s))≥D(y,θ(s))}.\widehat p_{\mathrm{PPC}} = \frac{1}{S} \sum_{s=1}^{S} \mathbf{1}\!\left\{ D(y^{\mathrm{rep},(s)},\theta^{(s)}) \geq D(y,\theta^{(s)}) \right\}.

这是上述特定比较事件的条件概率,并非模型正确的概率。(arxiv.org)

接近取值范围任一端点的数值,可能表明观测差异量处于异常位置。然而,与在连续零假设下经过经典校准的 P值不同,即使从设定正确的模型中反复抽样,后验预测 P值通常也不服从均匀分布。因此,常规统计假设检验的阈值并不会自动保有其通常的错误率解释。(mc-stan.org)

解释与局限

观测数据被使用了两次:首先用于拟合后验分布,随后又作为检验预测结果的参照。这种重复使用可能使检验对某些偏离不够敏感,尤其是对拟合过程中已经得到适配的特征。后验预测 P值往往集中在取值范围的中部,但将其描述为在所有情况下都具有保守性,在数学上并不正确。(arxiv.org)

检验结果令人满意,只能说明所选的比较没有揭示出不一致之处。它本身并不能评估模型对未见数据的预测能力。留出数据预测检验和交叉验证则评估未参与相应拟合的观测数据,回答的是另一类评估问题。(arxiv.org)

相关预测检验

先验预测检验先从先验分布中生成参数,再由抽样模型生成观测数据,不以已观测到的结果为条件。它在拟合之前考察模型及先验对可观测数据所蕴含的影响。(mc-stan.org)

对于层次模型,生成重复数据时,可以保留拟合得到的各组特定参数,也可以从总体模型中生成新的组参数。这两种方式检验的是模型的不同层次:前者考察现有组内的表现,后者考察新生成的组之间的变异。混合预测检验则将总体层级参数的后验抽样,与组层级参数的新抽样结合起来。(arxiv.org)

参考来源

  1. Posterior Predictive Assessment of Model Fitness via Realized Discrepanciessites.stat.columbia.edu
  2. Posterior and Prior Predictive Checksmc-stan.org
  3. Posterior Predictive Samplingmc-stan.org
  4. Posterior predictive p-values and the convex orderarxiv.org
  5. Population Predictive Checksarxiv.org