邦费罗尼校正是统计学中用于控制假阳性的一种方法,适用于同时考虑多项统计假设检验的情形。对于由 (m) 项检验组成的检验族,若总体显著性水平为 (\alpha),则每项假设都按 (\alpha/m) 的水平进行检验。等价地,也可以将每个P值乘以 (m),并将结果的上限设为 1。该方法控制的是族错误率,即至少拒绝一个真实原假设的概率。它的有效性不要求各项检验相互独立。(stat.ethz.ch)
多重检验与判定规则
在多重检验中,即使每项检验单独来看都是有效的,将它们合在一起也可能使至少发生一次第一类错误的概率相当高。如果全部 (m) 个原假设都为真,且各项检验的拒绝事件相互独立、发生概率均为 (\alpha),那么未经调整的族错误率为
[ 1-(1-\alpha)^m. ]
例如,按 0.05 的水平进行 20 项独立检验,至少发生一次错误拒绝的概率约为 0.642。这是在上述假设下计算得到的结果,并非任意 20 项检验都具有这一错误率。(stat.ethz.ch)
邦费罗尼校正将单项检验的阈值改为
[ \alpha_{\mathrm{individual}}=\frac{\alpha}{m}. ]
对于假设 (H_i),判定规则是在 (p_i\leq\alpha/m) 时拒绝该假设。等价的调整后P值为
[ p_i^{\mathrm{adj}}=\min(1,mp_i), ]
并将其与原来的 (\alpha) 比较。这两种做法是同一校正的不同表达方式;如果同时采用,就会施加额外且不必要的调整。(stat.ethz.ch)
举例来说,假设五项检验得到的P值分别为 (0.003,\ 0.012,\ 0.021,\ 0.040,\ 0.300)。在总体显著性水平为 0.05 时,阈值为 0.01,因此仅拒绝第一个假设。调整后的P值分别为 (0.015,\ 0.060,\ 0.105,\ 0.200,\ 1.000),得出的判定相同。
数学基础
这一校正源于并集界,也称布尔不等式。对于事件(概率论) (A_1,\ldots,A_k),有
[ \Pr!\left(\bigcup_{i=1}^{k}A_i\right) \leq\sum_{i=1}^{k}\Pr(A_i). ]
该不等式既不要求统计独立性,也不对事件之间的依赖结构作任何要求。(webhome.auburn.edu)
令 (I_0) 表示所有真实原假设的下标集合。在原假设为真时,有效的P值应对每个 (t\in[0,1]) 满足 (\Pr(p_i\leq t)\leq t)。将并集界应用于错误拒绝事件,可得
[ \begin{aligned} \mathrm{FWER} &=\Pr!\left(\bigcup_{i\in I_0} {p_i\leq\alpha/m}\right)\ &\leq\sum_{i\in I_0}\Pr(p_i\leq\alpha/m)\ &\leq |I_0|\alpha/m \leq\alpha. \end{aligned} ]
这一推导解释了所谓的强控制:无论哪些假设为真,该界限都成立,而不只是全部原假设为真时才成立。它也表明,仅仅调整P值,并不能使原本无效的单项检验变得有效。(arxiv.org)
同时置信区间
同样的概率论证也适用于置信区间。如果 (m) 个区间中的每一个都具有至少 (1-\alpha/m) 的覆盖概率,那么所有区间同时覆盖各自参数的概率至少为 (1-\alpha)。因此,若希望十个区间具有 95% 的同时覆盖概率,可以将每个区间的单独覆盖概率设为 99.5%。(itl.nist.gov)
对于基于学生t分布的双侧区间,一种常见形式为
[ \widehat{\theta}i \pm t{1-\alpha/(2m),,\nu_i} ,\mathrm{SE}(\widehat{\theta}_i), ]
其中,(\widehat{\theta}_i) 是估计值,(\mathrm{SE}) 是其标准误,(\nu_i) 是相应的自由度。因子 2 用于将单项错误概率分配到两侧尾部。因此,邦费罗尼区间比相应的未调整区间更宽。(itl.nist.gov)
检验族的界定
数量 (m) 指的是联合错误控制声明所涵盖的假设数,并不一定等于观测数或组数。在一项对 (k) 个组的均值进行所有两两比较的研究中,共有 (k(k-1)/2) 次比较;如果仅将每个非对照组与一个对照组比较,则只有 (k-1) 次比较。哪些比较应归为同一个检验族,由研究问题和实验设计决定。(itl.nist.gov)
邦费罗尼校正适用于方差分析中预先选定的一组对比,并不限于所有两两比较。对某一组对比的错误控制保证,并不会自动扩展到该组之外的其他比较。这一点可由证明看出:错误率的界限仅涵盖并集中包含的拒绝事件。(itl.nist.gov)
保守性与替代方法
邦费罗尼校正控制的是一个上界,因此实际族错误率可能低于 (\alpha)。它的保守性可能降低统计功效,即拒绝错误的原假设、转而支持备择假设的能力,尤其是在检验族包含大量检验时。尽管如此,计算简便、同时置信区间易于构造,仍是这一方法的实用优点。(stat.ethz.ch)
霍尔姆–邦费罗尼方法将P值从小到大排序,依次与 (\alpha/m,\alpha/(m-1),\ldots) 比较,并在首次不拒绝假设时停止。它同样能在任意依赖关系下对族错误率进行强控制,而且会拒绝普通邦费罗尼校正所拒绝的每一个假设,有时还能拒绝更多假设。(stat.ethz.ch)
控制错误发现率的方法,包括本杰明尼–霍赫伯格方法,针对的是另一种准则:所有被拒绝的假设中,错误拒绝所占比例的期望值;没有拒绝任何假设时,这一比例定义为零。这些方法通常不能对发生任何一次错误拒绝的概率提供相同的上界保证。(stat.ethz.ch)
一种加权扩展形式是预先指定非负权重 (w_i),使其总和为 1,并使用阈值 (\alpha w_i)。对于有效的单项检验,并集界论证仍能保证族错误率得到控制。取相等权重 (w_i=1/m),便得到普通的邦费罗尼校正。(pmc.ncbi.nlm.nih.gov)