多重检验是在同一推断框架内考虑多个统计假设检验。在统计学中,按常规阈值分别检验每个假设,通常无法使整组检验维持同样的错误率。多重检验程序先定义适当的整体错误准则,再据此调整拒绝阈值、P值或同时区间。组均值之间的多重比较是一个重要特例,但这一框架也适用于多项结局、参数和科学论断。(itl.nist.gov)
为什么多重性很重要
当一个为真的原假设被拒绝时,就发生了第一类错误。在满足相应统计条件的前提下,以显著性水平 进行的检验会限制该项检验发生这种错误的概率。反复进行检验会增加错误拒绝的机会;单项检验的水平不会自动成为整体水平。(fda.gov)
对于 个为真的原假设,如果其拒绝事件具有统计独立性,且每项检验的错误概率恰好为 ,那么至少发生一次错误拒绝的概率为
例如,当 、 时,该概率约为 。独立性是这一计算的必要条件:相互依赖的检验不一定满足该公式。不过,只要每项检验的实际第一类错误概率恰好为 ,无论检验之间是否存在依赖,错误拒绝次数的期望值都是 。这两者是不同的错误度量,而不是对同一个量的两种相互矛盾的计算。(math.tau.ac.il)
假设族与错误准则
假设族是需要进行整体错误控制的一组假设。其范围取决于所评估的科学论断,而不只是哪些检验恰好使用了同一数据集。一项研究中的多个终点、治疗比较、时间点和亚组分析,都可能造成多重性。因此,对假设进行分组和排序是实验设计和分析规划的组成部分。(fda.gov)
令 表示被拒绝的真原假设的数量, 表示被拒绝的原假设总数。两个核心准则是:
族错误率(FWER):
错误发现率(FDR):
FWER 关注是否发生任何错误拒绝;FDR 关注所有拒绝中错误拒绝所占比例的期望值,并在没有拒绝发生时将该比例记为零。强 FWER 控制适用于真假假设的每一种组合;弱控制则仅适用于所有原假设均为真的情形。(stat.purdue.edu)
FDR 始终不超过 FWER;当所有原假设均为真时,两者相等。将 FDR 控制在 ,并不保证任何特定数据集中错误拒绝所占的比例最多为 5%,也不意味着每项被拒绝的假设都有 5% 的概率属于错误拒绝。它是重复抽样意义下的期望值。(stat.purdue.edu)
族错误率控制程序
邦费罗尼校正在 时拒绝假设 。等价地,其调整后的 P 值为 。这一方法的理论依据是联合界,因此不要求独立性。只要每个单项 P 值在对应原假设成立时都是有效的,该程序就能实现强 FWER 控制。(stat.ethz.ch)
霍尔姆程序将 P 值排序为 。从最小的 P 值开始,将 与 比较,依次拒绝相应假设,直到首次不满足拒绝条件为止。这种逐步下降程序在任意依赖结构下也能实现强 FWER 控制,而且会拒绝普通邦费罗尼校正所拒绝的所有假设,还可能拒绝更多假设。较宽松的阈值可以提高统计功效,即检出错误原假设的概率。(stat.ethz.ch)
一些专门的程序会利用特定比较族的结构。在方差分析之后,图基极差检验用于所有均值的两两比较,而谢费法用于所有线性对比。总体检验拒绝原假设,只能说明各均值并非全部相等,不能指出具体哪些差异导致了这一结果。这些程序各自都要求满足相应的模型假设。(itl.nist.gov)
错误发现率控制程序
1995 年提出的本杰明尼—霍赫伯格程序先对 P 值排序,再找出满足下式的最大序号 :
其中, 是目标 FDR 水平。该程序拒绝与 对应的假设;如果没有任何序号满足条件,则不拒绝任何假设。与逐步下降程序不同,它不会在首次比较不满足条件时停止。最初的证明确立了该程序在检验统计量相互独立时对 FDR 的控制。(rss.onlinelibrary.wiley.com)
同一程序在一种特定的正依赖条件下也能控制 FDR,这一条件称为“子集上的正回归依赖”。仅仅观察到正相关关系,一般不能替代对这一条件的验证。本杰明尼—耶库铁利程序通过将 替换为 来适应任意依赖结构,其中 。这种适用范围更广的保证,需要以更严格的阈值为代价。(math.tau.ac.il)
同时推断与结果解释
多重性也会影响置信区间。分别构造的 95% 置信区间,通常不能保证以 95% 的概率同时覆盖所有对应参数。如果邦费罗尼区间的单个覆盖率至少为 ,则其同时覆盖率至少为 。这种联合保证不同于任何单个区间的覆盖率。(itl.nist.gov)
对调整后结果的解释,取决于所指定的假设族、程序、错误准则及相关假设。FWER 和 FDR 程序回答的是不同问题,因此不一定产生相同的拒绝集合。调整控制的是某个明确定义的错误率,并不能确立效应的大小或科学重要性。如果比较是在查看数据之后才选定的,选择过程也很重要:仅对选中的比较进行校正,通常无法获得针对完整搜索过程设计的程序所提供的保证。(stat.ethz.ch)