统计功效是指当指定的备择假设为真时,统计假设检验拒绝其原假设的概率。它描述了在给定的抽样和建模假定下,检验发现某种特定的、偏离原假设的效应的能力。功效通常记为 ,其中 是该备择假设为真时未能拒绝原假设的概率。功效是检验程序和研究设计的属性,而不是衡量某个具体观测结果有多大说服力的指标。(nist.gov)
定义与错误概率
假设检验用于区分原假设 与备择假设 。当原假设为真却被拒绝时,就发生了第一类错误;当指定的备择假设为真却未拒绝原假设时,就发生了第二类错误。显著性水平 规定了第一类错误概率的上限,而功效描述的是检验在备择假设下的表现。这些概率针对的是:在各自相应的假定下生成新样本,并对这些样本反复应用同一检验程序。(itl.nist.gov)
更一般地,设 为根据数据 计算的检验统计量, 为其拒绝域。功效函数为
其中, 指定生成数据的概率分布。在备择参数值 处,有 。因此,一个检验通常并没有唯一、普遍适用的功效值:其拒绝原假设的概率随真实参数而变化。计算功效需要求出统计量在备择假设下的抽样分布,而不能只考虑其在原假设下的分布。(online.stat.psu.edu)
哪些因素决定功效?
功效由检验方法、备择假设、显著性阈值,以及所收集信息的数量和质量共同决定。以下几种关系尤为重要:
- 效应量: 相对于随机变异而言,偏离原假设的程度越大,通常就越容易检出。相关的效应量可以是均值之差、比例之差,或其他参数对比。
- 样本量: 在常规情形下,增加样本量通常会提高功效,因为估计会变得更加精确。
- 变异性: 在均值差和样本量固定时,结果变量的方差越大,功效越低。
- 显著性水平: 较小的 意味着拒绝原假设的条件更严格,在其他条件不变时通常会降低功效。
- 检验方向: 单侧检验将拒绝概率集中在一个方向上;对于该方向上的备择假设,其功效可以高于相应的双侧检验,但它不检验反方向上的偏离。(itl.nist.gov)
这些关系使功效成为实验设计的核心考量。不过,通过扩大样本来提高功效,与放宽显著性阈值并不相同:后者也会允许更高的第一类错误率。因此,比较不同检验程序时,通常要规定相同的错误率约束。(itl.nist.gov)
正态总体均值的例子
假设 是来自正态分布的相互独立的观测值,该分布的均值为 ,已知标准差为 。考虑检验 ,备择假设为 。基于样本均值的统计量为
分母是均值的标准误。当 时,检验拒绝原假设,其中 是标准正态分布在概率 处的分位数。(itl.nist.gov)
当真实均值为 时,检验的功效为
其中, 是标准正态分布的累积分布函数。这一结果是通过计算均值发生平移后的正态分布下的拒绝概率得到的。求解达到目标功效所需的样本量,可得
当 、目标功效为 ,且 时,上式计算结果约为 ,因此在这些假定下至少需要九个观测值。当 需要估计时,计算必须考虑相应的学生t分布,而不能将其视为已知。(itl.nist.gov)
事前功效分析
功效分析利用预期效应、变异性、检验设定和显著性水平,在收集数据之前计算功效或确定所需样本量。反过来,也可以根据固定的样本量,确定该研究设计能够以指定概率检出哪些效应。因此,假定的效应是任何功效计算报告中不可缺少的一部分。(itl.nist.gov)
计算还取决于观测对象如何分配,以及以哪些比较结果作为研究成功的判据。预期的受试者退出可能会增加所需招募人数。在进行多重检验时,邦费罗尼校正等调整方法会降低每项比较的显著性阈值,以控制总体假阳性概率,这通常会降低单项检验的功效。对于包含多个结局指标的研究,所需的计算可能不同,取决于成功的定义是检出任意一个效应,还是检出所有指定的效应。(online.stat.psu.edu)
功效的解释与观测功效
功效既不是备择假设为真的概率,也不是具有统计显著性的发现能够被重复验证的概率。不显著的结果可能是因为原假设为真,也可能是因为检验程序未能检出真实存在的偏离。统计显著性也不能证明某个效应具有实质意义。效应估计和置信区间能够更直接地说明结果的大小及其不确定性。(researchgate.net)
“观测功效”是将根据已收集数据估计出的效应代入功效计算所得的结果。对于常见检验,在检验设定固定的情况下,这一数值由观测到的P值决定,不能为解释同一结果提供独立的证据。这不同于针对外部指定的、所关注的效应计算功效:后者可以描述研究设计的检出能力,而不必用观测效应来为其自身提供依据。(researchgate.net)