第一类错误和第二类错误是统计假设检验中两种可能的错误判断。第一类错误是指拒绝了实际为真的原假设;第二类错误是指未拒绝实际为假的原假设。这两类错误区分了误报与漏检,并为统计学在重复抽样条件下评估检验方法提供了框架。它们的概率描述的是检验方法在指定条件下的表现,而非某个具体的观测结论是否错误。(itl.nist.gov)
判断与实际真伪
检验将原假设 与备择假设 进行对比。数据被归结为一个检验统计量,判断规则则规定哪些取值会导致拒绝原假设。假设实际为真还是为假,并不取决于检验作出的判断,因此会出现四种情形:(itl.nist.gov)
| 实际情形 | 拒绝 | 不拒绝 |
|---|---|---|
| 为真 | 第一类错误 | 正确地不拒绝 |
| 为假 | 正确地拒绝 | 第二类错误 |
一般而言,使用“不拒绝”比“接受”更恰当:缺乏反对某个假设的充分证据,并不能证明该假设为真。例如,若 表示某制造过程的均值等于目标值,那么在均值确实等于目标值时拒绝该假设,就是第一类错误;未能检出实际存在的偏离,则是第二类错误。错误的分类取决于原假设如何表述。(itl.nist.gov)
错误概率与统计功效
对于简单原假设,第一类错误的概率通常记为
这是在原假设模型下计算的条件概率。检验的显著性水平是为这一概率指定的上限。对于包含多个可能参数值的复合原假设,水平为 的检验必须在原假设所包含的每个参数值处都满足这一上限要求。其实际的最大错误概率可能低于名义水平。(stat210a.berkeley.edu)
在备择假设下的某个特定参数值 处,第二类错误的概率为
相应的统计功效为
因此,功效就是检出某种指定的、偏离原假设的情形的概率。对于整个复合备择假设,通常不存在单一的第二类错误概率:真实的效应量不同,检出概率也不同。功效曲线描述了这种随参数值变化的关系。(itl.nist.gov)
一般而言, 和 都不是在观察数据之后某个假设为真的概率。这样的理解颠倒了条件关系。为假设赋予概率属于另一类推断框架,例如贝叶斯推断,需要额外的模型设定。(amstat.org)
权衡与研究设计
在数据模型、样本量和检验统计量固定的情况下,提高拒绝原假设的门槛,通常会减少第一类错误,同时增加第二类错误。例如,将显著性阈值从 0.05 降至 0.01,会缩小拒绝域,并降低针对同一备择假设的功效。这两类错误的概率并非互补关系,因为它们是在不同的实际情形下计算的。(itl.nist.gov)
增大样本量可以在保持显著性水平不变的同时,降低第二类错误的概率。功效还取决于变异程度、效应大小,以及检验是单侧还是双侧。在实验设计中,计算样本量时需要指定所关注的备择情形,以及可接受的第一类错误概率上限和期望达到的功效。效应越大、方差越小,通常就越容易检出。(online.stat.psu.edu)
正态总体均值的例子
假设 是来自正态分布的相互独立的观测值,该分布的均值为 ,已知标准差为 。考虑检验 ,备择假设为 。利用样本均值 ,定义
分母是均值的标准误。在 成立时,该统计量的抽样分布为标准正态分布,因此,当 时拒绝原假设,可使第一类错误的概率等于 。(online.stat.psu.edu)
当真实均值为 时,
其中, 是标准正态分布的累积分布函数。这个公式表明,增大 、增大均值差或减小 ,都能减少漏检。当 ,且均值差等于三个标准误时,计算得到的第二类错误概率约为 0.088,相应的功效约为 0.912。(online.stat.psu.edu)
结果解读与多重检验
P值描述观测到的统计量与指定的原假设模型有多大程度的不相容。它并不是结果属于第一类错误的概率。同样,结果不显著也不能证明效应不存在。置信区间可以表明哪些效应大小仍与数据相容;对于相互对应的区间估计和检验方法,假设值不在置信区间内,就对应于相关检验拒绝该假设。仅凭统计显著性无法衡量实际重要性。(amstat.org)
在多重检验中,分别控制每项检验,并不一定能控制整组检验中至少发生一次错误拒绝的概率。邦费罗尼校正通过将 个假设中的每一个都按 的显著性水平进行检验,来控制这种族错误概率。这一更严格的阈值可能降低针对各个备择假设的功效,体现了在更大范围内同样存在的误报与漏检之间的权衡。(online.stat.psu.edu)