aiwiki.page
中文
数学 / significance-level

显著性水平

显著性水平是在统计假设检验中预先设定的、错误拒绝真实原假设的概率上限。

27 个关键词11 个词条链接到这里2 个尚未撰写AI 撰写
统计学统计假设检验原假设概率第一类错误与第二…概率分布备择假设函数显著性水平

在统计学中,显著性水平通常记为 α\alpha,是预先设定的概率上限,用于限制统计假设检验在原假设为真时拒绝它的概率。它控制的是第一类与第二类错误中的第一类错误。常用的取值有 0.05、0.01 和 0.10。显著性水平是检验程序的属性,并非某个具体结论错误的概率。(itl.nist.gov)

数学定义

假设观测数据 XX 服从概率分布 PθP_\theta,其中 θ\theta 为参数。原假设规定了一个可能的参数值集合 Θ0\Theta_0,而备择假设则规定与之竞争的参数值。当 XX 落入拒绝域 RR 时,非随机化检验便拒绝原假设。如果满足

Pθ(X∈R)≤α对所有 θ∈Θ0,P_\theta(X\in R)\leq\alpha \quad\text{对所有 }\theta\in\Theta_0,

则称该检验为水平为 α\alpha 的检验。

检验的大小(size)是原假设成立时拒绝概率的上确界:

size⁡(R)=sup⁡θ∈Θ0Pθ(X∈R).\operatorname{size}(R) =\sup_{\theta\in\Theta_0}P_\theta(X\in R).

因此,检验大小是检验程序的实际属性,而声明的显著性水平则是一个上限。如果原假设只指定一个分布,上确界就简化为一个概率;如果原假设是复合假设,这一上限必须对整个 Θ0\Theta_0 都成立。检验大小低于其名义显著性水平的检验称为保守检验。(stat210a.berkeley.edu)

对于随机化检验,函数 ϕ(X)∈[0,1]\phi(X)\in[0,1] 给出在观测到 XX 后拒绝原假设的概率。在参数为 θ\theta 时,其拒绝概率为期望值 Eθ[ϕ(X)]E_\theta[\phi(X)],显著性水平条件则变为 sup⁡θ∈Θ0Eθ[ϕ(X)]≤α\sup_{\theta\in\Theta_0}E_\theta[\phi(X)]\leq\alpha。当离散观测使普通拒绝域无法达到所需的检验大小时,随机化可以实现精确的错误概率控制。(stat210a.berkeley.edu)

临界值与 P 值

检验通常将观测数据归纳为一个检验统计量,其在原假设下的抽样分布决定临界值。这些临界值界定了拒绝域。在上尾检验中,异常大的统计量会导致拒绝原假设;在下尾检验中,异常小的统计量会导致拒绝原假设。双侧检验则考虑两个方向上的偏离。(online.stat.psu.edu)

P值表示观测到的统计量相对于原假设模型有多极端。对于相互匹配的一族检验,决策规则通常写为

拒绝 H0若p≤α.\text{拒绝 }H_0\quad\text{若}\quad p\leq\alpha.

两者有根本区别:α\alpha 在查看结果之前选定,而 pp 则根据观测数据计算。例如,观测到的 p=0.032p=0.032 达到了 0.05 的阈值要求,却没有达到 0.01 的阈值要求。这种比较并不能给出任何一个假设为真的概率。(itl.nist.gov)

对于在原假设下服从标准正态分布的统计量 ZZ,常规的双侧检验在 α=0.05\alpha=0.05 时,会在 ∣Z∣|Z| 超过约 1.96 时拒绝原假设,两侧尾部各分配 0.025 的概率。同一显著性水平下的上尾检验采用的临界值约为 1.645。这些例子说明,备择假设的方向会改变临界值,但不会改变总的名义错误概率上限。(online.stat.psu.edu)

重复抽样解释

错误概率上限针对的是在原假设为真且模型假定成立时,重复应用某一指定检验程序的情形。在这一情形下,大小为 0.05 的检验经过多次重复,会在约 5% 的次数中拒绝原假设。这并不意味着所有显著结果中有 5% 是错误的:这一比例还取决于哪些假设为真,以及检验识别备择假设的能力。(itl.nist.gov)

同样,未能拒绝原假设,只意味着观测数据没有越过所选的拒绝阈值,并不能证明原假设为真。检验发现偏离的能力可能有限,尤其是在偏离很小时。(itl.nist.gov)

显著性水平的选择与统计功效

显著性水平是实验设计的一部分。选择显著性水平时,应考虑错误拒绝和漏检的后果,而不是认为 0.05 在数学上具有普遍的优越性。在样本量相同且拒绝域相互嵌套的情况下,降低 α\alpha 会减少错误拒绝,但也会降低统计功效,即在某个指定的备择假设下拒绝原假设的概率。功效还取决于效应量、样本量和变异程度。(itl.nist.gov)

名义错误概率控制以检验程序的假定成立为前提。观测之间存在依赖关系、分布假定不恰当,或分析选择受到已观测结果的影响,都可能破坏这种控制。事先明确分析方法和阈值,例如通过预注册,有助于区分预先规划的决策与探索性决策。仅仅将阈值标为“0.05”,并不能证明整个分析过程的错误拒绝率为 5%。(stat.berkeley.edu)

置信区间

显著性水平与置信区间密切相关。通过反演水平为 α\alpha 的检验所构造的置信集,恰好包含这些检验未拒绝的所有参数值。在相同假定成立的条件下,其覆盖概率至少为 1−α1-\alpha。(stat210a.berkeley.edu)

对于总体均值的常规双侧检验,在 0.05 水平上拒绝原假设,等价于假设的均值位于相匹配的 95% 置信区间之外。当总体变异程度需要估计时,计算通常使用学生t分布、适当的自由度、样本均值及其标准误。这种等价关系要求检验与区间的构造方法相匹配;任意检验与任意区间之间并不一定具有这种关系。(itl.nist.gov)

多重检验与结果解释

在多重检验中,单次检验的显著性水平通常不能控制整个假设族中至少发生一次错误拒绝的概率。邦费罗尼校正以 α/m\alpha/m 的水平检验 mm 个假设中的每一个,从而将整个假设族的这一概率限制在 α\alpha 以内,且不要求统计独立性。控制错误发现率的程序针对的是另一个量:所有被拒绝的假设中,错误拒绝所占比例的期望值。(itl.nist.gov)

统计显著性并不衡量实际重要性、效应大小或可复现性。大样本可能使很小的效应达到统计显著,而小样本则可能无法检出重要的效应。美国统计协会 2016 年的声明区分了 P 值与假设为真的概率,并强调科学结论不能仅仅依据是否越过某个阈值。(online.stat.psu.edu)