备择假设是统计假设检验中规定偏离原假设情形的命题。它通常记作 (H_1)、(H_a) 或 (H_A),描述检验旨在识别的参数取值或生成数据的分布。例如,原假设可以规定总体均值等于某个给定值,而备择假设则规定总体均值不等于该值。备择假设有助于确定哪些观测结果可视为反对原假设的证据。(itl.nist.gov)
数学表述
在统计学中,统计假设涉及总体或其概率分布,而不只是对已观测样本的描述。假设一个模型由参数 (\theta) 确定,且 (\theta) 属于参数空间 (\Theta)。检验问题可写为
[ H_0:\theta\in\Theta_0, \qquad H_1:\theta\in\Theta_1, ]
其中 (\Theta_0) 与 (\Theta_1) 互不相交。在穷尽所有可能情形的表述中,(\Theta_1=\Theta\setminus\Theta_0),即备择假设包含原假设所排除的所有可能情形。另一些检验问题则比较指定的、互不相交的可能情形,而不要求这些情形涵盖模型中的全部可能性。(itl.nist.gov)
简单假设完全确定了分布;复合假设则允许存在不止一种可能的分布。例如,若观测值服从正态分布,且方差已知,那么 (H_1:\mu=12) 是简单假设,而 (H_1:\mu>10) 是复合假设。如果方差仍然未知,仅指定均值并不能使假设成为简单假设。这一区分很重要,因为对于复合备择假设所包含的不同分布,同一检验的性能可能有所不同。(online.stat.psu.edu)
单侧与双侧备择假设
对于总体均值 (\mu) 和参照值 (\mu_0),常见的表述有:
- 双侧: (H_0:\mu=\mu_0),对立于 (H_1:\mu\ne\mu_0)。
- 上侧: (H_0:\mu\le\mu_0),对立于 (H_1:\mu>\mu_0)。
- 下侧: (H_0:\mu\ge\mu_0),对立于 (H_1:\mu<\mu_0)。
双侧备择假设涵盖两个方向上的偏离,单侧备择假设则只涵盖指定方向上的偏离。入门介绍有时会将单侧检验的原假设写成等式,因为通常的临界值由边界值决定;采用不等式表述则能明确体现两个假设的互补关系。(itl.nist.gov)
备择假设决定相应的拒绝域。在常规的对称双侧检验中,两端尾部的极端值都构成反对原假设的证据,通常将显著性水平的一半分配给每一侧尾部。上侧检验则在检验统计量足够大时拒绝原假设。因此,同样的观测结果在不同备择假设下可能产生不同的决策,因为这些检验回答的是不同的问题。(itl.nist.gov)
在构造检验中的作用
检验将统计量与决策规则相结合,决策规则依据原假设下该统计量的抽样分布进行校准。P值衡量观测到的统计量相对于原假设模型有多极端,而“极端”的含义由检验及其备择假设确定。计算P值不能仅看样本估计值在数值上是否与假设值不同,还必须考虑抽样变异。(itl.nist.gov)
例如,对于相互独立、服从正态分布且总体标准差未知的观测值,单样本均值检验使用
[ T=\frac{\bar X-\mu_0}{S/\sqrt n}, ]
其中,(\bar X) 为样本均值,(S) 为样本标准差,(n) 为样本量。分母是估计的标准误。在原假设的边界处,(T) 服从自由度为 (n-1) 的学生t分布。备择假设决定拒绝域位于上尾、下尾还是两侧尾部。(itl.nist.gov)
备择假设也在最优检验理论中发挥作用。奈曼–皮尔逊引理表明,当简单原假设与简单备择假设相对时,利用两个模型的似然函数之比适当地构造检验,可以得到给定检验大小下的最强检验。对于复合备择假设,同一个检验未必在每个参数值处都是最强的。(online.stat.psu.edu)
错误与统计功效
检验中的第一类与第二类错误分别是:拒绝实际上为真的原假设,以及在备择假设成立时未能拒绝原假设。水平为 (\alpha) 的检验将所有原假设参数取值下的第一类错误概率控制在不超过 (\alpha) 的范围内。对于备择假设中的某个特定参数值 (\theta),统计功效为
[ \pi(\theta)=P_\theta(\text{拒绝 }H_0). ]
相应的第二类错误概率为 (\beta(\theta)=1-\pi(\theta))。因此,复合备择假设一般对应一个功效函数,而不是一个统一的功效值。(itl.nist.gov)
功效取决于实际效应量、样本量、变异程度、显著性阈值以及检验方法。在标准的均值比较情境中,样本量越大或偏离原假设的程度越大,功效通常越高。因此,计算功效需要指定备择假设下的效应,通常是被认为具有实际意义的效应,而不能仅仅声称“存在某种差异”。(online.stat.psu.edu)
解释与报告
在检验的假定成立时,拒绝原假设提供了反对原假设的证据,但并不意味着备择假设必然成立。尤其是,(p) 和 (1-p) 都不是备择假设为真的概率。统计显著性也不能衡量偏离的幅度或实际重要性。(amstat.org)
同样,未能拒绝原假设也不能证明相等。与检验相匹配的置信区间表明,在所用方法下,哪些参数值仍与数据相容。对于常规的双侧均值检验,在边界判定约定一致的前提下,以水平 (\alpha) 拒绝原假设,等价于相应的 (100(1-\alpha)%) 区间不包含 (\mu_0)。(itl.nist.gov)
推断过程必须考虑多重检验和选择性报告。在众多备择假设中进行搜索,却只报告有利的结果,可能歪曲证据。因此,假设、模型假定、分析选择和不确定性估计都是报告中的重要内容,不能用一个拒绝与否的决策来取代。(magazine.amstat.org)