统计假设检验是统计学中利用观测数据评估有关总体或数据生成过程的主张的一套框架。检验需要明确相互竞争的假设、衡量偏离程度的指标,以及判断观测结果是否足以拒绝某个指定假设的规则。检验结论依赖于统计模型和抽样假定,并不能确凿地证明某个主张为真。(itl.nist.gov)
假设与统计模型
统计假说规定总体或模型的某种性质,例如均值、比例或变量之间的关系。原假设记为 ,是接受检验的主张。备择假设记为 或 ,描述与之竞争的其他可能情况。原假设不一定断言“没有效应”,也可以规定一个阈值或不等式。(itl.nist.gov)
例如,对总体均值进行双侧检验时,比较的是 与 。单侧检验则针对指定方向上的偏离。简单假设完全确定数据的概率分布,而复合假设则允许不止一种分布。假设与模型假定共同决定了表示数据的随机变量在原假设模型下的表现。(stats.org.uk)
检验统计量与决策规则
检验统计量将观测数据归纳为一个与待检验假设相关的量。它的抽样分布描述了在假想地重复抽样过程中,该统计量会如何变化。拒绝域包含所有会导致拒绝 的结果,其边界通常用临界值表示。(itl.nist.gov)
显著性水平 规定了在模型成立的条件下,拒绝一个真实原假设的概率上限。更形式化地说,若 为拒绝域, 为 所允许的参数值集合,则水平为 的检验满足
这一上限不一定能够恰好达到,尤其是在数据为离散型时。显著性水平是检验程序的性质,而不是某个具体结论出错的概率。(stats.org.uk)
P值是指在指定的原假设模型下,得到至少与观测值同样极端的检验统计量的概率,其中“极端”的含义由检验本身规定。常用的决策规则是在 时拒绝原假设。P值既不是 为真的概率,也不是观测结果“纯粹由偶然因素造成”的概率。(doi.org)
错误与统计功效
拒绝一个真实的原假设,就发生了第一类错误。未拒绝一个错误的原假设,则发生了第二类错误。对于某个具体的备择参数值 ,第二类错误的概率通常记为 。在该备择参数值下的统计功效为
因此,功效随备择情形而变化,并不是一个检验所具有的单一、普遍不变的属性。(itl.nist.gov)
功效取决于样本量、变异程度、偏离原假设的幅度以及拒绝规则。较大的样本通常能够检出较小的偏离。实验设计和样本量规划可以将针对指定备择情形的功效纳入考虑。未能拒绝原假设可能反映的是信息不足,而不是对原假设的支持。(stat.berkeley.edu)
示例:检验总体均值
假设 是来自某个正态分布的独立观测值,该分布的均值和方差均未知。检验 的单样本学生t检验使用以下统计量:
其中, 为样本均值, 为样本标准差。分母估计的是样本均值的标准误。在 成立时, 服从具有 个自由度的学生t分布。(itl.nist.gov)
对于水平为 的双侧检验,当
时拒绝原假设。
取 ,假设 、、、,则 。临界值约为 ,因此不拒绝原假设。这并不能证明总体均值恰好为100。(itl.nist.gov)
双样本检验用于比较总体均值。韦尔奇检验允许两个总体的方差不相等,而配对检验分析的是每一对观测值之间的差值,而不是将所有观测值视为互不相关。方差分析则将均值比较扩展到多个组。(itl.nist.gov)
置信区间与多重比较
检验与置信区间在数学上具有对偶关系。对一族水平为 的检验进行反演,可以得到一个置信集,其中包含未被这些检验拒绝的参数值。对于相互对应的双侧t检验与区间估计程序,当且仅当假设的均值位于相应的 置信区间之外时,该均值假设才会被拒绝。(stat.berkeley.edu)
当同时考虑许多项检验时,就会出现多重比较问题:对单项检验的错误率控制,并不会自动为整组检验提供同等程度的控制。邦费罗尼校正通过以 的水平检验 个假设中的每一个来处理这一问题,从而保证至少发生一次第一类错误的概率不超过 ,且不要求各项检验相互独立。(itl.nist.gov)
解释与报告
统计显著性并不衡量效应量或实际重要性。在大样本中,微小的效应也可能具有统计显著性;而在小样本中,重要的效应也可能未被检出。估计值和不确定性区间能够提供仅凭拒绝与否的决策无法传达的信息。(itl.nist.gov)
结果的解释还取决于模型假定、研究的实施情况以及实际进行过的分析。选择性地只报告较小的P值,会掩盖检验过程,并削弱对这些P值作出合理解释的基础。美国统计协会在2016年的声明中强调了透明报告的重要性,并提醒人们,不应仅根据P值是否跨过某个阈值来作出科学结论。(doi.org)