检验统计量是由样本数据计算得出的量,用于统计假设检验。它概括了观测结果中有助于区分原假设与备择假设的某个方面。其观测值会与一个参照分布进行比较,该分布描述了原假设及相关假定成立时统计量的行为。通过这一比较,可以确定结果是否落入拒绝域,或是否得到较小的P值。(online.stat.psu.edu)
数学定义
对于观测值 ,检验统计量可写为
它是样本的一个指定函数,而不是未知参数值的函数。不过,公式中仍可包含假设的参数值,以及根据观测数据估计得到的量。在收集观测数据之前, 是一个随机变量;收集数据之后,其实现值记为 。常见的统计量用于衡量标准化差异、观测频数与期望频数之间的差异,或比较拟合模型。(stat.berkeley.edu)
原假设成立时, 的抽样分布称为其原假设分布。仅凭一个数值,无法判断结果有多异常:对它的解释取决于这一分布,以及哪些取值被视为反对原假设的证据。根据备择假设的不同,较大的值、较小的值或分布两端的值都可能具有检验意义。(stat.berkeley.edu)
拒绝域与P值
拒绝域 规定了哪些统计量取值会导致拒绝原假设。显著性水平为 的检验,在其假定成立的情况下,将错误拒绝真实原假设的概率控制在不超过 的水平。对于简单原假设,可表示为
拒绝域的边界值称为临界值。这种控制针对的是第一类与第二类错误中的第一类错误;它并不保证对任一具体样本作出的判断都是正确的。(itl.nist.gov)
对于原假设分布已确定的上尾检验,
对于以分布对称且以零为中心的统计量为依据的双侧检验,一种常见定义是
因此,统计量与P值并不相同:前者概括数据,后者则利用概率分布评估统计量的极端程度。双侧检验中如何界定极端程度,取决于具体的检验方法,而不存在适用于所有检验的统一规则。(itl.nist.gov)
均值的标准化统计量
许多常用统计量具有如下形式:
分子衡量估计值偏离原假设值的程度;分母反映抽样变异。对于总体标准差 已知的总体均值,检验统计量为
其中, 为样本均值, 为假设的均值。当观测值相互独立且来自正态分布时, 的原假设分布为标准正态分布。(itl.nist.gov)
当总体标准差未知时,单样本t统计量用样本标准差 替代 :
这里, 是均值标准误的估计值。对于满足统计独立性、同分布且服从正态分布的观测值,原假设分布为具有 个自由度的学生t分布。因此,对变异程度进行估计会改变应采用的参照分布。(itl.nist.gov)
举一个数值例子,设 、、、。此时 ,即样本均值比假设值高出两个估计标准误。是否因此拒绝原假设,取决于所选的显著性水平、备择假设的方向,以及自由度为24的t分布。计算本身并不是决策规则。(itl.nist.gov)
差异统计量与似然统计量
对于分类频数,皮尔逊卡方统计量为
其中, 和 分别为观测频数和原假设模型下的期望频数。数值越大,表明差异越大。在拟合优度检验中,作为参照分布的卡方分布通常只是一种近似;自由度取决于类别数以及根据数据估计的参数。各类别的期望频数足够大,是这一近似成立的重要条件。(itl.nist.gov)
另一种方法使用似然函数。似然比检验将原假设所允许的最佳拟合与更大模型中的最佳拟合进行比较:
较小的 值,或较大的 值,表明施加原假设的约束显著降低了所能达到的似然值。这种方法将假设检验与最大似然估计联系起来。(online.stat.psu.edu)
校准与解释
原假设分布不一定来自标准的解析公式。置换检验按照原假设所允许的重排方式,重新计算选定的统计量。通过枚举或蒙特卡洛方法抽样,可以获得其参照分布。这种校准是否有效,取决于哪些重排方式是允许的,而不只是能否将观测值打乱。(stat.berkeley.edu)
对统计量的解释始终以模型和抽样假定为前提。极端结果可能反映原假设不正确,也可能反映相关假定不正确。此外,较小的P值并不表示原假设为真的概率,也不能衡量效应量或实际重要性。同样,未拒绝原假设也不能证明原假设成立。估计值和置信区间用于回答关于大小与不确定性的问题,而仅凭检验决策无法解决这些问题。(stat.berkeley.edu)