学生t分布是一种连续概率分布,在统计学中应用广泛,尤其用于根据来自正态总体的观测值估计总体均值,而总体方差未知的情形。其标准形式关于零对称,形状与正态分布相似,但尾部更厚。一个称为自由度的参数决定其形状:自由度越小,尾部越厚;自由度越大,分布就越接近标准正态分布。(itl.nist.gov)
历史起源
“Student”是威廉·西利·戈塞特的笔名。他于1908年3月在《生物统计学》(Biometrika)上发表论文《均值的或然误差》,建立了这一分布所依据的小样本理论。该理论处理的是这样一种不确定性:必须用同一组有限的观测值,既估计均值,又估计总体的离散程度。因此,这个名称指的是作者的笔名,并非表示该分布与学生群体有什么特殊关联。(ocw.mit.edu)
数学定义
设 服从标准正态分布, 服从自由度为 的卡方分布。如果两者满足统计独立性,则随机变量
服从学生t分布,记作 。虽然在抽样问题中,自由度通常为整数,但这一分布对任意正实数 都有定义。(search.r-project.org)
其概率密度函数为
其中 表示伽马函数。这一构造与通常的正态标准化的区别在于分母是随机的:当分母的取值异常小时,比值可能成为绝对值很大的正数或负数。(search.r-project.org)
形状、矩与极限行为
所有中心t分布都是单峰且对称的,中位数和众数均为零。当 时,其期望值为零;当 时,均值不存在。其方差为
因此,只有当自由度大于2时,才存在有限的标准差。仅有对称性并不能保证矩的存在:偏度仅在 时有定义,峰度仅在 时有定义。(itl.nist.gov)
从密度公式可知,其尾部按 的比例衰减,而不像正态密度那样呈指数衰减。当 时,它退化为标准柯西分布。当 趋于无穷大时,该分布趋近于标准正态分布。这些都是由其密度函数及极限行为得到的数学结论。(search.r-project.org)
从正态总体抽样
设 是来自 的相互独立的观测值,其中 。定义样本均值和样本方差为
则标准化统计量
服从自由度为 的t分布。具有这一抽样分布的是该统计量,而非原始观测值。分母 是样本均值的标准误的估计值。(search.r-project.org)
与使用已知的总体标准差相比,估计总体标准差会引入额外的不确定性。t分布通过更厚的尾部将这种不确定性纳入考虑。这一精确结论依赖于样本来自正态总体;对于任意数据,仅仅将未知标准差替换为估计值,并不能保证统计量精确服从t分布。(online.stat.psu.edu)
假设检验与置信区间
在正态模型下,且原假设成立时,该统计量服从 。双侧P值是统计量的绝对值至少达到 的相应概率。等价地,在显著性水平 下,当 时,拒绝原假设。(itl.nist.gov)
的双侧 置信区间为
其中 为 分位数。其置信水平描述的是重复抽样时区间覆盖总体均值的长期比例,而不是在观察到区间后赋予固定总体均值的概率。精确的覆盖率要求正态模型成立;偏离正态性可能产生影响,尤其是在样本量较小或偏斜严重时。(itl.nist.gov)
位置—尺度形式与非中心形式
通过 可得到位置—尺度形式,其中 。它的中心为 ,但尺度参数通常不等于标准差:当 时,其方差为 。这一结果可直接由中心分布的变换得到。(search.r-project.org)
非中心t分布则将正态分子替换为 :
它并不是简单地将中心t分布平移后得到的分布。在正态样本的均值检验中,当备择假设成立时,。这一形式对于计算统计功效十分重要,因为它描述了原假设中的均值与真实均值不同时,检验统计量的分布。(search.r-project.org)