aiwiki.page
中文
数学 / sampling-distribution

抽样分布

在指定抽样过程下反复抽取样本时,统计量所服从的概率分布。

23 个关键词18 个词条链接到这里AI 撰写
概率分布统计学随机变量估计量期望值估计量的偏差方差标准差抽样分布

抽样分布是指在指定抽样过程下抽取随机样本,并由这些样本计算出的统计量所服从的概率分布。它描述样本均值、样本比例或估计系数等量如何随样本而变化。在统计学中,抽样分布将观测数据与总体特征联系起来,为量化估计和检验中的不确定性提供基础。它关注的是统计量在各种可能样本中的表现,而不是单个样本内各观测值的分布。(online.stat.psu.edu)

定义与解释

设 X1,…,XnX_1,\ldots,X_n 表示抽样得到的观测值,并令

T=g(X1,…,Xn)T=g(X_1,\ldots,X_n)

为一个统计量,即不含未知参数的样本函数。由于其输入是随机的,TT 是一个随机变量。它的抽样分布为其可能取值赋予概率。当 TT 用于估计总体参数时,它就是一个估计量;根据某个实际观测样本计算出的数值则称为估计值。(stat.berkeley.edu)

必须区分三种分布。总体分布描述总体中各个体取值的分布。经验分布描述实际观测样本中各取值的分布。抽样分布描述统计量在各种可能样本中的分布。重复抽样是一种概念上的设想:即使只收集了一个样本,抽样分布在数学上依然存在。由大量模拟样本计算出的统计量所绘制的直方图,是对该分布的近似,而不是该分布的定义。(online.stat.psu.edu)

抽样分布取决于总体模型、样本量、统计量和抽样设计。即使是同一个统计量,有放回抽样、无放回抽样以及更复杂的抽样程序也可能产生不同的分布。(stat.berkeley.edu)

中心、变异性与估计

估计量抽样分布的中心通常用其期望值衡量。对于参数 θ\theta 的估计量 θ^\hat\theta,其偏差为

Bias⁡(θ^)=E(θ^)−θ.\operatorname{Bias}(\hat\theta)=E(\hat\theta)-\theta.

无偏估计量的抽样分布具有与目标参数相等的期望值;这并不意味着每次得到的估计值都等于该参数。(stat.berkeley.edu)

估计量的方差衡量其在重复抽样中的离散程度。抽样分布的标准差称为标准误:

SE⁡(θ^)=Var⁡(θ^).\operatorname{SE}(\hat\theta) =\sqrt{\operatorname{Var}(\hat\theta)}.

标准误描述统计量的不确定性,而各观测值的标准差描述原始数据的变异性。在实践中,标准误本身往往也需要根据样本进行估计。(online.stat.psu.edu)

均值的抽样分布

假设 X1,…,XnX_1,\ldots,X_n 是同分布且满足统计独立性的观测值,其均值为 μ\mu,有限方差为 σ2\sigma^2。它们的样本均值为

Xˉ=1n∑i=1nXi.\bar X=\frac{1}{n}\sum_{i=1}^{n}X_i.

其期望和方差分别为

E(Xˉ)=μ,Var⁡(Xˉ)=σ2n,E(\bar X)=\mu,\qquad \operatorname{Var}(\bar X)=\frac{\sigma^2}{n},

因此,其标准误为 σ/n\sigma/\sqrt n。在这些假设下,将样本量增至原来的四倍,会使标准误减半。如果总体服从正态分布,那么对于任何正整数样本量,都精确地有

Xˉ∼N(μ,σ2/n).\bar X\sim N(\mu,\sigma^2/n).

(online.stat.psu.edu)

对于从容量为 NN 的有限总体中进行的无放回简单随机抽样,观测值之间并不独立。如果总体方差的定义以 NN 为分母,则样本均值的方差为

Var⁡(Xˉ)=σ2nN−nN−1.\operatorname{Var}(\bar X) =\frac{\sigma^2}{n}\frac{N-n}{N-1}.

其中的附加因子反映了样本逐渐接近整个总体时不确定性的减小;普查不存在抽样变异性。(stat.berkeley.edu)

精确分布与近似分布

中心极限定理指出,对于独立同分布且方差有限并为正的观测值,

n(Xˉ−μ)σ→dN(0,1).\frac{\sqrt n(\bar X-\mu)}{\sigma} \xrightarrow{d}N(0,1).

因此,随着 nn 增大,采用正态分布近似样本均值的分布会逐渐变得适宜。该定理针对的是标准化后的均值,而不是原始观测值。不存在能够普遍保证近似准确的样本量阈值:高度偏斜的总体可能需要大得多的样本。(online.stat.psu.edu)

对于相互独立、服从成功概率为 pp 的伯努利分布的二元观测值,成功次数 KK 服从二项分布。因此,样本比例 p^=K/n\hat p=K/n 具有精确的离散抽样分布,且

E(p^)=p,SE⁡(p^)=p(1−p)n.E(\hat p)=p,\qquad \operatorname{SE}(\hat p)=\sqrt{\frac{p(1-p)}{n}}.

当预期成功次数和预期失败次数都足够大时,正态近似具有实用价值。(online.stat.psu.edu)

对于来自方差未知的正态总体、各观测值相互独立的样本,标准化统计量

T=Xˉ−μS/nT=\frac{\bar X-\mu}{S/\sqrt n}

服从自由度为 n−1n-1 的学生t分布,其中 SS 为通常定义的样本标准差。服从 tt 分布的是这个标准化统计量,而不是未经标准化的样本均值。(stat.umn.edu)

在统计推断中的作用

置信区间利用抽样分布中的概率,构建在重复抽样下具有指定覆盖率的区间方法。例如,在相关假设成立的条件下,95%置信区间构造方法在反复应用时,有95%的次数会使所得区间包含那个固定的参数;这一概率陈述针对的是观测数据之前的区间构造方法。(online.stat.psu.edu)

在统计假设检验中,需要将检验统计量与其在原假设下的抽样分布进行比较。P值是指,在该假设和所假定模型成立的条件下,按照检验规定的极端程度排序,得到至少与观测结果同样极端的结果的概率。(online.stat.psu.edu)

计算近似

当无法获得解析公式时,可以通过模拟样本来近似抽样分布。自助采样则利用已观测的样本近似未知总体,反复进行重采样并重新计算统计量。由此得到的自助分布用于估计给定观测数据条件下的抽样变异性;它并不等同于真实的抽样分布。(stat135.berkeley.edu)

重采样方案必须反映原始抽样过程。如果样本来自更复杂的抽样设计,对单个观测值进行普通重采样的方法可能失效。增加自助采样的重复次数可以提高数值精度,但无法消除原始样本或重采样假设中的缺陷。(stat20.berkeley.edu)