中心极限定理(CLT)是概率论中描述随机变量之和的极限行为的一类结论。其经典形式指出,独立同分布且具有有限、非零方差的随机变量之和,经过适当的中心化和尺度变换后,会收敛于正态分布。原始变量本身不必服从正态分布。这一结论解释了为什么在分析随机量的总和时会出现高斯近似。(ocw.mit.edu)
经典表述
设 X1,X2,… 是同分布的随机变量,彼此满足统计独立性,其期望值为 μ,方差为 σ2,其中 0<σ2<∞。定义总和 Sn=∑i=1nXi 和样本均值 Xˉn=Sn/n。则
Zn=σnSn−nμ=σn(Xˉn−μ)dN(0,1).
这里,d 表示依分布收敛。等价地,对任意实数 z,都有
n→∞limP(Zn≤z)=Φ(z),
其中,Φ 是标准正态分布的累积分布函数。Sn 的标准差为 σn,而 Xˉn 的标准误为 σ/n。中心化消除了均值的影响,尺度变换则使偏差以可比较的单位表示。(stat.berkeley.edu)
当 n 较大时,由此可采用以下近似:
Sn≈N(nμ,nσ2),Xˉn≈N(μ,σ2/n),
其中第二个参数表示方差。这些只是分布上的近似,并不意味着有限个随机变量之和严格服从高斯分布。(ocw.mit.edu)
解读与示例
该定理讨论的是汇总量的概率分布,而非单个观测值的分布。重复抽样会形成样本均值的分布;即使原始观测值是离散的或其分布不对称,样本均值的分布经标准化后,其形状也会趋近于正态曲线。增大样本量并不会使观测值本身变得服从正态分布。(stat.berkeley.edu)
一个基本例子是服从伯努利分布的随机变量,它们分别以概率 p 和 1−p 取值 1 和 0。这些变量之和服从二项分布,且对于固定的 0<p<1,有
np(1−p)Sn−npdN(0,1).
由此可得到二项分布概率的正态近似。在样本量有限时,近似的准确程度既取决于样本量,也取决于原始的成功概率。对于取整数值的总和,连续性校正可以补偿离散概率质量与连续曲线下面积之间的差异。(stat.berkeley.edu)
中心极限定理与大数定律不同。后者描述样本均值趋近于 μ 的现象;中心极限定理则描述其在 n−1/2 尺度上的波动分布。因此,均值可以越来越集中,同时其标准化后的波动仍具有非退化的极限分布。(ocw.mit.edu)
证明原理
一种标准的数学证明使用特征函数 φY(t)=E[eitY]。对于 Y=(X−μ)/σ,二阶矩有限意味着
φY(t)=1−2t2+o(t2)当 t→0 时.
独立性使随机变量之和的特征函数可以写成各变量特征函数的乘积。因此,
φZn(t)=[φY(t/n)]n⟶e−t2/2.
极限表达式是 N(0,1) 的特征函数;特征函数的连续性定理由此确立了依分布收敛。这个论证说明了为什么由方差决定的二次项支配着高斯极限。(math.mit.edu)
另一种方法是依次将各加项替换为均值和方差与之相同的高斯变量。在适当的矩条件下,通过对累积替换误差进行估计,既可以得到收敛结论,也可以得到定量的近似结果。(tropp.caltech.edu)
推广
同分布是充分条件,但并非必要条件。林德伯格–费勒定理适用于每一行内的变量相互独立的三角阵列。对于经过中心化的变量 Xn,k,令 sn2=∑kE[Xn,k2]>0。使 ∑kXn,k/sn 趋近于 N(0,1) 的一个充分条件是:对任意 ε>0,都有
sn21k∑E[Xn,k21{∣Xn,k∣>εsn}]⟶0.
这一林德伯格条件保证,相对于总标准差而言数值很大的加项,对总方差的贡献可以忽略不计。它允许各变量具有不同的分布,同时控制异常大的贡献。(stat.berkeley.edu)
准确性与局限
经典定理给出的是极限,而不是一个在所有情况下都足够大的有限样本量。在额外假设 ρ=E∣X1−μ∣3<∞ 下,贝里–埃塞恩定理给出
zsup∣P(Zn≤z)−Φ(z)∣≤σ3nCρ,
其中 C 是一个绝对常数。因此,有限的三阶绝对矩能够提供定量的误差界。误差界的大小取决于分布,而不只是 n。(ocw.mit.edu)
不过,对于罕见的尾部事件,即使绝对误差很小,相对误差也可能很大。因此,分布中心附近的高斯近似,并不能自动保证对极端事件概率的估计也同样准确。(stat.berkeley.edu)
方差有限也是一个实质性假设。柯西分布的期望值不存在,并且具有稳定性:相互独立的柯西变量之和仍服从柯西分布。特别是,相互独立的标准柯西变量的均值仍服从标准柯西分布,而不会趋近于高斯分布。对于存在依赖关系的情形,同样需要另行提出条件:不能直接将适用于独立加项的经典定理用于相关的观测值。(tropp.caltech.edu)