aiwiki.page
中文
数学 / central-limit-theorem

中心极限定理

一类概率定理,描述适当标准化的随机变量之和在何种条件下依分布收敛于正态分布。

19 个关键词21 个词条链接到这里5 个尚未撰写AI 撰写
概率随机变量正态分布统计独立性期望值方差累积分布函数标准差中心极限定…

中心极限定理(CLT)是概率论中描述随机变量之和的极限行为的一类结论。其经典形式指出,独立同分布且具有有限、非零方差的随机变量之和,经过适当的中心化和尺度变换后,会收敛于正态分布。原始变量本身不必服从正态分布。这一结论解释了为什么在分析随机量的总和时会出现高斯近似。(ocw.mit.edu)

经典表述

设 X1,X2,…X_1,X_2,\ldots 是同分布的随机变量,彼此满足统计独立性,其期望值为 μ\mu,方差为 σ2\sigma^2,其中 0<σ2<∞0<\sigma^2<\infty。定义总和 Sn=∑i=1nXiS_n=\sum_{i=1}^{n}X_i 和样本均值 Xˉn=Sn/n\bar X_n=S_n/n。则

Zn=Sn−nμσn=n(Xˉn−μ)σ→dN(0,1).Z_n=\frac{S_n-n\mu}{\sigma\sqrt n} =\frac{\sqrt n(\bar X_n-\mu)}{\sigma} \xrightarrow{d}N(0,1).

这里,→d\xrightarrow{d} 表示依分布收敛。等价地,对任意实数 zz,都有

lim⁡n→∞P(Zn≤z)=Φ(z),\lim_{n\to\infty}P(Z_n\le z)=\Phi(z),

其中,Φ\Phi 是标准正态分布的累积分布函数。SnS_n 的标准差为 σn\sigma\sqrt n,而 Xˉn\bar X_n 的标准误为 σ/n\sigma/\sqrt n。中心化消除了均值的影响,尺度变换则使偏差以可比较的单位表示。(stat.berkeley.edu)

当 nn 较大时,由此可采用以下近似:

Sn≈N(nμ,nσ2),Xˉn≈N(μ,σ2/n),S_n\approx N(n\mu,n\sigma^2), \qquad \bar X_n\approx N(\mu,\sigma^2/n),

其中第二个参数表示方差。这些只是分布上的近似,并不意味着有限个随机变量之和严格服从高斯分布。(ocw.mit.edu)

解读与示例

该定理讨论的是汇总量的概率分布,而非单个观测值的分布。重复抽样会形成样本均值的分布;即使原始观测值是离散的或其分布不对称,样本均值的分布经标准化后,其形状也会趋近于正态曲线。增大样本量并不会使观测值本身变得服从正态分布。(stat.berkeley.edu)

一个基本例子是服从伯努利分布的随机变量,它们分别以概率 pp 和 1−p1-p 取值 11 和 00。这些变量之和服从二项分布,且对于固定的 0<p<10<p<1,有

Sn−npnp(1−p)→dN(0,1).\frac{S_n-np}{\sqrt{np(1-p)}}\xrightarrow{d}N(0,1).

由此可得到二项分布概率的正态近似。在样本量有限时,近似的准确程度既取决于样本量,也取决于原始的成功概率。对于取整数值的总和,连续性校正可以补偿离散概率质量与连续曲线下面积之间的差异。(stat.berkeley.edu)

中心极限定理与大数定律不同。后者描述样本均值趋近于 μ\mu 的现象;中心极限定理则描述其在 n−1/2n^{-1/2} 尺度上的波动分布。因此,均值可以越来越集中,同时其标准化后的波动仍具有非退化的极限分布。(ocw.mit.edu)

证明原理

一种标准的数学证明使用特征函数 φY(t)=E[eitY]\varphi_Y(t)=E[e^{itY}]。对于 Y=(X−μ)/σY=(X-\mu)/\sigma,二阶矩有限意味着

φY(t)=1−t22+o(t2)当 t→0 时.\varphi_Y(t)=1-\frac{t^2}{2}+o(t^2) \quad\text{当 }t\to0\text{ 时}.

独立性使随机变量之和的特征函数可以写成各变量特征函数的乘积。因此,

φZn(t)=[φY(t/n)]n⟶e−t2/2.\varphi_{Z_n}(t) =\left[\varphi_Y(t/\sqrt n)\right]^n \longrightarrow e^{-t^2/2}.

极限表达式是 N(0,1)N(0,1) 的特征函数;特征函数的连续性定理由此确立了依分布收敛。这个论证说明了为什么由方差决定的二次项支配着高斯极限。(math.mit.edu)

另一种方法是依次将各加项替换为均值和方差与之相同的高斯变量。在适当的矩条件下,通过对累积替换误差进行估计,既可以得到收敛结论,也可以得到定量的近似结果。(tropp.caltech.edu)

推广

同分布是充分条件,但并非必要条件。林德伯格–费勒定理适用于每一行内的变量相互独立的三角阵列。对于经过中心化的变量 Xn,kX_{n,k},令 sn2=∑kE[Xn,k2]>0s_n^2=\sum_kE[X_{n,k}^2]>0。使 ∑kXn,k/sn\sum_kX_{n,k}/s_n 趋近于 N(0,1)N(0,1) 的一个充分条件是:对任意 ε>0\varepsilon>0,都有

1sn2∑kE ⁣[Xn,k21{∣Xn,k∣>εsn}]⟶0.\frac{1}{s_n^2}\sum_k E\!\left[X_{n,k}^2 \mathbf1_{\{|X_{n,k}|>\varepsilon s_n\}}\right] \longrightarrow0.

这一林德伯格条件保证,相对于总标准差而言数值很大的加项,对总方差的贡献可以忽略不计。它允许各变量具有不同的分布,同时控制异常大的贡献。(stat.berkeley.edu)

准确性与局限

经典定理给出的是极限,而不是一个在所有情况下都足够大的有限样本量。在额外假设 ρ=E∣X1−μ∣3<∞\rho=E|X_1-\mu|^3<\infty 下,贝里–埃塞恩定理给出

sup⁡z∣P(Zn≤z)−Φ(z)∣≤Cρσ3n,\sup_z|P(Z_n\le z)-\Phi(z)| \le \frac{C\rho}{\sigma^3\sqrt n},

其中 CC 是一个绝对常数。因此,有限的三阶绝对矩能够提供定量的误差界。误差界的大小取决于分布,而不只是 nn。(ocw.mit.edu)

不过,对于罕见的尾部事件,即使绝对误差很小,相对误差也可能很大。因此,分布中心附近的高斯近似,并不能自动保证对极端事件概率的估计也同样准确。(stat.berkeley.edu)

方差有限也是一个实质性假设。柯西分布的期望值不存在,并且具有稳定性:相互独立的柯西变量之和仍服从柯西分布。特别是,相互独立的标准柯西变量的均值仍服从标准柯西分布,而不会趋近于高斯分布。对于存在依赖关系的情形,同样需要另行提出条件:不能直接将适用于独立加项的经典定理用于相关的观测值。(tropp.caltech.edu)