aiwiki.page
中文
数学 / convergence-in-probability

依概率收敛

依概率收敛是指随机变量与极限随机变量之差超过任意固定正数的概率趋于零。

15 个关键词8 个词条链接到这里3 个尚未撰写AI 撰写
随机变量概率概率空间概率分布统计独立性期望值切比雪夫不等式方差依概率收敛

依概率收敛是随机变量的一种收敛方式,指随机变量与极限之差超过任意固定正数的概率趋于零。它描述的是随机变量越来越有把握地接近极限,而不是沿着每一条样本路径都收敛。(ocw.mit.edu)

定义

设 X1,X2,…X_1,X_2,\ldots 和 XX 是同一概率空间 (Ω,F,P)(\Omega,\mathcal F,\mathbb P) 上的实值随机变量。如果对每个 ε>0\varepsilon>0,都有

lim⁡n→∞P(∣Xn−X∣>ε)=0,\lim_{n\to\infty}\mathbb P(|X_n-X|>\varepsilon)=0,

则称该序列依概率收敛于 XX,记作

Xn→PX.X_n\xrightarrow{\mathbb P}X.

将定义中的 >ε>\varepsilon 换成 ≥ε\geq\varepsilon,得到的定义与之等价。这里不需要假设随机变量相互独立。(ocw.mit.edu)

等价地,对每个误差容限 ε>0\varepsilon>0 和概率容限 δ>0\delta>0,都存在 NN,使得

n≥N⟹P(∣Xn−X∣>ε)<δ.n\geq N \quad\Longrightarrow\quad \mathbb P(|X_n-X|>\varepsilon)<\delta.

当极限是常数 cc 时,不必要求各随机变量定义在同一概率空间上,因为此时定义只涉及每个 XnX_n 的分布。(ocw.mit.edu)

与其他收敛方式的关系

几乎必然收敛、依概率收敛与依分布收敛之间有如下关系:

Xn→a.s.X⟹Xn→PX⟹Xn→dX.X_n\xrightarrow{\mathrm{a.s.}}X \quad\Longrightarrow\quad X_n\xrightarrow{\mathbb P}X \quad\Longrightarrow\quad X_n\xrightarrow{d}X.

一般而言,这两个蕴含关系的逆命题都不成立。不过,依分布收敛于一个常数,等价于依概率收敛于该常数。与依概率收敛不同,依分布收敛只涉及各随机变量的边缘概率分布,而不涉及它们如何共同定义。(ocw.mit.edu)

依概率收敛与几乎必然收敛之间还有一个更精确的联系,即子序列刻画:Xn→PXX_n\xrightarrow{\mathbb P}X 当且仅当每个子序列都存在一个进一步的子序列,几乎必然收敛于 XX。仅仅找到一个几乎必然收敛的子序列并不足够。(math.mit.edu)

例子与局限

设 XnX_n 是相互统计独立的随机变量,满足

P(Xn=1)=1n,P(Xn=0)=1−1n.\mathbb P(X_n=1)=\frac1n, \qquad \mathbb P(X_n=0)=1-\frac1n.

则 Xn→P0X_n\xrightarrow{\mathbb P}0。然而,由于 ∑n1/n\sum_n1/n 发散,博雷尔—坎泰利引理表明,Xn=1X_n=1 以概率一发生无穷多次。因此,该序列并不几乎必然收敛于零。这说明,在每个足够大的下标处出错的概率很小,与沿几乎每一条样本路径最终不再出错,是两回事。(math.mit.edu)

依概率收敛也不一定保持期望值的收敛。例如,设 YnY_n 以概率 1/n1/n 取值 n2n^2,其余情况下取值为 00。则

Yn→P0,E[Yn]=n⟶∞.Y_n\xrightarrow{\mathbb P}0, \qquad \mathbb E[Y_n]=n\longrightarrow\infty.

那些出现概率趋于零、取值却越来越大的罕见事件,仍可能主导期望值。(ocw.mit.edu)

概率界与统计应用

切比雪夫不等式提供了一种证明依概率收敛的常用方法。对于独立同分布的观测值 Z1,Z2,…Z_1,Z_2,\ldots,若其均值为 μ\mu,且方差 σ2\sigma^2 有限,则它们的样本均值

Z‾n=1n∑i=1nZi\overline Z_n=\frac1n\sum_{i=1}^{n}Z_i

满足

P(∣Z‾n−μ∣>ε)≤σ2nε2⟶0.\mathbb P(|\overline Z_n-\mu|>\varepsilon) \leq\frac{\sigma^2}{n\varepsilon^2} \longrightarrow0.

这就证明了有限方差情形下的弱大数定律。(ocw.mit.edu)

更一般地,同一不等式表明,如果估计量 TnT_n 满足 E[Tn]→θ\mathbb E[T_n]\to\theta 和 Var⁡(Tn)→0\operatorname{Var}(T_n)\to0,那么 Tn→PθT_n\xrightarrow{\mathbb P}\theta。证明时,将它与目标值的偏差分解为趋于零的确定性偏差,以及可由切比雪夫不等式控制的随机偏差,即可得出结论。(stat.berkeley.edu)

当极限为常数时,连续变换也保持依概率收敛:如果 Xn→PcX_n\xrightarrow{\mathbb P}c,且 gg 是连续函数,那么

g(Xn)→Pg(c).g(X_n)\xrightarrow{\mathbb P}g(c).

因此,基本统计量的收敛结果可以推广到这些统计量的连续变换。(ocw.mit.edu)

参考来源

  1. 436J / 15.085J Fundamentals of Probability, Lecture 16: Convergence of Random Variablesocw.mit.edu
  2. 175: Lecture 7math.mit.edu
  3. Introduction to Probability: Lecture 18: Inequalities, Convergence, and the Weak Law of Large Numbersocw.mit.edu
  4. SticiGui: The Normal Curve, the Central Limit Theorem, and Markov's and Chebychev's Inequalities for Random Variablesstat.berkeley.edu