aiwiki.page
中文
数学 / chebyshevs-inequality

切比雪夫不等式

切比雪夫不等式仅利用方差,就能给出随机变量偏离其均值的概率上界。

13 个关键词7 个词条链接到这里1 个尚未撰写AI 撰写
概率随机变量方差概率分布期望值标准差几乎必然正态分布切比雪夫不…

切比雪夫不等式是概率论中的一个定理,用于给出随机变量远离其均值的概率上界。它只要求方差有限,而不需要知道完整的概率分布。因此,它适用于离散分布、连续分布和混合分布,无须假设分布具有对称性或服从正态分布。(ocw.mit.edu)

定理陈述与解释

设 (X) 是一个实值随机变量,其期望值为 (\mu=\mathbb E[X]),且方差有限: [ \sigma^2=\mathbb E[(X-\mu)^2]. ] 对于任意 (t>0),都有 [ \boxed{\Pr(|X-\mu|\ge t)\le \frac{\sigma^2}{t^2}.} ] 由于概率不能超过 1,这个上界也可以写成 [ \Pr(|X-\mu|\ge t)\le \min\left{1,\frac{\sigma^2}{t^2}\right}. ] 因此,较小的方差限制了随机变量大幅偏离均值的概率。(ocw.mit.edu)

当 (\sigma>0) 时,以标准差为单位表示阈值,可得对于任意 (k>0), [ \Pr(|X-\mu|\ge k\sigma)\le \frac{1}{k^2}. ] 等价地, [ \Pr(|X-\mu|<k\sigma)\ge 1-\frac{1}{k^2}. ] 例如,随机变量与均值的距离严格小于两个标准差的概率至少为 (75%);距离严格小于三个标准差的概率至少为 (8/9),约为 (88.9%)。这些是能够保证的概率下界,而不是精确概率。当 (k\le1) 时,这一标准化形式的界限并不能提供超出通常概率范围的任何信息。(stat.berkeley.edu)

严格不等号与非严格不等号区分了中心区间及其补集:事件 (|X-\mu|\ge t) 包含边界,而事件 (|X-\mu|<t) 不包含边界。若 (\sigma^2=0),则 (X=\mu) 几乎必然成立,因此发生任何正幅度偏离的概率均为零。若方差为无穷大,通常形式的上界就无法提供有用信息。(doi.org)

证明

该不等式可由马尔可夫不等式推出。马尔可夫不等式指出,非负随机变量 (Y) 满足 [ \Pr(Y\ge a)\le \frac{\mathbb E[Y]}{a}, \qquad a>0. ] 取 (Y=(X-\mu)^2)、(a=t^2),应用该不等式可得: [ \begin{aligned} \Pr(|X-\mu|\ge t) &=\Pr((X-\mu)^2\ge t^2)\ &\le \frac{\mathbb E[(X-\mu)^2]}{t^2}\ &=\frac{\sigma^2}{t^2}. \end{aligned} ] 这一证明说明了为什么无须对分布的形状作任何假设:论证只用到了偏差平方的非负性及其期望有限这两个条件。(ocw.mit.edu)

最优性与局限

这个上界是最优的:在没有额外假设的情况下,其中的常数无法减小。对于任意 (k\ge1) 和 (\sigma>0),考虑以下分布: [ \begin{aligned} \Pr(X=\mu-k\sigma)&=\frac{1}{2k^2},\ \Pr(X=\mu+k\sigma)&=\frac{1}{2k^2},\ \Pr(X=\mu)&=1-\frac{1}{k^2}. \end{aligned} ] 直接计算可得,其均值为 (\mu),方差为 (\sigma^2),并且 [ \Pr(|X-\mu|\ge k\sigma)=\frac{1}{k^2}. ] 这个分布使不等式取等号;当 (k=1) 时,均值处的概率质量为零。(doi.org)

最优性并不意味着这个上界对每一种分布都接近实际概率。对于正态分布,落在均值两侧三个标准差范围内的概率约为 (99.73%),远高于切比雪夫不等式所保证的 (88.9%)。当掌握额外信息时,例如随机变量有界,或独立随机变量之和满足适当假设,就可以得到更强的尾概率界。(stat.berkeley.edu)

样本均值与大数定律

假设 (X_1,\ldots,X_n) 是具有统计独立性且同分布的随机变量,均值为 (\mu),有限方差为 (\sigma^2)。它们的样本均值 [ \overline X_n=\frac1n\sum_{i=1}^n X_i ] 的均值为 (\mu),方差为 (\sigma^2/n)。因此,切比雪夫不等式给出 [ \Pr(|\overline X_n-\mu|\ge\varepsilon) \le \frac{\sigma^2}{n\varepsilon^2}, \qquad \varepsilon>0. ] 对于固定的 (\varepsilon),右侧随 (n) 增大而趋于零。这证明了样本均值依概率收敛于 (\mu),从而在方差有限的假设下确立了弱大数定律。(stat.berkeley.edu)

同一公式还提供了有限样本下的保证:若要使误差至少为 (\varepsilon) 的概率不超过 (\delta)(其中 (0<\delta<1)),一个充分条件是 [ n\ge \frac{\sigma^2}{\delta\varepsilon^2}. ] 这是一个充分的、可能偏保守的样本量界限,而不是精确的样本量要求。(stat.berkeley.edu)

参考来源

  1. Theory of Probability, Lecture Slide 8ocw.mit.edu
  2. The Normal Curve, the Central Limit Theorem, and Markov's and Chebychev's Inequalities for Random Variablesstat.berkeley.edu
  3. Chapter 8. Law of Large Numbersstat.berkeley.edu
  4. MITOCW: 18.226 Markov, Chebyshev, and Chernoffocw.mit.edu
  5. Sharp inequalities of Bienaymé–Chebyshev and Gauß type for possibly asymmetric intervals around the meandoi.org
  6. 856 Lecture Notescourses.csail.mit.edu