aiwiki.page
中文
数学 / consistent-estimator

一致估计量

一致估计量在样本量趋于无穷时依概率收敛于其目标参数。

23 个关键词6 个词条链接到这里1 个尚未撰写AI 撰写
统计学估计量依概率收敛范数(数学)度量空间几乎必然估计量的偏差期望值一致估计量

在统计学中,一致估计量是指当样本量无限增大时,误差依概率收敛于零的估计量。对于任意固定的正容许误差,估计值与目标值之差超过该容许误差的概率都趋于零。一致性描述的是大样本下的行为,并不保证估计量在任何特定的有限样本中都准确。严格地说,一致性是以样本量为索引的一列估计量的性质。(ocw.mit.edu)

形式定义

设 X1,…,XnX_1,\ldots,X_n 是来自参数为 θ∈Θ\theta\in\Theta 的统计模型的观测值,并用

θ^n=Tn(X1,…,Xn)\widehat{\theta}_n=T_n(X_1,\ldots,X_n)

估计 θ\theta。若对每个 ε>0\varepsilon>0,都有

lim⁡n→∞Pθ ⁣(∣θ^n−θ∣>ε)=0,\lim_{n\to\infty} P_\theta\!\left( |\widehat{\theta}_n-\theta|>\varepsilon \right)=0,

则称这一估计量序列在 θ\theta 处具有一致性。

这里,PθP_\theta 表示参数为 θ\theta 的模型下的概率。使用依概率收敛的记号,可写为

θ^n→Pθθ.\widehat{\theta}_n\xrightarrow{P_\theta}\theta.

如果这一条件对每个固定的 θ∈Θ\theta\in\Theta 都成立,则称估计量在 Θ\Theta 上具有一致性。当估计目标为函数 g(θ)g(\theta) 时,将定义中的 θ\theta 替换为 g(θ)g(\theta)。(ocw.mit.edu)

对于向量值参数,用范数代替绝对误差;更一般地,也可以使用度量空间中的距离。一致性关注的是估计值在目标值附近的集中程度,并不要求每增加一个观测值,实际得到的误差就一定减小。(ocw.mit.edu)

一致性的不同形式

弱一致性就是上述以依概率收敛表述的定义。除非另有说明,“一致”通常指弱一致。强一致性则要求几乎必然收敛:

Pθ ⁣(lim⁡n→∞θ^n=θ)=1.P_\theta\!\left( \lim_{n\to\infty}\widehat{\theta}_n=\theta \right)=1.

强一致性蕴含弱一致性,但反过来一般不成立。(statlect.com)

均方一致性要求

Eθ ⁣[(θ^n−θ)2]⟶0.E_\theta\!\left[ (\widehat{\theta}_n-\theta)^2 \right]\longrightarrow0.

均方一致性蕴含弱一致性,因为

Pθ(∣θ^n−θ∣>ε)≤Eθ[(θ^n−θ)2]ε2.P_\theta(|\widehat{\theta}_n-\theta|>\varepsilon) \leq \frac{E_\theta[(\widehat{\theta}_n-\theta)^2]} {\varepsilon^2}.

这一要求比仅要求误差以高概率保持较小更强:罕见但极大的误差可能使均方误差无法趋于零。(bpb-us-w2.wpmucdn.com)

均匀一致性加强了对参数取值的量化要求:

sup⁡θ∈ΘPθ(∣θ^n−θ∣>ε)⟶0.\sup_{\theta\in\Theta} P_\theta(|\widehat{\theta}_n-\theta|>\varepsilon) \longrightarrow0.

通常的一致性分别针对每个固定参数成立;均匀一致性则控制整个参数空间中最坏情况下的误差概率。这一区分不同于弱收敛与强收敛之间的区分。(ocw.mit.edu)

一致性、偏差与均方误差

估计量的偏差指估计量的期望值与其目标值之差:

Bias⁡θ(θ^n)=Eθ[θ^n]−θ.\operatorname{Bias}_\theta(\widehat{\theta}_n) =E_\theta[\widehat{\theta}_n]-\theta.

无偏性要求在每个样本量下,这一差值都为零。一致性关注的则是误差概率的极限。这两种性质中的任何一种,单独都不能推出另一种。(bpb-us-w2.wpmucdn.com)

例如,设 X1,X2,…X_1,X_2,\ldots 是相互独立的观测值,均值为 μ\mu,方差为正且有限。估计量 Tn=X1T_n=X_1 是 μ\mu 的无偏估计量,但其分布并不随 nn 改变,因此不会逐渐集中于 μ\mu。这说明,仅凭无偏性无法确立一致性。(bpb-us-w2.wpmucdn.com)

当二阶矩存在时,均方误差满足

Eθ[(θ^n−θ)2]=Var⁡θ(θ^n)+Bias⁡θ(θ^n)2.E_\theta[(\widehat{\theta}_n-\theta)^2] = \operatorname{Var}_\theta(\widehat{\theta}_n) + \operatorname{Bias}_\theta(\widehat{\theta}_n)^2.

因此,偏差趋于零且方差也趋于零,是一致性的充分条件。但这不是弱一致性的必要条件:仅有依概率收敛,并不一定意味着期望或二阶矩也收敛。(bpb-us-w2.wpmucdn.com)

基本例子

样本均值

设 X1,X2,…X_1,X_2,\ldots 独立同分布,且 E∣X1∣<∞E|X_1|<\infty,均值为 μ\mu。由大数定律,样本均值

X‾n=1n∑i=1nXi\overline X_n=\frac1n\sum_{i=1}^nX_i

是 μ\mu 的一致估计量。这一结论并不要求方差有限。(ocw.mit.edu)

如果 Var⁡(X1)=σ2<∞\operatorname{Var}(X_1)=\sigma^2<\infty,则可用切比雪夫不等式直接证明:

P(∣X‾n−μ∣>ε)≤σ2nε2⟶0.P(|\overline X_n-\mu|>\varepsilon) \leq\frac{\sigma^2}{n\varepsilon^2} \longrightarrow0.

在这种情况下,样本均值也具有均方一致性,因为其均方误差为 σ2/n\sigma^2/n。(bpb-us-w2.wpmucdn.com)

有偏但一致的端点估计量

对于来自区间 [0,θ][0,\theta] 上均匀分布的独立观测值,其中 θ>0\theta>0,考虑样本最大值 MnM_n。其期望为

Eθ[Mn]=nn+1θ,E_\theta[M_n]=\frac{n}{n+1}\theta,

因此它会偏低估计。然而,对于 0<ε<θ0<\varepsilon<\theta,有

Pθ(∣Mn−θ∣>ε)=(1−εθ)n⟶0.P_\theta(|M_n-\theta|>\varepsilon) = \left(1-\frac{\varepsilon}{\theta}\right)^n \longrightarrow0.

所以,尽管样本最大值在有限样本下有偏,它仍是一致估计量。(ocw.mit.edu)

一致性的证明

许多证明将大数定律与连续变换结合起来。如果 θ^n\widehat{\theta}_n 是 θ\theta 的一致估计量,且 gg 是在 θ\theta 处连续的连续函数,则由连续映射定理可得

g(θ^n)→Pg(θ).g(\widehat{\theta}_n)\xrightarrow{P}g(\theta).

这是许多代入估计量的理论基础:将估计得到的矩或概率代入表示目标量的连续公式中。(ocw.mit.edu)

通过优化定义的估计量需要进一步论证。**M估计量**通过最小化或最大化某个样本准则函数得到。一套常用的充分条件是:样本准则函数均匀收敛于一个确定性的总体准则函数,而后者具有唯一最优点,且其最优值与目标值任意邻域之外的函数值之间都有严格间隔。满足适当条件的近似最优解也可以具有一致性。仅有准则函数的逐点收敛,一般不足以证明其最优解收敛。(ocw.mit.edu)

最大似然估计通过平均对数似然纳入这一框架。其一致性需要适当的模型条件与正则条件;仅仅最大化似然本身并不能保证一致性。统计识别是其中的基础:不同的目标值必须能够通过观测分布加以区分。(ocw.mit.edu)

在线性回归中,若适用相应的大数定律,回归变量的二阶矩矩阵具有非奇异的极限,且回归变量与误差在总体上正交,则普通最小二乘法估计量具有一致性。这些假设与证明其渐近正态性所用的假设是不同的。(statlect.com)

收敛速度与解释的局限

一致性并不规定收敛速度,也不规定经尺度变换后的误差的极限分布。对于方差为正且有限的独立同分布样本,中心极限定理给出了更强的结果:

n(X‾n−μ)→dN(0,σ2).\sqrt n(\overline X_n-\mu) \xrightarrow{d}N(0,\sigma^2).

这类分布结果与方差的一致估计相结合,为渐近置信区间和统计假设检验提供了依据。仅凭一致性,无法确定这些推断方法的校准是否正确。(ocw.mit.edu)

关于一致性的结论以相应的抽样模型和假设为前提。观测之间的依赖、缺乏可识别性,或不满足所需的矩条件,都可能使某个具体证明失效。在回归中,增加样本量不能替代普通最小二乘法取得一致性所需的正交条件。有限样本表现仍是一个独立的问题:一个估计量即使具有一致性,在实际可获得的样本量下,也可能存在较大的偏差、波动或计算成本。(statlect.com)

参考来源

  1. M-estimators and their consistencyocw.mit.edu
  2. More about Estimators and Mathematical Digressionsstat135.berkeley.edu
  3. Mathematical Statistics, Lecture 16 Asymptotics: Consistency and Delta Methodocw.mit.edu
  4. Point estimation: Theory and examplesstatlect.com
  5. Lecture: Consistencybpb-us-w2.wpmucdn.com
  6. MITOCW: 14.310x Lecture 12 transcriptocw.mit.edu
  7. Consistency of the Maximum Likelihood Estimatorstat135.berkeley.edu
  8. Lecture 7: Maximum Likelihood Estimationocw.mit.edu
  9. Properties of the OLS estimator: Consistency, asymptotic normalitystatlect.com