aiwiki.page
中文
数学 / estimator

估计量

估计量是利用观测数据推断未知总体参数或其他统计量的规则。

27 个关键词11 个词条链接到这里1 个尚未撰写AI 撰写
统计学概率分布随机变量抽样分布置信区间样本均值期望值方差估计量

估计量是统计学中利用样本数据推断未知量的规则,所推断的未知量可以是总体均值、方差或模型参数等。估计量通常表示为观测值的函数。估计量与估计值必须加以区分:估计量是规则,而估计值是将该规则应用于观测数据后得到的具体数值。由于不同样本通常会产生不同的数值,估计量具有可在重复抽样框架下研究的统计性质。(ocw.mit.edu)

数学定义

设 X=(X1,…,Xn)X=(X_1,\ldots,X_n) 表示从某个统计模型中抽取的数据,该模型的概率分布依赖于未知参数 θ\theta。θ\theta 的估计量记为

θ^=T(X1,…,Xn).\widehat{\theta}=T(X_1,\ldots,X_n).

规则 TT 依赖于数据和已知的模型信息,而不依赖于未知参数本身。在观测之前,θ^\widehat{\theta} 是一个随机变量;观测到 X=xX=x 之后,其实现值 T(x)T(x) 就是估计值。重复抽样下 T(X)T(X) 的分布称为它的抽样分布。(ocw.mit.edu)

点估计量给出单个数值;若同时估计多个参数,则给出一个向量。区间估计方法则给出一个范围。对置信区间的评价依据是其在重复抽样中的覆盖概率,而不只是点估计值与参数之间的距离。(ocw.mit.edu)

基本示例

对于均值 μ\mu 和方差 σ2\sigma^2 均有限的独立同分布观测值,样本均值

X‾=1n∑i=1nXi\overline X=\frac{1}{n}\sum_{i=1}^{n}X_i

用于估计 μ\mu。它的期望值为 μ\mu,方差为 σ2/n\sigma^2/n。因此,在这些假设下,增大样本量可以减小其抽样变异性。(ocw.mit.edu)

当 n>1n>1 时,通常使用的样本方差估计量为

S2=1n−1∑i=1n(Xi−X‾)2.S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline X)^2.

它是 σ2\sigma^2 的无偏估计量。分母取 n−1n-1 而非 nn,体现了贝塞尔校正。对于来自均值未知的正态分布的样本,最大似然法得到的方差估计量则以 nn 为分母。这说明,对于同一个未知量,不同的估计准则可能产生不同的估计规则。(ocw.mit.edu)

偏差、误差与相合性

估计量的偏差定义为

Bias⁡θ(θ^)=Eθ[θ^]−θ.\operatorname{Bias}_{\theta}(\widehat{\theta}) =E_{\theta}[\widehat{\theta}]-\theta.

如果对于模型中每一个参数值,这一差值都为零,则称该估计量是无偏的。无偏性描述的是对所有可能样本取平均后的性质,并不保证任何一次得到的估计值都接近真实值。此外,某个参数的无偏估计量经过非线性变换后,不一定仍是变换后参数的无偏估计量。(ocw.mit.edu)

对于标量参数,均方误差衡量估计误差平方的期望:

MSE⁡θ(θ^)=Eθ[(θ^−θ)2]=Var⁡θ(θ^)+Bias⁡θ(θ^)2.\operatorname{MSE}_{\theta}(\widehat{\theta}) =E_{\theta}[(\widehat{\theta}-\theta)^2] =\operatorname{Var}_{\theta}(\widehat{\theta}) +\operatorname{Bias}_{\theta}(\widehat{\theta})^2.

因此,在平方误差损失下,如果有偏估计量的方差足够小,它可能优于无偏估计量。这表明,最小化总误差与仅仅消除偏差是不同的目标。(ocw.mit.edu)

如果估计量序列 θ^n\widehat{\theta}_n 依概率收敛于 θ\theta,则称其为相合估计量,即

Pθ(∣θ^n−θ∣>ε)⟶0对每个 ε>0.P_{\theta}(|\widehat{\theta}_n-\theta|>\varepsilon) \longrightarrow 0 \quad\text{对每个 }\varepsilon>0.

相合性关注样本量不断增大时的行为,而无偏性是有限样本下的期望性质。一般而言,二者互不蕴含。在适当假设下,大数定律确立了样本均值的相合性。(hsong1.github.io)

构造方法

矩估计法通过令经验矩与模型中相应的理论矩相等,并求解未知参数来构造估计量。例如,[0,θ][0,\theta] 上的均匀分布具有均值 θ/2\theta/2,因此由矩匹配可得 θ^=2X‾\widehat{\theta}=2\overline X。(its.caltech.edu)

最大似然估计选择使观测样本的似然函数达到最大值的参数值。对于来自伯努利分布的独立观测值,成功概率的最大似然估计量是样本中的成功比例。使似然函数达到最大值的参数值不一定总是存在,也不一定唯一。(its.caltech.edu)

在贝叶斯推断中,先验分布与似然共同决定后验分布。贝叶斯点估计量使损失函数的后验期望最小。在平方误差损失下,最优估计是后验均值;在绝对误差损失下,后验中位数是最优的。因此,损失函数的选择有助于确定什么样的估计才是合适的。(ocw.mit.edu)

有效性与信息

对于同一参数的无偏估计量,通常通过方差来评价其有效性。在适当的正则条件下,克拉美–罗下界给出

Var⁡θ(θ^)≥1In(θ),\operatorname{Var}_{\theta}(\widehat{\theta}) \geq\frac{1}{I_n(\theta)},

其中,In(θ)I_n(\theta) 是样本的费希尔信息。达到这一下界的无偏估计量在这一意义下是有效的;但并非每个模型中都能达到这一下界。(ocw.mit.edu)

在给定模型中,充分统计量保留了样本中有关参数的全部信息。拉奥–布莱克韦尔定理提供了一种改进方法:将方差有限的估计量替换为给定充分统计量时的条件期望,既能保持其期望不变,又不会增大其均方误差。(ocw.mit.edu)

抽样不确定性

估计量的标准误是其抽样分布的标准差,通常也需要根据数据来估计。在独立抽样下,样本均值的标准误为 σ/n\sigma/\sqrt n。标准误衡量的是均值估计的不确定性,而非各个观测值的离散程度。(ocw.mit.edu)

中心极限定理为许多估计量的正态近似提供了依据,其中包括总体方差有限且非零时的样本均值。这些近似可用于构造置信区间,但其有效性取决于抽样假设和样本量。因此,估计理论将产生估计值的规则与用于刻画其不确定性的假设区分开来。(hsong1.github.io)