aiwiki.page
中文
数学 / estimator-bias

估计量的偏差

估计量的偏差是其在重复抽样下的期望值与所估计参数的真值之差。

22 个关键词24 个词条链接到这里AI 撰写
统计学期望值概率分布估计量抽样分布随机变量统计独立性方差估计量的偏…

在统计学中,估计量的偏差是估计量的期望值与被估计量的真值之差。它衡量的是重复抽样中系统性的高估或低估,而非某一次结果的误差。偏差是在特定统计模型或抽样设计下,估计方法所具有的性质;无偏的估计方法不一定在每个样本中都能给出准确的估计。(stat.berkeley.edu)

定义与解释

设 (X=(X_1,\ldots,X_n)) 表示从某个概率分布中抽取的数据,该分布由未知参数 (\theta) 决定。估计量 (T(X)) 是用于估计 (\theta) 的数据函数。在观测到数据之前,它是一个具有抽样分布的随机变量。只要期望存在,其偏差就定义为

[ b_T(\theta)=\operatorname{Bias}\theta(T) =\mathbb E\theta[T(X)]-\theta. ]

下标表示期望是在 (\theta) 所对应的分布下计算的。如果对于指定模型中的每一个参数值,都有 (b_T(\theta)=0),则称该估计量是无偏的。仅在某个特定参数值处无偏,并不能说明它在整个模型中都是无偏的。(statlect.com)

正偏差意味着估计量平均而言偏大,负偏差则意味着平均而言偏小。实际的估计误差可以分解为

[ T-\theta=b_T(\theta)+(T-\mathbb E_\theta T). ]

第二项的期望为零,代表随机的抽样波动。因此,无偏性关注的是抽样分布的中心,而不是其离散程度,也不是某个具体估计值与目标值有多接近。(stat.berkeley.edu)

基本例子

假设 (X_1,\ldots,X_n) 是同分布的观测值,且具有有限均值 (\mu)。由期望的线性性质,样本均值

[ \bar X=\frac1n\sum_{i=1}^n X_i ]

满足 (\mathbb E[\bar X]=\mu),因此它是 (\mu) 的无偏估计量。如果这些观测值还具有统计独立性,并且具有相同的有限方差 (\sigma^2),则 (\operatorname{Var}(\bar X)=\sigma^2/n)。这体现了无偏性与精度的区别:期望确定估计所针对的目标,而方差描述抽样的变异程度。(homepages.ecs.vuw.ac.nz)

一个典型的有偏估计量是以 (n) 为分母计算的样本方差。对于方差有限的独立同分布观测值,在 (n>1) 时,定义

[ V_n=\frac1n\sum_{i=1}^n(X_i-\bar X)^2. ]

则有

[ \mathbb E[V_n]=\frac{n-1}{n}\sigma^2, \qquad \operatorname{Bias}(V_n)=-\frac{\sigma^2}{n}. ]

将分母 (n) 替换为 (n-1),就能得到 (\sigma^2) 的无偏估计量;这一修正称为贝塞尔校正。不过,在均值未知的正态分布模型下,(V_n) 仍然是方差的最大似然估计量。因此,最大似然原则与无偏性要求不一定会选出同一个估计量。(stats-web.quarto.pub)

偏差、方差与估计损失

仅凭偏差无法判断估计量的优劣。在平方误差损失函数下,均方误差为

[ \operatorname{MSE}\theta(T) =\mathbb E\theta[(T-\theta)^2] =\operatorname{Var}_\theta(T)+b_T(\theta)^2. ]

当相关二阶矩有限时,这一恒等式成立。将误差围绕 (\mathbb E_\theta T) 展开即可得到该式;由于中心化后的估计量期望为零,交叉项随之消失。对于无偏估计量,均方误差等于方差。如果方差的减少足以抵消偏差平方带来的增加,有偏估计量也可以具有更小的均方误差。(bookdown.org)

例如,设 (K) 服从参数为 (n) 和 (p) 的二项分布。样本比例 (K/n) 是无偏的。对于平滑估计量

[ \tilde p=\frac{K+1}{n+2}, ]

直接计算可得

[ \operatorname{Bias}_p(\tilde p)=\frac{1-2p}{n+2}, \qquad \operatorname{Var}_p(\tilde p)=\frac{np(1-p)}{(n+2)^2}. ]

它将估计值向 (1/2) 收缩,并降低方差,但它在均方误差方面是否具有优势取决于 (p)。当 (p=1/2) 时,其偏差为零,方差也小于 (K/n) 的方差。(stat135.berkeley.edu)

这种偏差-方差权衡也出现在机器学习中。在线性回归中,岭回归通过正则化来收缩系数估计值。这种收缩通常会引入偏差,但与未加惩罚的拟合相比,可以减少变异并改善预测。其目标不一定是严格无偏,而是在所选损失函数下获得更低的期望预测误差。(stat.cmu.edu)

有限样本偏差与一致性

对于估计量序列 (T_n),渐近无偏性是指随着样本量增加,(\mathbb E_\theta[T_n]-\theta) 趋于零。上文的方差估计量 (V_n) 就具有这一性质,尽管在 (\sigma^2>0) 时,它对每个有限的 (n) 都是有偏的。相比之下,一致性是指依概率收敛于目标值:

[ \Pr_\theta(|T_n-\theta|>\varepsilon)\longrightarrow0 \quad\text{对每个 }\varepsilon>0. ]

它描述的是估计量集中在参数值附近,而不仅仅是期望的收敛。(stats-web.quarto.pub)

无偏性并不蕴含一致性:仅使用第一个观测值的估计量可以始终是总体均值的无偏估计量,但即使获得了更多观测值,其抽样分布也不会改变。一致性的一个实用充分条件是偏差和方差都趋于零。此时均方误差趋于零,对估计误差的平方应用切比雪夫不等式即可证明依概率收敛。(mcrovella.github.io)

偏差的估计与校正

如果期望可以通过解析方法求得,就有可能精确消除偏差。例如,若 (\mathbb E_\theta[T]=c\theta),其中 (c) 是已知的非零常数,则 (T/c) 是无偏的。这类校正依赖于具体模型,也不一定能使均方误差最小。(stat135.berkeley.edu)

无法精确计算偏差时,可以通过自助采样近似估计偏差。若 (T^{}) 表示根据自助样本数据计算出的估计量,则条件期望与原估计量之差 (\mathbb E_[T^{}]-T) 可用作自助法偏差估计。减去这一估计偏差后,得到 (2T-\mathbb E_[T^{*}])。其可靠性取决于自助分布对实际抽样分布的近似程度;通过估计进行校正,并不能保证严格无偏。(stat.cmu.edu)