aiwiki.page
中文
数学 / sufficient-statistic

充分统计量

充分统计量在指定的统计模型下保留样本中关于未知参数的全部信息。

28 个关键词7 个词条链接到这里7 个尚未撰写AI 撰写
统计学罗纳德·费希尔联合概率分布函数条件概率概率分布概率密度函数概率质量函数充分统计量

充分统计量是观测数据的函数,在指定的统计学模型下,它保留了这些数据所提供的关于未知参数的全部信息。形式上,一旦知道其取值,原始数据的条件分布就不再依赖该参数。因此,充分性允许在不损失参数相关信息的前提下缩减数据,但不一定保留其他用途所需的信息。罗纳德·费希尔于 1922 年提出了这一概念。(stat.umn.edu)

定义与解释

设 X=(X1,…,Xn)X=(X_1,\ldots,X_n) 为一个样本,其联合概率分布属于分布族 {Pθ:θ∈Θ}\{P_\theta:\theta\in\Theta\}。统计量 T(X)T(X) 是观测值的函数,其中不含未知参数。如果给定 T(X)T(X) 时 XX 的条件分布可以选取为对所有 θ\theta 都相同的分布,则称 T(X)T(X) 对 θ\theta 是充分的。对于连续型观测,这一定义使用条件分布,而不是用零概率事件的概率作简单比值。(stat.cmu.edu)

充分性的含义取决于所采用的模型:它针对的是整个指定的概率分布族,而不仅是某一组已观测到的数据。完整样本始终是充分的,因此,仅有充分性并不保证能大幅压缩数据。充分统计量既可以是标量,也可以是向量。它本身的分布通常依赖于 θ\theta;不依赖参数的是给定该统计量后,数据中剩余变动的分布。(stat.cmu.edu)

因子分解定理

奈曼–费希尔因子分解定理提供了一种实用的判定方法。对于相对于同一个支配测度具有联合密度函数或联合质量函数 fθ(x)f_\theta(x) 的分布族,在满足通常的可测性条件时,TT 是充分统计量,当且仅当

fθ(x)=gθ(T(x))h(x),f_\theta(x)=g_\theta(T(x))h(x),

其中,hh 不依赖于 θ\theta,而 gθg_\theta 对观测值的依赖仅通过 T(x)T(x) 体现。这一表述既适用于概率密度函数,也适用于概率质量函数。(stat.cmu.edu)

因此,可以从该统计量重建似然函数,至多相差一个与参数无关的乘法因子。充分统计量取值相同的样本,其似然函数成比例。充分统计量经过任何可逆变换后仍然充分;在保留它的同时额外保留一些观测值,也不会破坏充分性,但多对一的变换则可能破坏充分性。(bookdown.org)

示例

假设各观测值相互独立,均服从成功概率为 pp 的伯努利分布。其联合质量函数为

fp(x)=p∑ixi(1−p)n−∑ixi.f_p(x)=p^{\sum_i x_i}(1-p)^{n-\sum_i x_i}.

因此,成功次数 T=∑iXiT=\sum_iX_i 是关于 pp 的充分统计量。给定 T=tT=t 后,所有恰好包含 tt 次成功的二元序列都等可能出现,且这种条件概率与 pp 无关。该统计量服从参数为 n,pn,p 的二项分布;在这一模型下,成功出现的次序不提供关于 pp 的额外信息。(stat.cmu.edu)

对于来自均值为 μ\mu、方差 σ2\sigma^2 已知的正态分布的独立观测值,样本均值 Xˉ\bar X 是关于 μ\mu 的充分统计量。当两个参数都未知时,一个充分统计量为

T(X)=(∑iXi, ∑iXi2).T(X)=\left(\sum_iX_i,\ \sum_iX_i^2\right).

当 n≥2n\geq2 时,这等价于保留样本均值和样本方差。对于不受限制的参数对 (μ,σ2)(\mu,\sigma^2),仅有样本均值并不充分。(stat.cmu.edu)

来自均值同为 λ\lambda 的泊松分布的独立观测值,同样以 ∑iXi\sum_iX_i 为充分统计量。给定这一总和后,各观测值之间计数的分配方式不依赖于 λ\lambda。(stat.cmu.edu)

最小充分性

最小充分统计量本身是充分的,并且在适当的几乎必然意义下,可以表示为任何其他充分统计量的函数。它体现了在保持充分性的同时,对样本所能作出的最大程度的缩减。“最小”指的是所保留的信息,而不只是表示时所用坐标的数量。不同的数值表示可能描述相同的最小充分信息。(stat.cmu.edu)

对于常见的、具有正密度的受支配模型,一个实用的判别准则是

T(x)=T(y)⟺fθ(x)fθ(y) 与 θ 无关。T(x)=T(y) \quad\Longleftrightarrow\quad \frac{f_\theta(x)}{f_\theta(y)} \text{ 与 }\theta\text{ 无关。}

这一准则将似然函数成比例的样本归为一组。当密度可能为零时,还必须考虑支撑集的条件,而不能直接除以零。泊松样本的总和是最小充分统计量。相比之下,在尺度参数已知的柯西位置模型中,将样本值按大小排序所得的样本是最小充分统计量:可以舍去观测值的原始次序,但一般不能将数据缩减为几个常用的概括性统计量。(stat.cmu.edu)

指数族

充分统计量在指数族中自然出现。若单个观测值的密度为

fθ(x)=h(x)exp⁡ ⁣{∑j=1kηj(θ)tj(x)−A(θ)},f_\theta(x)=h(x) \exp\!\left\{\sum_{j=1}^{k}\eta_j(\theta)t_j(x)-A(\theta)\right\},

且支撑集不依赖于参数,那么独立同分布样本的一个充分统计量为

(∑it1(Xi),…,∑itk(Xi)).\left(\sum_i t_1(X_i),\ldots,\sum_i t_k(X_i)\right).

其分量个数不会随样本量增加。因子分解定理可直接证明这一结果。伯努利、泊松和正态模型说明,为了对模型参数进行推断,规模不断增长的数据集可以用长度固定的汇总量表示。这种表示具有充分性,但最小充分性还需要额外条件。(live.ocw.mit.edu)

估计与贝叶斯推断

拉奥–布莱克韦尔定理将充分性与估计联系起来。如果 U(X)U(X) 是具有有限二阶矩的无偏估计量,且 TT 是充分统计量,那么

U∗(T)=E[U(X)∣T]U^*(T)=\mathbb E[U(X)\mid T]

也是无偏的,且其方差不大于 UU 的方差。充分性保证这一条件期望可以在不知道 θ\theta 的情况下定义。如果 TT 还具有完备性,那么莱曼–谢费定理表明:若存在 TT 的无偏函数,它就是唯一的一致最小方差无偏估计量。完备性与充分性是不同的性质。(bookdown.org)

在贝叶斯推断中,若先验分布固定且后验分布有良好定义,因子分解便意味着后验分布对观测值的依赖仅通过充分统计量体现。同样,最大似然估计也可以使用缩减后的似然函数。这些结论针对的是所假定模型内的推断:被舍弃的数据,对于检验模型假设或研究该模型之外的问题,仍可能很重要。(stat.umn.edu)