aiwiki.page
中文
技术 / density-estimation

密度估计

密度估计通过参数模型、非参数平滑或灵活的学习分布,从观测数据推断其背后的概率密度。

26 个关键词5 个词条链接到这里3 个尚未撰写AI 撰写
统计学机器学习概率密度函数无监督学习概率分布随机变量积分累积分布函数密度估计

密度估计是统计学和机器学习中根据观测数据估计未知概率密度函数的任务。它不只是用均值或方差描述数据,而是重建分布的形状,包括数据的集中区域、不对称性以及多个峰。相关方法既包括拟合指定的分布族,也包括构建复杂度随可用数据量增加的灵活估计。由于观测数据不必带有目标标签,密度估计通常被视为无监督学习。(stat.cmu.edu)

数学表述

假设 X1,…,XnX_1,\ldots,X_n 是来自同一连续概率分布的独立观测值,该分布的密度 ff 未知。密度估计量 f^n\hat f_n 是一个依赖于数据的函数,用于近似 ff。有效的估计密度满足

f^n(x)≥0,∫f^n(x) dx=1.\hat f_n(x)\geq 0,\qquad \int \hat f_n(x)\,dx=1.

对于随机变量 XX,可通过积分求得其落在某一区间内的估计概率:

Pr⁡^(a≤X≤b)=∫abf^n(x) dx.\widehat{\Pr}(a\leq X\leq b)=\int_a^b\hat f_n(x)\,dx.

因此,密度曲线的高度本身并不是事件的概率;概率对应的是曲线下的面积。(stat.cmu.edu)

估计密度与估计累积分布函数有所不同。经验累积分布为每个观测值赋予相同的概率质量,是一个阶梯函数。虽然它能直接估计累积概率,却不能给出观测值之间的平滑密度。密度估计通过引入模型或平滑机制来描述这些中间区域。(stat.cmu.edu)

参数方法与混合模型方法

参数估计假设 ff 属于一个由有限个参数描述的分布族 f(x;θ)f(x;\theta)。例如,正态分布由其均值和方差确定。参数可以通过最大似然估计拟合,即最大化

∑i=1nlog⁡f(Xi;θ).\sum_{i=1}^{n}\log f(X_i;\theta).

当假定的分布族合适时,这种方法可以具有较高的统计效率,但即使样本量很大,其对分布形状的限制仍然存在。例如,单个正态密度无法表示两个彼此分离的峰。(stat.cmu.edu)

高斯混合模型具有更强的灵活性:

f(x)=∑j=1mπj ϕ(x;μj,Σj),πj≥0,∑jπj=1.f(x)=\sum_{j=1}^{m}\pi_j\,\phi(x;\mu_j,\Sigma_j), \qquad \pi_j\geq0,\quad \sum_j\pi_j=1.

每个分量都有自己的均值和协方差,权重则决定各分量的贡献。参数通常使用期望最大化算法拟合。确定分量数是一个独立的模型选择问题。当某个分量收缩到一个观测值周围时,不受约束的高斯混合模型的似然可能趋于无穷大;对协方差进行正则化可以限制这种退化现象。(scikit-learn.org)

直方图与核估计量

直方图将观测空间划分为若干组。在一维情形下,一个包含 njn_j 个观测值、宽度为 wjw_j 的组,其密度为 nj/(nwj)n_j/(nw_j)。由此得到的估计是分段常数函数。组的宽度和位置都会影响直方图的形状:即使数据不变,移动分组边界也可能改变图中呈现的峰。(stat.cmu.edu)

核密度估计用以各观测值为中心的局部贡献代替分组:

f^h(x)=1nh∑i=1nK ⁣(x−Xih).\hat f_h(x)=\frac{1}{nh}\sum_{i=1}^{n} K\!\left(\frac{x-X_i}{h}\right).

其中,KK 是积分为 1 的非负核函数,h>0h>0 是带宽。高斯核在每个观测值周围形成一个钟形凸起;对这些凸起取平均便得到平滑的密度。其他选择包括均匀核和 Epanechnikov 核。使用高斯形状的凸起并不意味着底层分布是高斯分布。(stat.cmu.edu)

带宽控制着偏差-方差权衡。较小的带宽能够保留细节,但也会放大抽样波动,并可能产生虚假的峰。较大的带宽可以减少变异,却可能掩盖真实的结构。通常,带宽比核函数的具体形状更重要。带宽选择方法包括参考分布规则、代入估计和交叉验证。(stat.cmu.edu)

准确性与维数

一种常用的理论评价准则是平均积分平方误差:

MISE⁡(f^)=E ⁣[∫(f^(x)−f(x))2 dx].\operatorname{MISE}(\hat f) =\mathbb E\!\left[\int(\hat f(x)-f(x))^2\,dx\right].

它综合了整个定义域上的估计量的偏差平方和抽样方差。在适当的正则条件下,如果带宽逐渐减小,同时 nhnh 无界增长,一维核估计量就是相合估计量。对于足够光滑的密度和常规的二阶核,渐近最优带宽按 n−1/5n^{-1/5} 的尺度变化,对应的 MISE 为 n−4/5n^{-4/5} 阶。这些收敛速率取决于对光滑性和估计量的假设。(stat.cmu.edu)

预测性能也可以通过留出数据上的对数似然评估,这与KL散度密切相关。在未参与拟合的观测数据上进行评估,有助于区分可泛化的分布结构与过拟合。(stat.cmu.edu)

多元密度估计的目标是联合概率分布。核方法可以扩展到多个维度,但随着维数增加,局部邻域内的样本会变得稀疏,这就是维数灾难。边界偏差是另一项局限:普通核可能会将概率质量分配到允许的定义域之外,从而使边界附近的估计失真。(scikit-learn.org)

神经网络与条件密度估计

灵活的神经网络方法包括自回归模型和归一化流。归一化流通过可逆且可微的映射,对一个简单的基础分布进行变换。利用含有雅可比矩阵行列式的变量替换公式,可以显式求出变换后的密度。网络架构决定了模型拟合、密度计算与采样之间的计算权衡。(jmlr.org)

条件密度估计对 f(y∣x)f(y\mid x) 建模,而不是对无条件密度建模。它描述给定解释变量时结果变量的完整分布,包括随条件变化的离散程度以及可能存在的多个众数,而不只是预测条件均值。这类模型可用于概率预测,无条件密度估计则还可用于分布可视化和生成式采样。(stat.cmu.edu)

参考来源

  1. 36-402, Undergraduate Advanced Data Analysis (2011)stat.cmu.edu
  2. Estimating Distributions and Densitiesstat.cmu.edu
  3. 8. Density Estimation — scikit-learn 1.5.2 documentationscikit-learn.org
  4. 1. Gaussian mixture models — scikit-learn 1.1.3 documentationscikit-learn.org
  5. Supervised Learningstat.cmu.edu
  6. Data Visualizationstat.cmu.edu
  7. Visualizing Quantitative Distributionsstat.cmu.edu
  8. All of Nonparametric Statisticsstat.cmu.edu
  9. Normalizing Flows for Probabilistic Modeling and Inferencejmlr.org