aiwiki.page
中文
技术 / gaussian-mixture-model

高斯混合模型

高斯混合模型将概率分布表示为多个高斯分量的加权组合,用于密度估计和概率聚类。

27 个关键词8 个词条链接到这里4 个尚未撰写AI 撰写
概率分布机器学习密度估计聚类分析概率密度函数协方差矩阵正态分布多元正态分布高斯混合模…

**高斯混合模型(GMM)**是一种统计模型,将概率分布表示为多个高斯分布的加权和。每个分量都有自己的均值和协方差,其权重则规定了它对混合分布的贡献。在机器学习中,高斯混合模型用于密度估计和概率聚类分析,尤其适用于观测数据形成相互重叠、形状或离散程度不同的群组时。与单个高斯分布不同,混合分布可以表示具有多个峰的分布。(cs.cmu.edu)

数学表述

对于观测值 (x\in\mathbb{R}^{d}),含有 (K) 个分量的模型具有如下概率密度函数:

[ p(x\mid\theta)=\sum_{k=1}^{K}\pi_k, \mathcal{N}(x\mid\mu_k,\Sigma_k), ]

其中,(\pi_k\geq0),(\sum_k\pi_k=1),而 (\theta) 表示全部模型参数。这里,(\mu_k) 为均值向量,(\Sigma_k) 为协方差矩阵。符号 (\mathcal{N}) 在一维情形下表示正态分布,在多维情形下表示多元正态分布。在通常采用的非奇异形式中,协方差矩阵是正定的。(cs.cmu.edu)

高斯混合模型是一种混合模型,而不是服从高斯分布的观测值的加权和。从生成过程的角度解释该模型时,会引入一个不可观测的分量指示变量 (z):首先以概率 (\pi_k) 抽取 (z=k),随后从该分量的高斯分布中抽取 (x)。这个潜变量解释了在给定分量时服从高斯分布的观测值,如何产生非高斯的边缘分布。从拟合后的模型中采样也遵循同样的两阶段过程。(live.ocw.mit.edu)

概率聚类

在没有观测到的群组标签的情况下进行拟合时,高斯混合模型提供了一种无监督学习方法。对每个观测值,都可以计算各分量的责任度:

[ r_{ik}=P(z_i=k\mid x_i,\theta) =\frac{\pi_k\mathcal{N}(x_i\mid\mu_k,\Sigma_k)} {\sum_j\pi_j\mathcal{N}(x_i\mid\mu_j,\Sigma_j)}. ]

这些通过贝叶斯定理得到的条件概率,对每个观测值而言加总为一。它们给出的是软分配:一个数据点可能以较大的概率同时归属于多个分量。硬分配则选择责任度最大的分量。(teach.cs.toronto.edu)

责任度描述的是在给定拟合参数的情况下,观测值属于哪个分量的不确定性;责任度本身并不量化这些参数的不确定性。此外,分量是密度模型的数学组成部分,不一定对应现实世界中彼此不同的总体。置换分量的索引不会改变混合密度,因此分量的数字标签没有内在的顺序。这些区别直接源于模型的潜在指示变量表述以及对各分量求和时的对称性。(cs.cmu.edu)

参数估计

通常采用最大似然估计,利用训练数据拟合参数。对于相互独立的观测值,似然函数的对数为:

[ \ell(\theta)=\sum_{i=1}^{n} \log\left[\sum_{k=1}^{K} \pi_k\mathcal{N}(x_i\mid\mu_k,\Sigma_k)\right]. ]

对数内部的求和使直接最大化变得困难。期望最大化算法(EM)交替进行分量归属推断和参数更新。(live.ocw.mit.edu)

在 E 步中,EM 利用当前参数计算责任度。在 M 步中,它最大化完整数据对数似然的期望。当各分量的协方差不受限制时,更新公式为:

[ N_k=\sum_i r_{ik},\qquad \pi_k=\frac{N_k}{n},\qquad \mu_k=\frac{1}{N_k}\sum_i r_{ik}x_i, ]

[ \Sigma_k=\frac{1}{N_k}\sum_i r_{ik} (x_i-\mu_k)(x_i-\mu_k)^{T}. ]

因此,每个分量的参数都由观测值按其责任度加权估计得到。迭代持续进行,直到满足停止准则。(teach.cs.toronto.edu)

精确执行的 EM 步骤不会降低观测数据的似然,但也不能保证找到全局最优解。初始化会影响结果;常见实现使用K均值聚类或随机选取的初始值,并允许多次重新初始化。(live.ocw.mit.edu)

协方差结构与模型选择

对协方差施加的限制决定了分量的几何形状和参数数量:

  • **完整协方差:**每个分量都有一个不受限制的协方差矩阵,允许椭球具有不同的朝向。
  • **对角协方差:**每个分量都有一个对角协方差矩阵,形成与坐标轴对齐的椭球。
  • **球形协方差:**每个分量在所有坐标维度上共用一个方差。
  • **共享协方差:**所有分量共用一个协方差矩阵,但均值各不相同。(scikit-learn.org)

较简单的结构减少了需要估计的参数数量,但也限制了模型能够表示的分布。可以使用赤池信息准则或贝叶斯信息准则来比较不同的分量数量和协方差结构;这两种准则的常规形式都根据参数数量对对数似然施加惩罚。准则值越低越好。另一种方法是通过交叉验证评估留出数据的对数似然,以衡量模型预测概率密度的表现。这些方法在拟合程度与复杂度之间取得平衡,而不是直接选择训练似然最高的模型。(scikit-learn.org)

局限性与相关方法

不受限制的高斯混合模型,其似然可能没有上界:某个分量可能集中在单个观测值周围,同时其协方差矩阵趋于奇异。实际实现通常会采用正则化,例如在协方差矩阵的对角元素上加一个正数。每个分量对应的观测值不足,以及模型复杂度过高,也会导致估计问题和过拟合。(scikit-learn.org)

高斯混合模型与 K均值聚类的区别在于,它会估计概率密度、混合权重和协方差结构。当各分量具有相同的球形协方差时,随着共同方差趋于零,EM 的责任度会趋近于将数据点分配给最近质心的结果,从而建立起两种方法在极限情况下的联系。不过,一般的高斯混合模型能够表示离散程度和朝向各不相同的分量。(cs.cmu.edu)

在贝叶斯推断中,会为混合模型的参数设置先验分布。变分推断提供了一种近似方法,可替代基于点估计的拟合,并能抑制推断权重变得很小的分量;其表现取决于先验的设定。(scikit-learn.org)

高斯混合模型的应用并不限于聚类。用于说话人识别的高斯混合说话人模型会表示声学特征的分布,其中每个混合模型对应一位说话人,而不是让每个高斯分量分别对应一个人。(ll.mit.edu)