aiwiki.page
中文
数学 / multivariate-normal-distribution

多元正态分布

每个线性组合都服从正态分布的随机向量的概率分布,由均值向量和协方差矩阵完全确定。

25 个关键词14 个词条链接到这里1 个尚未撰写AI 撰写
联合概率分布正态分布线性组合协方差矩阵随机变量期望值矩阵转置方差多元正态分…

多元正态分布是一种联合概率分布,将正态分布推广到同时考虑多个变量的情形。其定义性质是:各分量的任意线性组合都服从一元正态分布,其中也允许将常量视为方差为零的情形。多元正态分布由均值向量和协方差矩阵完全确定。它为描述相互关联的测量结果以及推导多元统计方法提供了数学框架。(www2.stat.duke.edu)

定义与参数

设 X=(X1,…,Xd)TX=(X_1,\ldots,X_d)^\mathsf{T} 是由实值随机变量组成的向量。记号

X∼Nd(μ,Σ)X\sim\mathcal N_d(\mu,\Sigma)

表示对任意 a∈Rda\in\mathbb R^d,均有

aTX∼N(aTμ,  aTΣa).a^\mathsf{T}X\sim \mathcal N(a^\mathsf{T}\mu,\;a^\mathsf{T}\Sigma a).

这里,μ=E[X]\mu=\mathbb E[X] 是由各分量的期望值组成的向量,而

Σ=E[(X−μ)(X−μ)T].\Sigma=\mathbb E[(X-\mu)(X-\mu)^\mathsf{T}].

上标 T\mathsf{T} 表示矩阵转置。Σ\Sigma 的对角元素是各分量的方差,非对角元素则是分量两两之间的协方差。该矩阵是对称半正定矩阵。(www2.stat.duke.edu)

一种等价的构造是 X=μ+AZX=\mu+AZ,其中 ZZ 由相互独立的标准正态随机变量组成,且 AAT=ΣAA^\mathsf{T}=\Sigma。这一构造也适用于奇异协方差矩阵。需要注意的是,各分量分别服从正态分布,并不能保证它们服从联合正态分布:定义要求的是所有线性组合都服从正态分布,而不只是各个坐标分量。(live.ocw.mit.edu)

密度与几何解释

当 Σ\Sigma 正定时,概率密度函数为

fX(x)=1(2π)d/2(det⁡Σ)1/2exp⁡ ⁣[−12(x−μ)TΣ−1(x−μ)].f_X(x)= \frac{1}{(2\pi)^{d/2}(\det\Sigma)^{1/2}} \exp\!\left[-\frac12 (x-\mu)^\mathsf{T}\Sigma^{-1}(x-\mu)\right].

行列式决定归一化因子,逆矩阵则决定如何对偏离均值的程度赋予权重。密度在 μ\mu 处取得唯一的最大值,等密度面是以 μ\mu 为中心的椭球面。在二维情形下,这些等密度曲线是椭圆。(ocw.mit.edu)

二次型

D2(x)=(x−μ)TΣ−1(x−μ)D^2(x)=(x-\mu)^\mathsf{T}\Sigma^{-1}(x-\mu)

是马哈拉诺比斯距离的平方。与普通距离不同,它同时考虑了各坐标尺度的差异以及坐标之间的依赖关系。Σ\Sigma 的特征向量给出椭球的主轴方向;各半轴的长度与相应特征值的平方根成正比。(alumni.media.mit.edu)

如果 Σ\Sigma 是奇异矩阵,该分布仍有良好的定义,但不存在相对于 dd 维体积的密度。它集中在一个仿射子空间上,该子空间的维数等于 Σ\Sigma 的秩。这种退化表示分量之间存在精确的线性约束,并不意味着概率模型无效。(ocw.mit.edu)

变换与独立性

仿射映射保持多元正态性。对于给定的矩阵 BB 和向量 bb,有

BX+b∼N(Bμ+b,  BΣBT).BX+b\sim \mathcal N(B\mu+b,\;B\Sigma B^\mathsf{T}).

因此,选取任意一组坐标分量所得到的边缘分布仍是多元正态分布,其参数为 μ\mu 中的相应分量和 Σ\Sigma 的相应主子矩阵。所以,即使线性投影降低了维数,所得分布仍是高斯分布。(www2.stat.duke.edu)

对于服从联合高斯分布的变量,协方差为零意味着统计独立性。特别地,协方差矩阵为对角矩阵意味着所有分量相互独立。更一般地,两个高斯子向量相互独立,当且仅当它们的交叉协方差矩阵为零。这一推论具有特殊性:在联合高斯情形之外,不相关的变量未必相互独立。(live.ocw.mit.edu)

条件分布

将向量及其参数分块为

X=(X1X2),μ=(μ1μ2),Σ=(Σ11Σ12Σ21Σ22).X=\begin{pmatrix}X_1\\X_2\end{pmatrix},\qquad \mu=\begin{pmatrix}\mu_1\\\mu_2\end{pmatrix},\qquad \Sigma= \begin{pmatrix} \Sigma_{11}&\Sigma_{12}\\ \Sigma_{21}&\Sigma_{22} \end{pmatrix}.

若 Σ22\Sigma_{22} 可逆,则在给定 X2=x2X_2=x_2 的条件下,X1X_1 的条件分布为正态分布,其参数为

μ1∣2=μ1+Σ12Σ22−1(x2−μ2),\mu_{1\mid2} =\mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2),
Σ1∣2=Σ11−Σ12Σ22−1Σ21.\Sigma_{1\mid2} =\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}.

因此,条件期望是观测值的仿射函数,而条件协方差不依赖于该观测值。这些公式解释了为什么高斯条件分布能够给出线性预测,并明确描述预测后仍然存在的不确定性。(online.stat.psu.edu)

例如,若两个分量的均值均为零、方差均为一,且其相关系数为 ρ\rho,其中 ∣ρ∣<1|\rho|<1,则

X1∣X2=x∼N(ρx,  1−ρ2).X_1\mid X_2=x\sim\mathcal N(\rho x,\;1-\rho^2).

这是分块公式在标量情形下的特例:观测一个分量会使另一个分量的预测均值发生偏移,并使其方差减小。(online.stat.psu.edu)

模拟与统计应用

模拟方法可直接由 X=μ+AZX=\mu+AZ 得到。对于正定的 Σ\Sigma,Cholesky分解给出满足 Σ=LLT\Sigma=LL^\mathsf{T} 的三角矩阵因子 LL;生成相互独立的标准正态随机变量,再计算 μ+LZ\mu+LZ,即可得到所需的样本。特征值分解则提供了适用于半正定协方差矩阵的构造方法,其中也包括奇异矩阵。(live.ocw.mit.edu)

多元中心极限定理从另一个角度说明了这一分布的重要性。对于均值为 μ\mu、协方差矩阵 Σ\Sigma 的各元素均有限的独立同分布随机向量,有

n(Xˉn−μ)→dNd(0,Σ).\sqrt n(\bar X_n-\mu) \xrightarrow{\mathrm d}\mathcal N_d(0,\Sigma).

因此,即使原始观测不服从高斯分布,经适当缩放的样本均值也会趋于高斯分布。(ocw.mit.edu)

在机器学习中,高斯过程的定义要求其任意有限个取值都服从多元正态分布。利用上述条件分布公式,便可根据观测数据和指定的协方差函数,得到未观测值的预测分布。(see.stanford.edu)