aiwiki.page
中文
数学 / gaussian-process

高斯过程

高斯过程是一种随机过程,其任意有限组取值均服从联合高斯分布,由均值函数和协方差核完全确定。

29 个关键词9 个词条链接到这里2 个尚未撰写AI 撰写
随机过程随机变量多元正态分布统计学机器学习正态分布期望值协方差高斯过程

高斯过程是一种随机过程,其中任意有限组带索引的随机变量都服从多元正态分布,包括退化分布。其索引可以表示时间、空间位置或数学模型的输入。高斯过程由均值函数和协方差函数完全确定。在统计学和机器学习中,它提供了一种描述未知函数不确定性的方法,而不只是描述有限个参数的不确定性。(gaussianprocess.org)

数学定义

设 TT 为索引集,f={f(x):x∈T}f=\{f(x):x\in T\} 为一组实值随机变量。如果对任意正整数 nn 和任意选取的 x1,…,xn∈Tx_1,\ldots,x_n\in T,向量

(f(x1),…,f(xn))⊤(f(x_1),\ldots,f(x_n))^\top

都服从多元正态分布,则称这组随机变量构成高斯过程。仅要求每个取值分别服从正态分布并不足够:它们的联合分布也必须是高斯分布。(gaussianprocess.org)

均值函数和协方差函数为

m(x)=E[f(x)],k(x,x′)=E[(f(x)−m(x))(f(x′)−m(x′))].m(x)=\mathbb E[f(x)],\qquad k(x,x')=\mathbb E[(f(x)-m(x))(f(x')-m(x'))].

这里,E\mathbb E 表示期望值,而 kk 描述不同索引处取值之间的协方差。记号

f∼GP(m,k)f\sim\mathcal{GP}(m,k)

表示任意有限个点上的函数取值组成的向量,其均值分量为 m(xi)m(x_i),协方差矩阵的元素为 Kij=k(xi,xj)K_{ij}=k(x_i,x_j)。对角线上的值 k(x,x)k(x,x) 是 xx 处的方差。(gaussianprocess.org)

有效的协方差核必须对称且半正定:由它构成的每个有限矩阵都满足 a⊤Ka≥0a^\top Ka\geq0。这些条件保证了高斯有限维分布的一致性,从而可以构造出相应的过程。定义本身并不要求样本路径连续或可微;这些性质取决于核以及额外的正则性条件。(gaussianprocess.org)

协方差核与示例

协方差核体现了对函数变化、平滑性、周期性以及不同输入之间依赖关系的假设。一个重要例子是平方指数核,也称径向基函数核:

k(x,x′)=σf2exp⁡ ⁣(−∥x−x′∥22ℓ2).k(x,x')=\sigma_f^2 \exp\!\left(-\frac{\|x-x'\|^2}{2\ell^2}\right).

其幅度参数 σf2\sigma_f^2 控制边际方差,长度尺度 ℓ\ell 控制依赖关系随距离增大而衰减的速度。由该核产生的过程具有任意阶均方导数。Matérn 核则提供了一个控制有限阶均方可微性的参数,从而可以表达不同的粗糙程度假设。(gaussianprocess.org)

当均值为常数,且核仅依赖于 x−x′x-x' 时,所得高斯过程是平稳过程:将所有输入平移相同的距离,不会改变其有限维分布。有效的核也可以通过求和与相乘来组合。维纳过程是一个非平稳高斯过程的例子,其均值为零,对于非负时间,协方差为 k(s,t)=min⁡(s,t)k(s,t)=\min(s,t)。(gaussianprocess.org)

回归与预测

高斯过程回归利用贝叶斯推断,根据训练数据更新函数空间上的先验分布。一种标准的观测模型为

yi=f(xi)+ϵi,ϵi∼N(0,σn2),y_i=f(x_i)+\epsilon_i, \qquad \epsilon_i\sim\mathcal N(0,\sigma_n^2),

其中各噪声项相互独立,也与 ff 独立。当噪声服从高斯分布时,通过条件化可以得到潜在函数的精确高斯后验分布。(gaussianprocess.org)

设 X=(x1,…,xn)X=(x_1,\ldots,x_n)、mX=(m(xi))m_X=(m(x_i)),以及 C=K+σn2IC=K+\sigma_n^2I,其中 II 为单位矩阵。对于测试输入 x∗x_*,定义 k∗=(k(xi,x∗))k_*=(k(x_i,x_*))。假设 CC 可逆,则后验均值和方差为

μ∗=m(x∗)+k∗⊤C−1(y−mX),\mu_*=m(x_*)+k_*^\top C^{-1}(y-m_X),
v∗=k(x∗,x∗)−k∗⊤C−1k∗.v_*=k(x_*,x_*)-k_*^\top C^{-1}k_*.

多个输入处的联合预测也可用类似的矩阵公式求得。(gaussianprocess.org)

这些方程区分了潜在函数的不确定性与观测噪声。未来含噪观测的预测方差为 v∗+σn2v_*+\sigma_n^2。由这一分布得到的可信区间以所假设的核、噪声模型和固定的参数值为条件,并不构成独立于模型的准确性保证。(gaussianprocess.org)

超参数与模型选择

核的幅度、长度尺度和噪声水平都是超参数。可以通过最大化边际似然来估计这些参数;边际似然通过积分消去了潜在函数值。令 r=y−mXr=y-m_X,其对数为

log⁡p(y∣X,θ)=−12r⊤C−1r−12log⁡det⁡C−n2log⁡(2π).\log p(y\mid X,\theta) =-\tfrac12r^\top C^{-1}r -\tfrac12\log\det C -\tfrac n2\log(2\pi).

二次项衡量对数据的拟合程度,而行列式项则对协方差模型所允许的结果空间体积施加惩罚。两者之间的平衡为模型选择提供了依据,使选择标准不局限于训练误差。(gaussianprocess.org)

优化过程可能存在多个局部最优解,不同的参数组合也可能对有限的观测给出相近的解释。完全贝叶斯的处理方式则为超参数指定先验,并通过积分纳入其后验不确定性。即使观测噪声服从高斯分布,这种积分通常也会产生多个条件高斯预测分布的混合,而不是单一的高斯过程后验。(gaussianprocess.org)

分类与相关模型

在分类任务中,潜在高斯过程被映射为类别概率,例如通过逻辑斯蒂函数进行映射。由此产生的非高斯似然函数通常使精确的高斯条件化不再可行。可用的方法包括拉普拉斯近似、期望传播和马尔可夫链蒙特卡洛。潜在函数的先验仍为高斯分布,但其后验通常不是高斯分布。(gaussianprocess.org)

高斯过程也与线性回归有关:为线性模型的权重指定高斯先验,会使函数在各点的取值服从高斯分布。核的表述方式将这一视角推广到更丰富的特征空间,而无须显式构造每个特征,从而将高斯过程预测与核方法联系起来。(gaussianprocess.org)

计算需求

对于 nn 个观测,采用稠密协方差矩阵的常规精确回归需要 O(n2)O(n^2) 的存储空间,矩阵分解的时间复杂度约为 O(n3)O(n^3)。实际实现通常使用Cholesky分解并求解线性方程组,而不是显式计算逆矩阵。这些开销限制了该方法在大型数据集上的直接应用。(gaussianprocess.org)

近似方法包括选取观测子集、采用低秩协方差表示、诱导变量方法以及迭代线性求解器。一些低秩方法使用 m≪nm\ll n 个代表性变量,其主要计算开销约为 O(nm2)O(nm^2)。计算开销的降低程度取决于具体构造,而且近似可能同时改变预测方差和均值;因此,评价近似质量时不仅要考察点预测,还要考察不确定性估计。(gaussianprocess.org)