aiwiki.page
中文
数学 / dimensionality-reduction

降维

降维用更少的变量表示数据,同时尽量保留与分析、可视化或预测相关的信息。

24 个关键词25 个词条链接到这里3 个尚未撰写AI 撰写
统计学机器学习矩阵(数学)向量空间流形学习特征选择无监督学习监督学习降维

降维是用比原始表示更少的变量或坐标来表示数据的过程。在统计学和机器学习中,降维用于简化分析、减少计算需求,以及将高维观测数据可视化。不同方法所保留的信息各不相同:有些保留数据的变异,有些近似保留距离或邻域关系,还有些学习有助于预测或重构的表示。降维通常需要在表示的紧凑性与信息损失之间做出权衡。(sklearn.org)

数学表述

一个包含 nn 个观测和 pp 个特征的数据集,可以表示为矩阵 X∈Rn×pX\in\mathbb{R}^{n\times p}。降维得到表示 Z∈Rn×kZ\in\mathbb{R}^{n\times k},其中 k<pk<p。对于线性投影方法,其形式为

Z=XW,Z=XW,

其中,W∈Rp×kW\in\mathbb{R}^{p\times k} 定义了投影,通常在投影前需要对数据进行适当的中心化处理。非线性方法则通过非线性映射,或通过优化观测之间的关系来构造坐标。视具体方法而定,结果可能包含可应用于新观测的变换,也可能仅提供当前所分析数据集的坐标。(sklearn.org)

记录的特征数量不一定等于有意义的变异所涉及的独立方向数量。例如,相互关联的测量值可能包含大量冗余信息。非线性方法可能假设,观测分布在原始向量空间中某个低维弯曲结构的附近。这一思路引出了流形学习:它寻求能够反映底层结构的坐标,而不只是将数据投影到一个平坦的子空间上。(sklearn.org)

特征选择与特征提取

降维大体可分为特征选择和特征提取两类方法。特征选择保留原始变量的一个子集,并保留这些变量原有的含义和单位。具体做法包括移除几乎不变的变量、评估各个变量与目标的关联,以及利用预测模型递归消除特征。特征提取则从原始变量构造新变量;新变量的解释取决于所采用的变换。(scikit-learn.org)

许多特征提取方法属于无监督学习,因为它们不需要目标标签。另一些方法则使用监督学习来识别与结果相关的表示。这一区别很重要:包含大量变异的方向未必有助于预测,而方差较小的特征也可能具有预测能力。因此,降维并不等同于为每一种任务找出最相关的变量。(sklearn.org)

线性方法

主成分分析(PCA)寻找彼此正交的方向,使这些方向依次捕获中心化数据中剩余的最大方差。保留前 kk 个主成分可得到一个秩为 kk 的近似;在相同维数的正交线性投影中,这一近似的平方重构误差最小。PCA 可以通过样本协方差矩阵的特征值与特征向量推导出来,也可以使用奇异值分解(SVD)计算。其主成分是输入变量的组合,而不是从原始特征中选出的变量。(sklearn.org)

截断 SVD 保留主要的奇异分量,但不一定对输入进行中心化处理。因此,它适用于稀疏矩阵,包括文档的矩阵表示,因为中心化可能破坏稀疏性。核 PCA 通过核方法扩展 PCA,使原始输入空间中的非线性关系也能影响最终的表示。(sklearn.org)

随机投影使用随机生成的投影矩阵,而不是学习方差最大的方向。约翰逊–林登施特劳斯引理给出了将有限点集映射到更低维空间、同时近似保留点对之间欧氏距离的条件。它所保证的是距离失真的程度,而不是保留每个特征或每种预测关系。(scikit-learn.org)

非线性表示与学习得到的表示

流形方法的几何目标各不相同。等距映射(Isomap)利用邻域图中的最短路径,近似计算沿底层流形的距离。局部线性嵌入保留将每个观测表示为附近观测的加权组合的关系。这两种方法都依赖邻域的构造,并且可能受到噪声、采样稀疏,或底层结构中相距较远的部分之间存在不恰当连接的影响。(scikit-learn.org)

t 分布随机邻域嵌入(t-SNE)主要用于可视化。它将相似性表示为概率分布,并最小化原始空间与嵌入空间中这些分布之间的KL散度。它侧重于局部关系,而不是准确保留所有全局距离。统一流形近似与投影(UMAP)采用涉及几何与拓扑的框架,构造基于邻域的表示,并支持嵌入到二维或三维以上的空间。(scikit-learn.org)

自编码器通过学习得到一个将输入映射为更低维编码的编码器,以及一个用于重构输入的解码器。非线性人工神经网络使这种瓶颈表示能够捕获简单线性投影无法捕获的关系。训练以最小化重构损失函数为目标;仅仅成功重构输入,并不能证明编码具有可解释性,也不能证明它对其他任务而言是最优的。(pubmed.ncbi.nlm.nih.gov)

评估与局限

评估方式取决于降维的目的。相关标准包括解释方差、重构误差、距离失真、邻域关系的保留程度,以及下游预测性能。维数本身也是一种建模选择:保留更少的坐标可以得到更紧凑的表示,但也可能丢失有用的结构。为可视化而优化的表示,并不一定最适合聚类分析或预测。(sklearn.org)

特征缩放可能改变结果,因为数值尺度较大的特征可能主导方差或距离。PCA 会对观测进行中心化处理,但本身并不会将每个特征标准化。非线性可视化方法也依赖参数设置和初始化;在 t-SNE 中,图上呈现的分离程度和间距可能随困惑度及优化参数而变化,因此,一幅图并不能直接证明底层数据中存在彼此离散的群体。(sklearn.org)

在评估预测性能时,应从训练数据中学习变换,再将该变换原样应用于留出的观测。在交叉验证中,必须在每个训练折内分别拟合变换。如果在评估前使用完整数据集学习投影或选择变量,就可能造成数据泄漏(机器学习),从而得到过于乐观的性能估计,即使变换本身并未使用目标标签也是如此。(scikit-learn.org)