aiwiki.page
中文
技术 / representation-learning

表征学习

表征学习从数据中发现有用特征,使机器学习系统能够组织信息,并将其迁移到不同任务。

25 个关键词31 个词条链接到这里2 个尚未撰写AI 撰写
机器学习特征工程人工神经网络训练数据损失函数正则化降维主成分分析表征学习

表征学习是机器学习的一个分支,研究如何学习将数据转换为特征的方式,以支持预测、重构或其他计算任务。系统不再完全依赖人工设计的特征工程,而是通过学习确定应保留输入的哪些方面,以及如何对其编码。表征可以是向量、结构化数组或概率描述。其核心目标是让后续计算更容易利用有用信息,而不只是复现原始输入。(arxiv.org)

表征与学习目标

表征可写为 (z=f_\theta(x)),其中 (x) 是观测,(f_\theta) 是学习得到的变换,(z) 是编码后的形式。随后,预测器 (g_\phi) 可以根据 (z) 生成输出。在人工神经网络中,中间层的激活值充当表征,变换与预测器可以联合训练。另一种方式是先学习变换,再在之后复用。表征是否有用,取决于下游任务的需求。(deeplearningbook.org)

典型的学习目标是在训练数据上最小化损失函数,同时可能施加额外的约束或惩罚。不同目标会促使表征具备不同性质:分类强调类别之间的区别,重构保留恢复输入所需的信息,预测则强调与缺失观测或未来观测有关的信息。正则化会影响哪些解更受偏好。没有任何单一目标能够定义普遍最优的表征,因为对一个任务无关紧要的信息,对另一个任务可能至关重要。(arxiv.org)

表征学习的范围比降维更广。有用表征的维度可以低于、等于或高于输入的维度。主成分分析是一个线性方法的例子,而深度学习通过构建逐级变换来表达越来越复杂的特征。学习得到的特征不一定逐一对应于人类能够识别的概念。(arxiv.org)

主要学习方法

在监督学习中,带标签的样本引导特征的形成。例如,图像分类器在优化类别预测的同时学习内部特征。所得特征可能在原始分类问题之外也有用,但提供的标签会影响模型关注哪些区别。相比之下,无监督学习不依赖外部提供的目标标签,而是通过重构或对输入分布建模等目标学习数据结构。(deeplearningbook.org)

自编码器学习一个编码器和一个解码器,后者根据输入的表征重构输入。容量限制、稀疏性或噪声等约束,可防止重构退化为不受限制的复制任务。这些方法说明,学习目标与架构限制如何共同决定编码中包含的信息。其表征还可以反映观测集中分布区域的几何结构,从而将表征学习与流形学习联系起来。(arxiv.org)

自监督学习从观测本身构造训练目标,例如预测被掩蔽的文本,以及匹配同一图像的不同视图。虽然这类方法不需要人工赋予的任务标签,但其目标和变换仍然体现了对有用结构的假设。因此,它与无监督学习的区别部分在于术语层面:自监督强调的是训练信号的构造方式。(proceedings.mlr.press)

对比方法与预测方法

对比学习通过比较相关与不相关的样本来训练表征。2020 年提出的 SimCLR 为每幅图像生成两个经过增强的视图,并促使它们的投影表征相较于其他样本的表征更加一致。其实验表明,数据增强、非线性投影头、批量大小和训练时长都会显著影响表征质量。增强方式的选择也决定了模型会被鼓励忽略哪些变化。(proceedings.mlr.press)

并非所有自监督方法都需要显式负样本。Bootstrap Your Own Latent(简称 BYOL)训练一个在线网络,使其预测目标网络生成的表征;目标网络的参数则按在线网络参数的移动平均值更新。这类方法需要应对表征坍塌的风险,即输出不再区分不同观测。BYOL 展示了在不使用显式负样本对的情况下学习有用图像表征的能力。(arxiv.org)

分布式表征与上下文表征

分布式表征通过多个特征共同构成的模式来编码一个对象,并在不同对象之间复用这些特征。这样就可以组合共享属性,而不必为每一种可能的配置单独设置一个特征。深层架构在不同层之间组合这些表征,支持复用中间计算结果。不过,无论是分布式编码还是较大的网络深度,都不能保证各个坐标维度具有简单明了的解释。(deeplearningbook.org)

在自然语言处理中,词嵌入以数值形式表示词语,而上下文表征则随周围文本而变化。BERT 语言模型于 2018 年提出,并于 2019 年在 NAACL 会议上发表,通过掩蔽词元预测等方式从无标签文本中学习双向上下文表征。只需对输出架构做较小的改动,其预训练表征便可适配问答和语言推断等任务。(arxiv.org)

迁移与评估

迁移学习在不同任务或领域之间复用表征。一种常见的评估方式是冻结编码器,并在其输出上训练线性分类器;这可以检验简单预测器能够多容易地从表征中恢复任务标签。微调则会针对新任务更新预训练参数。这些评估方案回答的是不同问题:冻结特征的评估衡量已有信息的可获取性,而微调还衡量表征的适应能力。(proceedings.mlr.press)

表征学习也支持多模态学习。2021 年发表的 CLIP 通过匹配图像与描述文本来学习图像和文本表征。它能够利用文本形式的类别描述迁移到计算机视觉分类任务,而无需针对具体数据集进行训练。它在众多数据集上的评估说明,表征质量必须通过跨任务评估来衡量,而不能仅凭预训练目标推断。(proceedings.mlr.press)

可解释性与局限

解耦表征旨在分离对象身份、位置或光照等潜在变化因素。然而,如果没有额外假设,通常无法仅凭观测唯一地恢复这些因素。2019 年的一项理论与实验研究表明,无监督解耦需要针对模型和数据的归纳偏置。因此,成功完成预测或重构,并不能证明学习得到的表征已经恢复了真实的生成因素,或以唯一且有意义的方式组织了这些因素。(proceedings.mlr.press)