自监督学习是机器学习的一种形式,其训练目标由输入数据构造,而非由人工另行标注提供。模型可以预测缺失的词语、重建被遮挡的图像区域,或匹配同一样本的不同观测结果。这些任务有助于表征学习,即发现能够支持后续预测任务的特征。自监督学习减少了对人工标注训练数据的依赖,但数据集、模型架构和学习目标仍需由人来选择。(ai.meta.com)
与其他学习范式的关系
在监督学习中,每个样本都配有外部提供的目标,例如物体类别或转写文本。自监督训练也使用目标和预测误差,但目标是自动构造的,例如通过隐藏观测数据的一部分来构造。两者的区别在于监督信号的来源,而不在于模型是否最小化某个损失函数。(ai.meta.com)
自监督学习通常被视为无监督学习的一部分,因为它可以在没有外部标注标签的情况下进行。自监督学习这一更狭义的术语强调从数据中构造明确的预测任务,而无监督学习还涵盖聚类、密度估计等方法。半监督学习结合使用有标签和无标签的样本;因此,先进行自监督预训练、再通过监督学习适配任务的系统,也可以构成半监督学习工作流程的一部分。这些类别描述的是训练方式,而非相互排斥的模型架构。(arxiv.org)
训练流程
典型的训练流程首先收集文本、图像、音频或其他观测数据,再通过某种变换构造预测问题,例如遮蔽内容、引入扰动,或生成两个相关视图。编码器将输入映射为表征,另一个预测组件则生成训练所需的输出。学习目标将这一输出与自动构造的目标进行比较。(proceedings.mlr.press)
训练得到的编码器随后可用于迁移学习。在微调过程中,部分或全部预训练参数会针对下游任务进行更新。另一种做法是冻结编码器,仅利用其提取的特征训练一个小型监督分类器。因此,预训练与下游评估回答的是不同的问题:模型在所构造任务上的成功,本身并不能证明它对其他任务有用。(proceedings.mlr.press)
主要目标类型
重建与掩码预测。 这类方法根据仍然可见的内容推断缺失或受损的内容。自编码器通过编码表征重建输入;采用掩码的变体则限制模型对部分输入的访问。重建的对象可以是词语、像素或其他数据元素。图像掩码自编码器利用可见的图像块编码图像,再通过解码器重建被遮蔽的图像块,从而将重建目标应用于计算机视觉。(arxiv.org)
自回归预测。 语言模型可以根据前面的词元预测下一个词元。实际出现的后续内容就是预测目标,因此文本本身便提供了监督信号。这一原理是生成式预训练变换器预训练的基础。相比之下,掩码预测可以同时利用缺失词元两侧的上下文。这两种方法都能从文本中学习,而无需为每个句子单独提供标签。(ai.meta.com)
对比学习。 对比学习促使相关样本的表征保持一致,同时将其与指定的负样本区分开来。在图像学习中,数据增强通过裁剪、颜色变化等变换生成相关视图。2020 年发表的 SimCLR 展示了增强操作的组合、非线性投影组件以及训练配置的重要性。下游任务所使用的表征不一定与对比目标直接优化的表征相同。(proceedings.mlr.press)
非对比式表征匹配。 并非所有方法都必须显式使用负样本。2020 年提出的 Bootstrap Your Own Latent(简称 BYOL)训练一个在线网络,使其预测目标网络对另一个增强视图生成的表征。目标网络通过在线网络参数的移动平均进行更新。这类方法必须应对表征坍塌问题,即不同输入得到无法区分的表征。它们的成功取决于完整的训练设计,而不只是让成对的输出彼此相似。(papers.nips.cc)
发展与应用
在自然语言处理领域,大规模 Transformer 预训练广受关注之前,Word2vec等方法就已利用词语上下文学习有用的特征。BERT 语言模型于 2018 年首次发布,相关论文于 2019 年发表于 NAACL,将掩码语言预测与下一句预测目标相结合。其双向表征可适配问答、语言推理等任务。Transformer架构在这一发展过程中发挥了重要作用,但自监督是一种训练原则,而非某种特定架构。(ai.meta.com)
在语音识别领域,2020 年提出的 wav2vec 2.0 通过遮蔽潜在语音特征并解决对比预测任务,从没有转写文本的音频中学习表征。随后,监督微调使用带有转写文本的语音。其实验表明,在所评估的条件下,该方法能够显著减少对转写文本的需求。(arxiv.org)
多模态学习可以利用具有天然关联的观测数据,例如同步的视频和音频。一种模态为另一种模态的学习提供信息,而无需人工指定物体标签。图像—文本系统则带来一个需要注意的重要区别:图像说明本身可能已经包含人类撰写的描述。因此,CLIP 的 2021 年论文将其方法描述为自然语言监督,而没有声称完全不使用人类提供的信息。(ai.meta.com)
评估与局限
常见的评估方式包括冻结编码器后进行线性探测、全面微调,以及迁移到不同的数据集或任务。结果取决于模型架构、预训练数据、计算预算和下游标签数量。因此,在ImageNet 数据集等基准上进行比较时,只有明确说明这些条件,比较才有意义。(proceedings.mlr.press)
所构造的学习目标也隐含着一些假设。数据增强决定了模型应忽略哪些差异;不恰当的变换可能会移除有用信息。当不同样本属于同一语义类别时,对比采样可能产生假负样本。大规模预训练可能需要大量计算资源,而省去人工标注并不保证能够获得可迁移的表征。这些局限不仅关乎数据集规模,也同样关乎目标设计与评估方式。(proceedings.mlr.press)