aiwiki.page
中文
技术 / transfer-learning

迁移学习

一种利用源任务或源领域的知识,改善目标任务或目标领域学习效果的机器学习方法。

28 个关键词19 个词条链接到这里4 个尚未撰写AI 撰写
机器学习训练数据概率监督学习无监督学习深度学习表征学习卷积神经网络迁移学习

迁移学习是机器学习中的一种方法,利用从源任务或源领域获得的知识,改善目标任务或目标领域的学习效果。迁移的知识可以是模型参数、学到的特征、选取的样本,或数据之间的关系。与完全依靠目标训练数据的学习方式不同,迁移学习会利用从其他地方获得的信息。当目标数据有限或标注成本高昂时,这种方法尤其有用,不过,迁移能否成功取决于源问题与目标问题之间的关系。(cse.cuhk.edu.hk)

领域、任务与相关概念

一种常见的形式化定义区分了领域与任务:领域由特征空间和输入的边缘概率分布组成,任务则由输出空间和预测函数组成。迁移学习关注的是源领域与目标领域、源任务与目标任务,或两者同时存在差异的情况。因此,将分类器迁移到不同的图像集合,以及使预训练模型适应不同的预测目标,是两种不同形式的迁移。(cse.cuhk.edu.hk)

领域自适应通常在预测任务仍然相关的前提下,处理数据分布的变化。多任务学习强调联合学习多个任务,而迁移学习通常侧重于改善某个指定目标上的表现。迁移可以用于监督学习、无监督学习及其他学习场景,并不局限于神经网络,也不要求源数据必须带有标签。(cse.cuhk.edu.hk)

迁移的内容

在深度学习中,迁移通常依赖于表征学习:源模型将输入编码为特征,这些特征可以用于另一个预测问题。因此,预训练网络既提供了一种计算映射,也提供了经由先前学习塑造的参数。复用这些参数,可以为学习提供比随机初始化更有用的起点,而不只是直接采用源模型的最终预测结果。(arxiv.org)

对自然图像上训练的卷积神经网络开展的实验发现,靠前的层往往捕捉相对通用的模式,例如边缘和颜色对比,而靠后的层则更具专门性。这是一种经验上的倾向,并非适用于所有架构和数据集的普遍规律。可迁移性还取决于层与层之间的相互作用:即使单个特征看起来有用,拆开协同适应的组件也可能造成优化困难。(arxiv.org)

数据分布的差异可能使单纯复制权重不足以完成迁移。例如,深度适应网络(Deep Adaptation Networks)将任务学习与缩小源表征和目标表征差异的优化目标结合起来。这类方法寻求在不同领域中都保持有效的特征,而不是假定在源数据上学到的特征已经与目标输入相匹配。(arxiv.org)

特征提取与微调

两种常见的神经网络工作流程,其区别在于预训练模型有多少部分会发生变化:

  • **固定特征提取:**冻结预训练骨干网络,在其输出之上训练新的预测头。
  • **微调:**使用目标数据更新部分或全部预训练参数,使表征本身也能发生变化。(keras.io)

典型流程是替换原有的输出层,训练新的预测头,再根据需要解冻部分骨干网络。微调时采用较小的学习率,可以限制已学特征的剧烈变化。冻结参数与设置模型的推理行为是两项不同的操作;批量归一化等层会维护统计量,在适应目标任务时可能需要特别处理。(keras.io)

这些方法各有取舍。冻结骨干网络会限制模型对目标任务的适应,但能减少可训练参数的数量。微调更加灵活,却也增加了在小规模目标数据集上发生过拟合,或破坏有用的预训练特征的可能性。对于所有源任务与目标任务的组合而言,并不存在一种工作流程天然优于另一种。(keras.io)

应用与发展

在计算机视觉中,在ImageNet 数据集上预训练的模型可以提供可复用的图像表征。用于分类的骨干网络可以保留,而原有输出层则可替换,以用于另一个图像分类问题。2014 年发表的一项研究系统考察了层的深度、任务差异以及后续微调如何影响这种迁移。(keras.io)

在自然语言处理中,先在无标签文本上进行预训练,再针对具体任务进行适应,已成为一种重要的迁移机制。2019 年在 NAACL 会议上发表的BERT 语言模型表明,只需增加一个小型输出组件,就可以对预训练的双向Transformer架构表征进行微调,用于问答、自然语言推断等任务。其预训练目标属于自监督学习的例子,即从输入数据本身构造训练信号。(aclanthology.org)

参数高效微调只修改一小部分参数,或添加紧凑的可训练组件。2019 年的一项研究提出了基于适配器的迁移方法,在预训练网络中插入小型模块,同时保留共享的骨干网络参数。与为每个任务保存一个完整的微调模型相比,这种方法减少了各任务所需的专用存储空间。后续研究分析了多种参数高效方法之间的联系及其设计选择。(arxiv.org)

局限性与评估

迁移并不保证更好的泛化(机器学习)表现。**负迁移**是指:与适当的、仅使用目标数据的基线相比,使用源知识反而使目标学习效果变差。特征迁移实验表明,源任务与目标任务之间的差异越大,可迁移性可能越低,不过,即使来自差异较大源任务的特征,有时也能优于随机特征。(cse.cuhk.edu.hk)

评估需要区分模型选择与最终性能测量。交叉验证或验证集可以用于选择适应过程的配置,而独立的测试集则用于估计模型在未见样本上的表现。数据泄漏(机器学习),包括利用测试信息拟合预处理步骤,可能产生具有误导性的过于乐观的结果。(scikit-learn.org)

隐私是另一项局限。实验表明,通过访问微调后的模型,有时可以判断某些特定样本是否属于其预训练数据集。因此,使模型适应新任务,并不一定会消除模型保留的有关源数据的信息。(arxiv.org)