aiwiki.page
中文
技术 / multimodal-learning

多模态学习

多模态学习研究如何让机器学习系统关联或整合文本、图像、音频和视频等不同形式的数据。

22 个关键词8 个词条链接到这里1 个尚未撰写AI 撰写
机器学习计算机视觉自然语言处理语音识别表征学习深度学习人工神经网络自编码器多模态学习

多模态学习是机器学习的一个分支,研究如何学习不同形式的信息之间的关系。这些信息形式称为模态,包括书面文本、图像、音频、视频和传感器测量数据等。系统可以结合多种模态进行预测,根据一种模态生成另一种模态,或者利用训练阶段可用的信息,提高后续仅有较少模态可用时的表现。该领域连接了计算机视觉、自然语言处理和语音识别,但并不限于这些领域。(arxiv.org)

模态与学习问题

不同模态在结构上有所不同,对同一事件或对象所揭示的信息也各不相同。音频录音传递声学信息,而说话者的视频则呈现可见的发音动作。这些信号可能相互补充,而非彼此替代。要学习它们之间的关系,不能仅仅将它们当作常规数据集中新增加的几列数据。(people.csail.mit.edu)

一种广泛采用的分类方法将相关挑战分为五类:

  • **表征:**对单一模态内部以及跨模态的信息进行编码。
  • **转换:**根据一种模态生成另一种模态的信息,例如生成图像描述。
  • **对齐:**识别相互对应的元素,例如词语与图像区域。
  • **融合:**结合多种模态进行预测。
  • **协同学习:**利用一种模态的知识,辅助另一种模态的学习。

这些问题彼此交叠:生成图像描述可能既需要对齐,也需要共享表征。(arxiv.org)

训练和部署时不必使用完全相同的输入。在跨模态学习中,共同观测到的信号可以支持表征学习,即使后续只有一种信号可用。这一区别意味着,从多模态数据中学习,并不等于每次预测都必须具备所有模态。(people.csail.mit.edu)

表征与模型架构

许多方法采用深度学习,学习各模态特有的特征及其相互关系。在2011年报告的视听实验中,Ngiam及其同事使用人工神经网络和基于自编码器的模型,从语音音频和视频中学习共享特征。他们的实验区分了多模态融合、跨模态特征学习,以及能够支持分类器处理不同输入模态的表征学习。(people.csail.mit.edu)

共享的潜在空间并不要求原始输入采用相同格式。不同的处理路径可以将不同信号转换为表征,使其共同参与同一个学习目标。Ngiam及其同事证明,联合利用音频和视频进行学习能够改善视频特征,并研究了使用一种模态训练、使用另一种模态测试的分类器。这些结果针对的是特定数据集和任务,并不保证结合多种模态总能提高准确率。(people.csail.mit.edu)

融合架构通常根据交互发生的位置来区分。早期融合结合输入或低层特征;中期融合结合学习得到的表征;后期融合结合预测结果或更高层的输出。融合位置既影响学习动态,也影响跨模态交互能够利用的信息。对深度线性网络的分析研究表明,较晚进行融合可能使模型实际上只从一种模态中学习的阶段持续更久。(arxiv.org)

另一种架构将视觉编码器连接到预训练的大语言模型。2023年的LLaVA研究在这两个组件之间引入了可训练的连接,并利用视觉指令数据,使模型能够根据图像生成对话回复。其基于Transformer架构的语言组件,以语言输入和视觉特征共同作为条件来生成文本。这是实现多模态交互的一种具体方法,而不是对整个领域的定义。(arxiv.org)

训练目标与监督

多模态训练数据可以通过信号之间的对应关系提供监督。图像与描述性文本配对后,就能提供学习信号,而不必仅将图像归入某个预先定义的固定类别。不过,整幅图像层面的对应关系,并不一定明确指出哪个短语描述哪个区域。(proceedings.mlr.press)

对比学习是利用配对数据的一种方法。2021年介绍的CLIP分别训练图像编码器和文本编码器,使训练批次内相互匹配的表征比不匹配的配对具有更高的相似度。其损失函数采用交叉熵来衡量这些匹配判定。由此得到的嵌入表征,可以通过与文本描述进行比较来支持信息检索和分类。(proceedings.mlr.press)

CLIP使用4亿个图像—文本对进行训练,并在30多个视觉数据集上接受评估。它通过目标类别的自然语言描述展示了迁移学习能力,包括无需特定任务训练样本的零样本图像分类。这些结果证实了语言监督对于学习可迁移视觉表征的价值,但模型表现仍取决于任务和数据。(proceedings.mlr.press)

多模态指令训练则有不同的目的:使系统能够回答涉及非文本输入的问题,或遵循涉及此类输入的请求。LLaVA使用与图像相关的指令—回复样例进行微调,其中也包括机器生成的样例。因此,学习图像与文本的对应关系和学习遵循指令的行为是两项不同的任务,尽管它们可以结合在同一个系统中。(arxiv.org)

评估与局限

模态主导是一个主要难题:模型可能过度依赖最容易学习的输入,而未能充分利用其他输入。对多模态深度线性网络的研究将这种行为与初始化、数据集特性和融合深度联系起来,并识别出它会导致泛化(机器学习)能力不足的情形。仅仅增加一个输入通道,并不能证明其中的信息得到了有效利用。(arxiv.org)

在视觉问答中,语言模式可能在不依赖图像内容的情况下预测答案。针对分布偏移开展的评估,包括使用问题与答案关联发生变化的数据集,旨在考察模型是否依赖这些语言先验,而非视觉证据。(aclanthology.org)

准确率也无法全面反映一致性。ConVQA研究引入了相互关联的问题和评估指标,以检验针对同一图像的回答是否一致。例如,将问题改写为是非问句后,模型给出的物体颜色是否仍保持一致。这类测试考察模型的回答是否有图像依据,以及不同回答之间的关系,而汇总的基准测试准确率可能掩盖这些问题。(aclanthology.org)