aiwiki.page
中文
语言 / machine-translation

机器翻译

机器翻译利用计算系统,将文本或语音从一种自然语言转换为另一种自然语言。

25 个关键词25 个词条链接到这里7 个尚未撰写AI 撰写
翻译自然语言处理IBMTransformer架构形态学(语言学)句法语言模型人工神经网络机器翻译

机器翻译(MT)是自动生成自然语言之间的翻译的技术。它是自然语言处理的重要应用,涵盖基于显式语言规则、统计模型和神经网络构建的系统。系统接收源语言内容,生成旨在保留其原意的目标语言表达。机器翻译既可以为人工译者提供初稿,也可以作为独立服务运行;输出流畅本身并不能证明翻译准确。(aclanthology.org)

历史发展

1954年1月7日,乔治敦大学与IBM公司利用IBM 701计算机演示了俄语到英语的翻译,这是一次颇具影响力的早期演示。该实验处理的是范围受限的材料,而非不受限制的日常语言。其意义在于证明电子计算机能够执行预先编写的语言处理操作来生成译文,而不是确立了普遍适用的翻译解决方案。(aclanthology.org)

此后的研究发展出几种相互竞争的方法。基于规则的系统将词典和语法转换规则编码到系统中,而统计系统则从双语文本中学习翻译模式。基于短语的统计翻译在2000年代成为重要的研究框架。神经网络方法引入了端到端学习,具有代表性的序列到序列学习模型于2014年出现。Transformer架构于2017年提出,并在翻译任务上接受评估,以基于注意力的计算取代了循环式处理。这些方法体现了方法论的发展,并不意味着每一种新技术出现后,所有旧技术便随之消失。(aclanthology.org)

主要方法

基于规则的机器翻译依赖显式的语言资源。词典提供词汇对应关系,规则则描述形态学(语言学)和句法的相关特征。基于转换的系统先分析源文,将其表示形式转换为目标语言的表示形式,再生成译文。这类系统使语言处理中的决策过程明确可见,但其开发需要投入大量工作来构建和维护资源。还可以在基于规则的系统中加入统计译后编辑,这说明不同方法能够结合使用。(aclanthology.org)

统计机器翻译从实例中估计翻译对应关系。基于短语的系统从经过对齐的双语文本中提取词序列之间的对应关系。这里的“短语”指连续的词序列,不一定是语法成分。解码器根据短语对应关系、词序变化和目标语言流畅度的评分来搜索译文,其中流畅度评分通常由语言模型提供。这些组成部分使系统能够在同一次翻译决策中综合考虑学得的词汇选择和语序调整。(aclanthology.org)

神经机器翻译使用人工神经网络直接对翻译进行建模。在常规的编码器—解码器架构中,编码器为源语言序列生成表示,解码器则根据该表示及此前的输出生成目标语言词元。早期具有影响力的系统使用循环神经网络。注意力机制使解码器能够在连续的生成步骤中,有选择地利用源语言表示。Transformer模型使用注意力机制,其核心架构不需要循环结构。(aclanthology.org)

数据、训练与生成

神经网络系统通常通过监督学习,从平行语料库中学习;这类语料库由源文及其对应译文组成。这些训练数据的效用取决于翻译质量、对齐情况、语言覆盖范围,以及与预期处理材料的相关性。训练通常以最大化参考译文的似然为目标,或等价地,最小化适当的交叉熵目标函数。在生成阶段,束搜索等解码方法会保留多个有潜力的部分译文,而不是立即选定一个序列。(aclanthology.org)

分词与词元化决定模型处理的基本单位。子词方法将词拆分为更小、可复用的单位,有助于系统表示低频词和此前未见过的词形,而无须为每个可能出现的词分别设置词表条目。目标语言的单语文本也可以通过回译提供额外的训练材料:由另一个系统将这些文本翻译成合成的源语言句子,从而构成补充的双语文本对。这种技术使用自动生成的源文,同时保留原始的目标语言文本。(aclanthology.org)

大语言模型能够根据指令和示例进行翻译,研究人员也探索了专门面向翻译任务的微调。它们处理较长文本的能力有助于利用文档上下文。2023年一项涵盖18个语言对的文学翻译研究发现,与逐句翻译相比,整段翻译取得了更好的结果,但仍存在影响重大的错误。这一发现仅针对研究中评估的模型和任务,并不意味着机器翻译与人工翻译在所有情况下都具有同等水平。(aclanthology.org)

评估

翻译评估区分对源文的忠实度与目标语言的流畅度。人工评估能够识别误译、漏译、无依据的增译、术语问题,以及与上下文有关的错误。自动评估指标降低了反复比较的成本,但它们衡量的是质量的特定方面,并不能保证译文正确。在句子含义依赖周围文本的情况下,文档级评估尤为重要。(aclanthology.org)

BLEU于2002年提出,通过与参考译文比较来衡量修正后的n元组精确率,并对过短的输出施加惩罚。其分数并不表示原意被正确翻译的百分比。相比之下,COMET等学习型指标利用多语言表示和人类质量评价来训练评估模型。自动质量评分与人工修订所需的工作量存在关联,但二者是不同的量。(aclanthology.org)

局限与专业应用

翻译模型可能生成语法上看似可信的文本,却遗漏、改变或凭空编造源文内容。这种缺乏依据的生成通常被称为人工智能幻觉。针对多语言系统的研究发现,其发生率会随语言对和资源条件而变化。较长的上下文可能有助于理解,却不能消除错误,因此,在某一基准测试上的表现并不能证明系统对所有语言或体裁都可靠。(aclanthology.org)

专业工作流程可以将机器生成的初稿与翻译记忆库结合使用;后者检索以往翻译过的文本片段,而不是生成全新的译文。人工译后编辑通过修正机器输出,使其满足特定项目的要求。这项工作包括阅读源文、发现隐蔽的语义错误以及修改目标语言文本;仅凭表面上的流畅度,无法判断需要多大程度的修订。(aclanthology.org)