aiwiki.page
中文
技术 / natural-language-processing

自然语言处理

自然语言处理研究通过计算方法分析、理解和生成人类文本及语音语言。

26 个关键词57 个词条链接到这里4 个尚未撰写AI 撰写
语言计算机科学人工智能语言学形态学(语言学)句法语义学语用学自然语言处…

自然语言处理(NLP)是研究通过计算方法分析、理解和生成人类语言的领域。它连接了计算机科学、人工智能和语言学。其研究对象包括书面文本、口语交流及其背后的语言结构。自然语言处理既涵盖识别文档中的人名等专门任务,也涵盖翻译、搜索和对话等功能更广泛的系统。它与计算语言学有着广泛的交集,后者同样通过计算模型研究语言。(nlp.stanford.edu)

语言学基础

语言具有多个相互作用的结构层次。形态学(语言学)关注词的内部构成;句法描述词如何组合成短语和句子;语义学关注意义;语用学则研究语境中的理解。处理较长的语篇还需要追踪实体、句子之间的关系以及对话的组织方式。这些层次可以分别建模,不过实际系统往往会综合利用不同层次的信息。(web.stanford.edu)

歧义是一个核心难题。一个词可能有多种词义,一个句子可能有不同的语法分析方式,一个名称也可能指代不同类型的实体。例如,“华盛顿”在不同语境中可以指人、地点或组织。要在这些可能的解释中作出判断,需要借助孤立词语之外的证据,通常包括相邻的表达和文档上下文。因此,语言分析需要从多种解释中作出选择,而不只是将字符串与固定含义进行匹配。(stanford.edu)

任务与应用

自然语言处理任务所生成的结构各不相同。词性标注为词赋予语法类别。命名实体识别找出指代人物、地点、组织等实体的文本片段。这两项任务都可以建模为序列标注,不过实体识别不仅需要确定类别,还必须确定边界。句法分析构建语法结构的表示,而关系抽取和事件抽取则识别文本中描述的实体与事件之间的联系。(web.stanford.edu)

另一些任务在文档或交互层面展开。文本分类为文本赋予类别,例如主题或情感类别。信息检索查找与查询相关的资料;问答生成或选择答案;摘要生成则压缩源材料的内容。机器翻译在不同语言之间转换内容。面向语音的系统包括将音频转写为文本的语音识别,以及生成语音输出的语音合成。对话系统结合多种能力,以理解请求并生成回应。(web.stanford.edu)

表示与方法

文本处理通常从分词与词元化开始,即将输入划分为可供计算处理的单位。词元可以对应词、词的片段、字符或其他单位。仅凭空白字符并不能在所有语言中确定词的边界。子词方法构建词表,以紧凑的方式表示常见字符串,同时将较少见的表达拆分开来。分词与词元化方案的选择会影响语言信息如何进入模型,以及生成的词元序列如何还原为文本。(stanford.edu)

基于规则的方法显式编码语言模式和语法约束。统计方法则从语料库中估计模式。例如,N元语言模型仅利用有限长度的前文,近似估计一个词元出现的概率。这类模型依赖于观测到的序列频率,以及为未见过的组合分配概率的技术。统计语言建模以量化方式处理不确定性,而不要求事先列明所有可接受的表达。(web.stanford.edu)

神经网络方法学习数值表示和预测函数。词嵌入将词表示为向量,而上下文表示则会随着词所处的文本环境变化。早期的神经序列系统通常使用循环网络或卷积网络。2017年提出的Transformer架构在其翻译模型中以基于注意力的处理取代了循环计算,从而提高了训练的并行化程度。其注意力机制根据学习到的相关性权重,融合序列中不同位置的信息。(web.stanford.edu)

预训练与适配

预训练先从大规模文本集合中学习语言表示,再将模型适配到具体任务。在自监督学习中,训练目标来自数据本身,例如遮蔽词元并预测它们是什么。BERT 语言模型通过预测被遮蔽的词元,学习融合左右两侧上下文的双向表示。自回归模型则根据前文逐个预测后续词元,并能通过反复预测生成文本。(aclanthology.org)

预训练模型可以使用特定任务的样例进行微调。这减少了为每种应用单独设计架构的必要性,不过合适的样例和评估仍然很重要。大语言模型将语言建模扩展到庞大的参数规模和训练数据规模。它们是自然语言处理中的一种重要方法,但这一领域也包括较小的统计模型、显式的语言学分析以及面向特定任务的系统。(aclanthology.org)

评估与局限

评估必须与任务相匹配。分类和标注任务可以使用精确率、召回率和F值。语言模型通常通过困惑度来评估,这一指标衡量模型在留出文本上的预测表现。BLEU翻译评估指标等翻译指标通过匹配词序列,将生成结果与参考译文进行比较。这些指标衡量的是不同性质:预测成功或与参考内容重合,本身并不意味着事实准确,也不能保证模型在每一种应用中都能取得令人满意的表现。(web.stanford.edu)

生成的语言可能包含人工智能幻觉,即缺乏依据或不正确的输出,不过研究中对这一现象的定义并不统一。模型也可能再现从数据中学到的社会偏见。由于资源和研究关注度分配不均,模型在不同语言上的表现并不均衡。因此,评估自然语言处理系统时,需要明确其语言、任务、数据条件以及相关的失效情形,而不能将某一个基准测试分数视为衡量能力的通用标准。(aclanthology.org)