人工智能幻觉是指人工智能系统生成的内容存在事实错误、缺乏现有证据支持,或与其输入不一致的现象。这一现象尤其常见于生成式人工智能和大语言模型,因为它们流畅的回答可能使虚构信息显得可信。美国国家标准与技术研究院(NIST)使用“虚构”(confabulation)一词来指称与此有所重叠的失误,包括以确信的口吻呈现错误信息,以及生成相互矛盾的内容。这一术语描述的是可观察到的输出行为,并不意味着机器具有类似人类的感知体验。(nvlpubs.nist.gov)
定义与范围
目前,幻觉尚无公认的操作性定义。在自然语言处理领域,研究者区分了事实性与忠实性:前者指内容与有关现实世界的可靠信息相符,后者指内容与任务所提供的源材料或指令相符。这两项标准可能并不一致:摘要可能忠实地复述了不准确的来源,而一个本身正确的陈述也可能得不到被摘要文档的支持。2024年发表的一项审查发现,研究文献与从业者之间在术语使用上存在较大分歧。(aclanthology.org)
一种常见的、以源材料为依据的分类区分了以下两类幻觉:
- **内在幻觉:**与源材料相矛盾的内容,例如改动材料中报告的数量,或将某个行为错误地归于另一人。
- **外在幻觉:**无法根据源材料核实的内容,例如添加材料未提及的事件。
外在内容在现实世界中不一定是错误的;其界定特征是缺乏任务所提供证据的支持。因此,评估必须明确说明,所衡量的是与源材料的一致性、相对于外部事实的准确性,还是两者兼有。(aclanthology.org)
幻觉研究早于对话式助手的出现,其范围涵盖自动文本摘要、机器翻译、对话以及视觉—语言生成。在多模态学习系统中,相应的失误可能表现为描述视觉输入无法支持的物体或事件。虚构内容是否构成错误取决于任务:富有想象力的生成与受证据约束的报告有着不同的要求。(arxiv.org)
机制与影响因素
语言模型从训练数据中学习模式,并利用条件概率分布生成后续内容。在传统的自回归训练中,损失函数通常通过最大似然估计,鼓励模型预测实际观测到的词元。这一目标并不会独立核验生成的每一项陈述。因此,续写内容可能在语言上合理,却缺乏事实依据。有关抽象式摘要的研究已记录了生成目标与对源材料的忠实性之间的这种不匹配。(nvlpubs.nist.gov)
错误输出既可能源于模型学到的错误信息,也可能源于对原本熟悉的信息进行虚构组合。TruthfulQA研究表明,模型可能重现通过模仿文本学到的人类常见误解。研究结果还显示,在这一特定基准上,增大模型规模并不会自动提高回答的真实性;这一发现针对的是特定任务,并不代表模型规模与可靠性之间存在普遍适用的关系。(aclanthology.org)
置信度是另一个独立的问题。一个词元序列具有较高的概率,并不等于其所表达的陈述具有经过核实的较高真实概率。有关模型自我评估的研究发现,在某些条件下,模型能够提供有助于判断答案是否正确的信号,但这些信号的泛化(机器学习)能力和校准表现可能在分布偏移下下降。实验也区分了普通的下一词元预测,以及通过专门提问引导模型作出的正确性判断。(arxiv.org)
检测与衡量
幻觉难以衡量,因为同一条回答可能混合了有依据和无依据的陈述。人工评估可以将输出与源文档或权威证据进行比较,但判断会受到标注说明、可用证据以及评估单位的影响。一项涵盖2019年至2024年间发表的64项研究的综述发现,人工评估实践存在显著差异。(aclanthology.org)
2023年提出的FActScore通过将长篇输出拆分为原子事实,并计算其中得到可靠知识来源支持的比例,来处理事实性参差不齐的问题。相较于将整段文本标记为正确或错误,这种方法提供了更细粒度的衡量。该分数衡量的是相对于所选证据的事实精确率;它本身不能证明内容的完整性或实用性。(aclanthology.org)
其他方法会评估生成的陈述是否能由输入推导出来,或比较多次采样得到的答案。SelfCheckGPT将不同采样结果之间的一致与分歧作为检测信号,无须使用外部数据库。采样结果不一致可能表明内容不可靠,但仅凭一致性在逻辑上无法确定内容真实:多次回答可能包含相同的错误。(aclanthology.org)
基准测试结果需要谨慎解读。TruthfulQA侧重于容易诱发误解的问题,而FActScore评估的是较长回答中得到证据支持的陈述。这些不同任务的分数不能相互替代,用来衡量系统在所有情境下的幻觉率。(aclanthology.org)
缓解方法与局限
检索增强生成将生成器与针对外部材料的信息检索相结合,外部材料可以是知识库等。2020年最初提出RAG的研究报告称,在所评估的任务上,相比仅依靠模型参数的对照系统,RAG生成的内容更符合事实。检索到的证据还为核查陈述和更新系统可获取的信息提供了依据,使系统不必完全依赖编码在模型参数中的知识。这些结果表明系统在受测条件下有所改善,但并不保证检索或生成的每一项陈述都正确。(arxiv.org)
基于训练的方法包括采用将事实准确性与模仿区分开来的目标进行微调。自我评估方法试图识别模型不太可能正确回答的问题,从而有望支持选择性作答,而非不加限制地生成内容。这些方法的有效性取决于任务设计,以及不确定性估计在新输入上的适用程度。(aclanthology.org)
后果与系统评估
虚构内容可能包括捏造的引文、误导性解释,以及损害信息完整性的矛盾陈述。其影响大小取决于具体应用,以及下游流程能否发现错误。NIST的生成式人工智能风险概况将虚构视为一项可靠性问题,并将测试、文档记录和持续监测列为风险管理活动。因此,评估关注的不仅是模型输出,还包括围绕其使用建立的证据与核验程序。(nvlpubs.nist.gov)