基于人类反馈的强化学习(RLHF)是一类利用人类评价来指导强化学习的机器学习方法。系统并不完全依赖人工指定的奖励函数,而是从对其行为的评价中学习,通常借助能够预测人类偏好的模型来实现。RLHF 已应用于游戏智能体、仿真机器人控制和大语言模型。它与人工智能对齐密切相关,但符合收集到的偏好并不意味着系统能够可靠地满足人类的所有目标。(arxiv.org)
发展与应用
2017 年一项具有重要影响的研究展示了如何通过人类对短行为序列的比较来学习,实验涉及雅达利游戏和仿真机器人的运动控制。评价者从一对行为片段中选出更偏好的片段;训练得到的奖励预测器随后为规模大得多的智能体训练提供反馈。在报告的实验中,人类评价的交互次数不到智能体与环境交互总次数的百分之一。这说明,有限的人类监督也能传达难以直接编码的目标。(arxiv.org)
2020 年,关于语言模型的研究将这种方法应用于文本摘要。研究者利用人类的比较评价训练奖励模型,再用它指导摘要生成策略的微调。所得模型在人类质量评价中优于监督学习基线模型,其中包括规模更大的模型;而且,这些模型无需针对新闻进行专门微调,就能从 Reddit 帖子摘要迁移到新闻文章摘要。这些结果仅针对该研究所用的数据集和评价者,并不涵盖所有可能的摘要任务。(arxiv.org)
2022 年的 InstructGPT 研究将该方法扩展到针对多种提示的指令遵循任务。其模型结合了人类示范、输出排序和强化学习。在该研究的提示分布下,相较于原始的 1750 亿参数 GPT-3,评价者更偏好 13 亿参数的 InstructGPT 模型。这项实验表明,在这些评价条件下,模型规模并非决定实用性的唯一因素。(arxiv.org)
人类反馈与奖励建模
人类反馈可以采取多种形式,包括示范、数值评分、排序和成对比较。在基于偏好的实现方式中,评价者查看同一输入对应的两个输出,或两个行为片段,并判断哪一个更符合任务要求。这些评价成为奖励模型的训练数据,该模型负责为候选输出打分。学得的分数是对人类评价的预测,而非对输出客观正确性的直接测量。(arxiv.org)
一种常见的成对比较模型将给定提示 时,回答 比 更受偏好的概率表示为
其中, 为奖励模型, 为逻辑斯蒂函数。训练使用分类损失函数来调整奖励模型,使观察到的偏好具有更高的预测概率。因此,比较结果约束的是相对分数,本身并不能确定衡量质量的绝对尺度。(arxiv.org)
语言模型训练流程
一种常见的语言模型训练流程包含三个阶段:
- 监督初始化。 人类编写的示范提供符合预期的回答样例。通过监督学习得到初始的指令遵循模型。
- 偏好收集。 评价者对选定提示所生成的回答进行比较或排序。一个独立的奖励模型学习预测这些评价。
- 策略优化。 将生成回答的模型视为一种策略,让它生成更多输出,并更新模型以提高这些输出的预测奖励。(arxiv.org)
近端策略优化(PPO)是用于最后一个阶段的算法之一。PPO 交替进行样本收集和替代目标优化,并允许对收集到的数据进行多次小批量更新。它并不等同于 RLHF:人类反馈决定学习信号,而 PPO 规定优化过程。(arxiv.org)
为避免模型过度偏离初始模型,训练中可以加入基于KL散度的正则化。一个简化的目标为
其中, 是参考策略, 控制惩罚力度。该目标在提高预测奖励与限制回答分布的变化之间取得平衡;训练完成的模型在后续使用时不必再调用奖励模型。(arxiv.org)
相关方法
2023 年提出的直接偏好优化(DPO)从带有 KL 正则化的偏好学习形式中推导出直接训练目标。它利用受偏好和不受偏好的回答来更新语言模型,无需拟合单独的显式奖励模型,也无需运行传统的强化学习采样循环。因此,DPO 与 RLHF 密切相关,但不同于后者采用“奖励模型加策略优化”的实现方式。(arxiv.org)
基于人工智能反馈的强化学习用模型生成的评价替代一部分人类比较评价。在宪法式人工智能中,书面原则指导模型进行评析、修改和偏好判断。人类仍通过这些原则和系统设计影响训练目标,但直接用于训练的偏好标签可以来自另一个人工智能模型。(arxiv.org)
局限性与评估
反馈取决于评价者的选择、评价指引、专业知识以及呈现的样例。评价者可能意见不一、忽略错误,或更偏好有说服力的表达,而非事实准确性。单一的奖励分数也可能将相互冲突的目标压缩成不完整的代理指标。因此,人类偏好评分的提高并不保证模型不会产生人工智能幻觉,也不保证它在评价场景之外表现可靠。(arxiv.org)
当优化过程利用奖励信号的弱点,而非改善预期行为时,就会发生奖励投机。对收集到的比较数据产生过拟合,以及对陌生输入的泛化(机器学习)能力不足,也是需要关注的问题。因此,评估时应区分奖励模型分数、独立的人类评价和特定任务上的表现,并通过留出数据评估、评价者之间的分歧以及能力退化情况,为训练后系统的不同方面提供证据。(arxiv.org)