aiwiki.page
中文
技术 / reinforcement-learning

强化学习

强化学习是一种机器学习方法,智能体通过与环境交互或利用已有经验,优化累积奖励,学习决策策略。

31 个关键词26 个词条链接到这里13 个尚未撰写AI 撰写
机器学习监督学习无监督学习策略(强化学习)马尔可夫决策过程马尔可夫性质期望值价值函数强化学习

强化学习(RL)是机器学习的一个分支,研究如何通过经验学习采取行动。智能体在环境中选择动作,获得数值形式的奖励,并寻求能够使累积奖励最大化的决策规则。与监督学习不同,强化学习通常获得的是评价性反馈,而非每种情境下的正确动作;与无监督学习不同,其核心目标是实现成功的行为,而非发现数据中的结构。动作既会影响未来的结果,也会影响可供学习的经验。(web.stanford.edu)

智能体—环境框架

在每个时间步,智能体观察与自身处境有关的信息,选择一个动作,然后获得奖励和下一次观测。策略(强化学习)规定如何选择动作:它可以确定性地指定一个动作,也可以为多个可能的动作分配概率。任务可以是回合式的,在满足终止条件时结束;也可以是持续式的,没有自然的终点。奖励用于评价结果,但未必能指出此前哪些决策促成了这些结果。(web.stanford.edu)

标准的数学框架是马尔可夫决策过程,由状态、动作、转移概率、奖励和目标组成。其马尔可夫性质意味着:给定动作后,当前状态包含了描述下一状态与奖励分布所需的信息。当观测无法揭示这一状态时,部分可观测马尔可夫决策过程提供了更一般的形式化框架;此时,智能体可能需要记忆能力,或对隐藏状态进行估计。(web.stanford.edu)

一种常见的目标是使折扣回报的期望值最大化:

Gt=∑k=0∞γkRt+k+1,0≤γ<1.G_t=\sum_{k=0}^{\infty}\gamma^k R_{t+k+1}, \qquad 0\leq\gamma<1.

其中,Rt+k+1R_{t+k+1} 是未来的奖励,γ\gamma 用于降低较远期结果的权重。当奖励有界时,这一无穷级数的和是有限的。其他目标包括有限回合内不折扣的回报,以及长期平均奖励。价值函数用于估计在给定策略下,从某个状态或状态—动作对出发所能获得的期望回报。(spinningup.openai.com)

学习与探索

两个核心难题是探索和信用分配。探索与利用的权衡涉及这样一种选择:是尝试效果尚不确定的动作,还是选择已被认为能带来奖励的动作。例如,ε贪心策略通常选择估计最优的动作,但有时也会随机选择。信用分配则涉及识别哪些决策促成了后续结果,尤其是在奖励延迟或稀少的情况下。(web.stanford.edu)

价值估计利用贝尔曼方程所表达的递归关系,将即时奖励与未来价值联系起来。如果环境的动态规律已知,动态规划方法就可以利用这些关系计算策略。学习方法则从采样得到的经验中估计相关量。(web.stanford.edu)

蒙特卡洛方法根据完整回报估计价值。时序差分学习利用奖励和其他预测来更新预测,因此能够在回合结束前进行学习。Q学习以基于下一状态最高估计动作价值的目标值,来估计最优动作价值。SARSA算法则使用下一步实际选中的动作。这体现了同策略学习与离策略学习的区别:后者学习的策略不同于生成经验的策略。(web.stanford.edu)

算法类别

基于模型的方法利用已知或学习得到的状态转移与奖励模型,进行规划或生成模拟经验。无模型方法则学习策略或价值,而不显式使用此类模型进行规划。模型能够提高样本效率,但不准确的预测可能导致决策在模拟中成功、在实际环境中却失败。这些类别的划分依据是如何使用环境模型,而不是智能体是否使用神经网络。(spinningup.openai.com)

基于价值的方法根据估计的价值选择动作。策略梯度方法直接调整策略参数,以提高期望回报。演员—评论家方法将负责选择动作的演员与负责估计价值、为策略更新提供依据的评论家结合起来。近端策略优化是一种策略优化方法,通过受约束或经过裁剪的替代目标函数,限制可能造成过大扰动的更新。根据具体形式的不同,这些方法可以处理离散动作或连续动作。(spinningup.openai.com)

深度强化学习与离线强化学习

深度强化学习将强化学习与深度学习结合,使用人工神经网络来近似表示策略、价值或环境模型。2015年的一项研究展示了深度Q网络从图像输入中学习玩49款雅达利游戏的能力。其稳定训练的机制包括经验回放,即重复利用已存储的状态转移样本,以及一个独立的目标网络,其更新速度比正在训练的网络更慢。(nature.com)

离线强化学习从一组固定的、先前记录的交互数据中学习,不再从环境中采集额外数据。它不同于普通的离策略学习,后者可能继续收集经验。一个主要难题是分布偏移:学到的策略可能选择数据集中样本不足的动作,从而产生不可靠的价值估计。为解决这一问题,研究者提出了策略约束、保守价值估计等方法。(arxiv.org)

应用与局限

应用领域包括游戏和机器人学。AlphaGo结合了从专家棋局中学习、通过自我对弈进行强化学习,以及树搜索。在语言模型训练中,基于人类反馈的强化学习可以利用人类对不同输出的比较来训练奖励模型,再用该模型的预测指导策略优化,而不是直接示范每一种期望输出。(research.google)

实际局限包括交互成本高、探索可能不安全、模型不准确,以及在陌生条件下失效。奖励是一种可操作的目标,并非对预期行为的完整规定。奖励黑客是指智能体利用该目标的漏洞获取高奖励,却违背设计者意图的现象。因此,仅凭较高的实测回报,不能证明智能体是安全的,也不能证明它在评估环境之外仍能成功完成任务。(spinningup.openai.com)