强化学习:行动之后还有后果

有些选择会改变接下来能看到什么、能做什么。游戏里现在拿到一小份奖励,可能错过后面的机会;机器人某一步动作也会影响后续能不能完成任务。强化学习研究怎样利用交互反馈学会行动。

强化学习关心一串行动怎样得到好的结果。模型每次看到环境给出的观察,选一个动作,再收到新的观察和奖励;眼前得分高,未必最后做得好。它适合游戏决策、机器人控制等需要反复交互的问题,也被用于语言模型的后训练。

入门时先分清两件事:怎样判断一个动作值得做,怎样根据这个判断改变行动。价值学习、策略优化和两者结合的 Actor–Critic 是几种常见思路。再去看数据从哪里来、能否重复利用、奖励怎样定义,就能理解算法差异落在哪里。

主要任务
  • 在当前收益与未来机会之间做选择,例如游戏中是否先收集资源。
  • 在连续动作空间里学控制,例如给关节施加多大的力。
  • 用任务反馈改进已有策略,例如根据答案是否通过验证来调整生成行为。

先把状态、动作、奖励和数据来源写清楚,再选算法;训练曲线升高之后,还要看策略到底学会了什么。

奖励怎样改变策略
  1. 01探索与回报
  2. 02估计状态价值
  3. 03形成行动策略
  4. 04执行策略

发展路线与代表工作

  1. 2015

    估计行动的长期价值

    DQN 用神经网络估计每个离散动作的未来回报,把从像素学习与价值更新接在一起。

  2. 2017

    直接改进选动作的策略

    PPO 用新采集的交互数据更新策略,并抑制一次更新中的过大变化。

  3. 2018

    重复利用经验,同时保留探索

    SAC 结合策略与价值网络,用回放数据学习连续控制,并在目标中加入策略熵。三条路按数据与动作条件选择。

关键概念

策略 · Policy
根据观察选择动作的规则,可以输出一个确定动作,也可以输出动作的概率分布。
奖励与回报 · Reward / Return
奖励是某一步的反馈;回报把后续奖励累积起来,常用折扣降低远期奖励的权重。
价值 · Value
在某个状态,或先做某个动作之后,按一定策略继续行动能获得多少预期回报。
On-policy / Off-policy
前者主要用当前策略附近采集的数据更新;后者能学习来自其他策略或旧策略的经验。

状态、动作、奖励与一次交互

用动手学强化学习认识状态、动作、奖励、回报和策略,再看 Gymnasium Basic Usage 中观察与动作怎样流动。

先追踪一次运行:环境给了什么,策略选了什么,环境怎样变化,一次任务何时结束。能把这一轮讲清楚,再看算法怎样利用这些记录更新。

价值估计与策略优化

一条路线是估计某种处境或动作以后能得到多少回报,另一条路线是直接调整选动作的策略。它们在很多算法中会结合。

读到期望和条件概率,去数学基础补;读到神经网络训练,再回 DL。接着选 CleanRL 中一个适合自己的实现,把更新公式与代码对应起来。

想系统深入,进入 Berkeley 深度强化学习课程;偏好中文的另一种讲法,可以看 Easy RL。

强化学习的几条研究路线

同样是根据反馈改进策略,语言模型输出的是 token,Agent 会调用工具,人形机器人要控制关节。这些方向共享一些算法,也有各自的数据、环境和评测方式。下面按研究问题找入口;Model-based、离线学习等方法,也可以用于机器人和其他任务。

语言模型后训练:让回答更符合目标

模型已经会生成文字,接下来怎样让它遵循指令、解对题目?RL 可以用人类偏好训练出的奖励模型,也可以用答案或程序测试提供可验证的反馈。这里要看清奖励来自哪里,以及高奖励是否对应更好的回答。

  • InstructGPT:从人工示范、偏好比较到奖励模型与策略优化,认识 RLHF 的训练流程。
  • DeepSeek-R1:看推理任务的奖励设计,以及 R1-Zero 与 R1 不同的训练流程。
  • verl:沿着采样回答、计算奖励、更新策略的过程读实现。模型报告的更多入口在 LLM 页。

Agentic RL:学会在多轮交互中完成任务

Agent 的一次行动可能是搜索、执行代码或操作界面,工具返回的结果又会影响下一步。训练需要处理整段交互:哪一步带来了最终成功,错误怎样累积,模型是否学会了合理使用工具。

  • Search-R1:把搜索接入推理过程,用 RL 学习何时检索、怎样利用结果;附项目代码。
  • RAGEN:围绕多轮交互研究训练稳定性、环境反馈与策略学习。

读时追踪一条完整轨迹:哪些内容由模型生成,哪些来自环境,奖励在什么时候给出。工具调用与任务执行的基础放在 Agent 页。

人形机器人:从运动控制到 Sim-to-Real

站稳、行走、跟随动作乃至全身协同,需要策略连续控制身体。训练常在仿真中进行,再迁移到真机;接触、延迟和动力学差异都会影响表现。重点是观察量、动作表示、奖励,以及仿真与现实怎样对齐。

  • Humanoid-Gym:从人形机器人运动控制认识仿真训练与零样本 Sim-to-Real 迁移。
  • ASAP:通过对齐仿真与真实动力学,学习敏捷的全身动作。
  • Unitree RL Gym:对照机器人配置、训练环境和部署代码看一套控制流程。操作任务与 VLA 模型接着看具身智能。

Model-based RL:预测行动的后果

先学习环境怎样随动作变化,再用这个模型训练策略或规划行动。模型可以在潜空间里预测,不必生成一张清晰图片。需要分清两件事:策略是否在想象轨迹中学习,执行时是否还会搜索候选动作。

  • DreamerV3:学习世界模型,在想象轨迹中训练行为;看模型学习与策略学习怎样衔接。
  • TD-MPC2:学习用于控制的潜空间模型,并通过模型预测控制选择动作;对照它与 Dreamer 的决策方式。

更广的预测、视频模拟与交互环境见世界模型。

离线 RL:从已有交互数据学习

当真机试错昂贵,或只能使用已经收集的数据时,就需要从固定数据集中学习策略。行为克隆直接模仿数据里的动作;离线 RL 还利用奖励与长期回报,但要处理策略偏离数据分布后的价值估计问题。

  • CQL:通过保守的价值估计,抑制对数据覆盖不足的动作过度乐观。
  • IQL:通过隐式价值学习和优势加权的策略提取,减少训练时对分布外动作价值的依赖。

阅读时留意数据由什么策略收集、覆盖哪些行为,以及论文怎样评估超出示范水平的改进。

多智能体 RL:多个决策者怎样协作

多个智能体同时行动时,每个个体看到的信息可能不完整,其他个体的策略也在变化。合作、竞争、通信和信用分配都由此出现;共享团队奖励时,怎样判断每个个体的贡献尤其重要。

  • MAPPO:看 PPO 在合作式多智能体任务中的表现,以及集中式价值估计、分散执行的做法。
  • 官方实现:对照环境中的局部观察、全局信息与各智能体动作,理解训练和执行各能使用什么信息。

LLM 多 Agent 系统也涉及协作;其中是否使用 RL,要看策略有没有通过交互奖励训练。

改变奖励,观察策略

在同一个小环境里保留配置,重复运行,看看训练曲线与最终表现是否一致。然后改一个奖励设置,观察策略是否出现你没预料到的行为。结果异常时,先回到轨迹,看实际发生了什么。

强化学习教材、实现与项目

中文教材、小环境、实现和深入课程收在强化学习资料目录。遇到机器人与控制问题,也可以去课题组入口找相关项目。

代表论文

先读 DQN 的交互与更新过程,再比较 PPO、SAC 如何用数据;第一遍能说清各自学什么、用什么数据就很有收获。

2015 · Nature

Human-level control through deep reinforcement learning

Human-level control through deep reinforcement learning · Mnih et al. · Fig. 1
论文原图 · Mnih et al. · Fig. 1 · 论文原文

它在解决什么

怎样从游戏画面学会选择离散动作?

核心想法

网络预测动作价值;经验回放与延迟更新的目标网络帮助稳定学习。

为什么选这篇

它把观察、动作价值和训练目标接得很清楚,是理解深度 RL 的入口。

第一遍读哪里

先看智能体与环境的交互,再追踪 Q 值更新与 Atari 评估。

读完还要问

原方法按离散动作估值;连续控制通常需要不同处理。

2017 · arXiv

Proximal Policy Optimization Algorithms

Proximal Policy Optimization Algorithms · Schulman et al. (2017), Fig. 1
论文原图 · Schulman et al. (2017), Fig. 1 · 论文原文

它在解决什么

怎样让策略更新容易实现,又不轻易跨得太大?

核心想法

常用版本对新旧动作概率的比值做裁剪,让过度改变策略不再获得额外的目标收益。

为什么选这篇

它是读策略梯度与理解许多 RL 实现的实用起点。

第一遍读哪里

先看 clipped surrogate objective,再看采样与多轮小批次更新。

读完还要问

裁剪不是性能单调提升的保证;数据采集和实现细节仍影响结果。

2018 · ICML

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor · Haarnoja et al. (2018), Fig. 1
论文原图 · Haarnoja et al. (2018), Fig. 1 · 论文原文

它在解决什么

怎样反复利用交互数据,并避免策略太早只选一种动作?

核心想法

策略追求回报,也保留一定随机性;价值网络评价动作,回放缓冲区提供旧经验。

为什么选这篇

用它比较 PPO,容易看清数据复用和探索目标的区别。

第一遍读哪里

先看最大熵目标,再追踪 actor、critic 与 replay buffer 的关系。

读完还要问

该论文主要研究连续控制;熵与奖励的尺度会影响行为。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗