如果系统能预测“我这样做之后会发生什么”,就有机会在真正行动前比较不同选择。世界模型研究怎样表示环境变化,以及这种预测能怎样服务学习和决策。
世界模型尝试从观察和行动中学会环境怎样变化。例如机器人向前推杯子,模型预测杯子接下来会在哪里;智能体还可以比较几种行动的可能结果。预测对象可以是画面,也可以是压缩后的内部状态,关键是这些信息能怎样帮助完成任务。
这里有几条相邻但不同的路线:学习可供控制器使用的环境表示,在模型想象的轨迹里训练策略,或者行动前用模型搜索。生成看起来合理的视频是另一种能力。读论文时,把预测什么、训练谁、最后在哪里测效果分开,会更容易理解它们。
主要任务- 把高维观察压缩成保留任务信息的表示,帮助策略判断当前处境。
- 在学到的环境中产生训练轨迹,减少部分真实交互需求。
- 行动前比较可能的后果,为搜索和规划提供预测。
判断世界模型是否有用,要看它支持了什么决策,以及模型里的好结果能否回到真实任务中成立。
预测动作之后的环境- 01观察与编码
- 02预测后续状态
- 03比较多种未来
- 04实际执行
- 05反馈与校正
发展路线与代表工作
- 2018
把视觉、记忆与控制拆开
World Models 用压缩表示和变化预测支持小控制器,并展示在模型生成的环境里训练。
- 2020
为规划学习需要的信息
MuZero 学习奖励、价值与策略相关的内部状态,用树搜索选行动,不要求把每个未来画面还原出来。
- 2025
在想象轨迹中学习行为
DreamerV3 的正式论文展示同一套配置如何用于多类任务;重点是世界模型、actor 和 critic 怎样配合。
关键概念
- 潜在状态 · Latent state
- 模型内部保存的压缩表示。它可能包含画面与历史信息,但每个维度未必有可读含义。
- 动力学模型 · Dynamics model
- 预测给定当前状态与行动,下一步状态会怎样变化的模型。
- 想象轨迹 · Imagined rollout
- 从一个内部状态出发,反复预测行动后果得到的一段轨迹;它的反馈来自模型。
- 规划与策略 · Planning / Policy
- 规划在决策时比较候选行动序列;策略直接按观察或内部状态输出动作,二者可以结合。
World Models 与 Dreamer
World Models 把观察的压缩、变化预测与控制放在一起,是很直观的入门案例。先沿页面的图和演示,分清每个模块接收什么、输出什么。
接着看 DreamerV3,追踪学到的模型怎样参与行为学习。需要补的主要是表示学习、序列预测,以及 RL 中的策略和回报。
预测什么,用预测做什么
预测的东西是什么? 可以是图像、压缩后的状态或其他表示。选择不同表示,会影响训练难度,也会影响它保留了哪些信息。
预测用来做什么? 生成后续画面、模拟交互、训练策略和规划动作,对模型提出的要求不完全相同。想看行动是否真的变好,就需要把模型接到任务结果上评价。
图像或视频生成可以接生成模型,机器人应用可以接具身。
拆解一个世界模型系统
画出 World Models 中数据与模块的关系,找一段预测失败的现象,想想它会怎样影响后面的决策。接下来再按原项目的条件尝试运行或训练。长时间训练不必成为第一次接触的起点。
Awesome World Models可以继续按主题找文章。选一条用途深入,比把所有带 world model 名字的系统混在一起更容易形成自己的理解。
世界模型论文与研究笔记
World Model 资料目录保留经典项目和论文索引;Purshow Notes还有 WAM 等技术笔记入口,按当前问题查阅。
代表论文
从 World Models 的交互图开始,再把 MuZero 和 Dreamer 放在一起看:它们需要的预测信息和使用预测的时机不同。
入门练习
卡在某一步?把过程带到 AMA 一起聊 ↗