World Model:先预测,再行动

如果系统能预测“我这样做之后会发生什么”,就有机会在真正行动前比较不同选择。世界模型研究怎样表示环境变化,以及这种预测能怎样服务学习和决策。

世界模型尝试从观察和行动中学会环境怎样变化。例如机器人向前推杯子,模型预测杯子接下来会在哪里;智能体还可以比较几种行动的可能结果。预测对象可以是画面,也可以是压缩后的内部状态,关键是这些信息能怎样帮助完成任务。

这里有几条相邻但不同的路线:学习可供控制器使用的环境表示,在模型想象的轨迹里训练策略,或者行动前用模型搜索。生成看起来合理的视频是另一种能力。读论文时,把预测什么、训练谁、最后在哪里测效果分开,会更容易理解它们。

主要任务
  • 把高维观察压缩成保留任务信息的表示,帮助策略判断当前处境。
  • 在学到的环境中产生训练轨迹,减少部分真实交互需求。
  • 行动前比较可能的后果,为搜索和规划提供预测。

判断世界模型是否有用,要看它支持了什么决策,以及模型里的好结果能否回到真实任务中成立。

预测动作之后的环境
  1. 01观察与编码
  2. 02预测后续状态
  3. 03比较多种未来
  4. 04实际执行
  5. 05反馈与校正

发展路线与代表工作

  1. 2018

    把视觉、记忆与控制拆开

    World Models 用压缩表示和变化预测支持小控制器,并展示在模型生成的环境里训练。

  2. 2020

    为规划学习需要的信息

    MuZero 学习奖励、价值与策略相关的内部状态,用树搜索选行动,不要求把每个未来画面还原出来。

  3. 2025

    在想象轨迹中学习行为

    DreamerV3 的正式论文展示同一套配置如何用于多类任务;重点是世界模型、actor 和 critic 怎样配合。

关键概念

潜在状态 · Latent state
模型内部保存的压缩表示。它可能包含画面与历史信息,但每个维度未必有可读含义。
动力学模型 · Dynamics model
预测给定当前状态与行动,下一步状态会怎样变化的模型。
想象轨迹 · Imagined rollout
从一个内部状态出发,反复预测行动后果得到的一段轨迹;它的反馈来自模型。
规划与策略 · Planning / Policy
规划在决策时比较候选行动序列;策略直接按观察或内部状态输出动作,二者可以结合。

World Models 与 Dreamer

World Models 把观察的压缩、变化预测与控制放在一起,是很直观的入门案例。先沿页面的图和演示,分清每个模块接收什么、输出什么。

接着看 DreamerV3,追踪学到的模型怎样参与行为学习。需要补的主要是表示学习、序列预测,以及 RL 中的策略和回报。

预测什么,用预测做什么

预测的东西是什么? 可以是图像、压缩后的状态或其他表示。选择不同表示,会影响训练难度,也会影响它保留了哪些信息。

预测用来做什么? 生成后续画面、模拟交互、训练策略和规划动作,对模型提出的要求不完全相同。想看行动是否真的变好,就需要把模型接到任务结果上评价。

图像或视频生成可以接生成模型,机器人应用可以接具身。

拆解一个世界模型系统

画出 World Models 中数据与模块的关系,找一段预测失败的现象,想想它会怎样影响后面的决策。接下来再按原项目的条件尝试运行或训练。长时间训练不必成为第一次接触的起点。

Awesome World Models可以继续按主题找文章。选一条用途深入,比把所有带 world model 名字的系统混在一起更容易形成自己的理解。

世界模型论文与研究笔记

World Model 资料目录保留经典项目和论文索引;Purshow Notes还有 WAM 等技术笔记入口,按当前问题查阅。

代表论文

从 World Models 的交互图开始,再把 MuZero 和 Dreamer 放在一起看:它们需要的预测信息和使用预测的时机不同。

2018 · arXiv

World Models

World Models · Ha & Schmidhuber · Fig. 4
论文原图 · Ha & Schmidhuber · Fig. 4 · 论文原文

它在解决什么

能否先学环境表示,再用很小的控制器完成任务?

核心想法

视觉模块压缩画面,循环模型学习变化,控制器利用二者提供的信息选动作。

为什么选这篇

交互页面让几个模块各自做什么非常直观。

第一遍读哪里

先看 Agent Model 与 Car Racing,再看在 VizDoom 的想象环境中训练。

读完还要问

控制器可能利用模型误差;模型内高回报需要回到原环境检验。

2020 · Nature

Mastering Atari, Go, chess and shogi by planning with a learned model

Mastering Atari, Go, chess and shogi by planning with a learned model · Schrittwieser et al. (2020), Fig. 1
论文原图 · Schrittwieser et al. (2020), Fig. 1 · 论文原文

它在解决什么

不知道环境动力学规则时,能否学一个帮助搜索的模型?

核心想法

在内部状态里预测奖励、价值与动作策略,用树搜索比较选择。

为什么选这篇

它说明有用的模型不必还原所有像素,预测目标可以围绕决策来设计。

第一遍读哪里

先看 planning、acting、training 的流程,再看游戏实验。

读完还要问

论文测试的是特定游戏与动作接口。

2025 · Nature

Mastering diverse control tasks through world models

Mastering diverse control tasks through world models · Hafner et al. (2025), Fig. 1 (CC BY 4.0)
论文原图 · Hafner et al. (2025), Fig. 1 (CC BY 4.0) · 论文原文

它在解决什么

怎样让同一套世界模型学习算法适应不同任务的信号尺度?

核心想法

用交互经验训练世界模型,在预测轨迹中训练 actor 与 critic,并稳定不同损失与信号的尺度。

为什么选这篇

它把世界模型与行为学习连起来,也展示跨任务评估应怎样组织。

第一遍读哪里

先看训练流程图与 Learning algorithm,再看任务分组和消融。

读完还要问

统一配置不等于一个预训练模型直接通吃所有任务;各任务仍需训练与交互。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗