具身智能:从看见到行动

让机器人把杯子放到架子上,需要看清杯子与架子的位置,选动作,控制身体,还要应对杯子滑了、角度变了、之前没见过的环境。你在视频里看到几秒钟的动作,背后连着数据、学习、控制和系统。

具身智能研究一个有身体、能行动的系统怎样理解环境并完成任务。机器人拿杯子时,识别出杯子只是开始:它还要决定从哪抓、移动多远、接触后怎样调整。感知、规划、控制和学习在这里接到一起,最终要落实到身体与环境的真实互动。

这页先从机器人操作认识问题,再向导航、移动和更复杂的身体扩展。示范学习让模型模仿人做过的动作;VLA 把视觉、语言与动作接起来;强化学习通过交互反馈改进策略。它们可以组合,数据覆盖、动作接口和评估条件往往和模型同样关键。

主要任务
  • 根据相机和身体状态执行抓取、放置等操作任务。
  • 把人的指令转成适合具体机器人执行的动作。
  • 在物体位置、背景或任务变化时继续行动,并用反馈修正偏差。

看机器人演示时,先问它看见了什么、执行什么动作、在哪些初始条件下测过,再讨论泛化。

观察、动作与反馈
  1. 01图像与关节状态
  2. 02编码输入
  3. 03生成动作序列
  4. 04抓取与放置
  5. 05观察执行结果

发展路线与代表工作

  1. 2022

    用多任务示范训练动作模型

    RT-1 把语言指令、相机观察与机器人动作连接起来,研究真实机器人数据的规模与多样性。

  2. 2023

    把动作序列作为生成对象

    Diffusion Policy 用去噪过程生成连续动作序列,让多种合理动作的分布有更合适的表达。

  3. 2023

    把视觉语言知识带进控制

    RT-2 把动作编码成 token,与视觉语言任务一起训练,探索语义知识怎样帮助机器人选动作。它与动作生成方法可以交叉。

  4. 2024

    用视觉语言模型生成连续动作

    π0 将预训练视觉语言模型与 flow matching 动作专家结合,用跨机器人数据学习通用策略,再针对任务微调。

  5. 2025

    把任务带到新的家庭环境

    π0.5 联合训练多种数据与任务,研究机器人在未见过的家庭环境中完成多阶段操作。

关键概念

模仿学习 · Imitation learning
从示范中的观察与动作配对学习策略。示范没覆盖到的处境,往往也是部署时容易出问题的地方。
VLA · Vision–Language–Action
接收视觉与语言条件、输出动作的模型类别;动作可以是离散 token,也可以用连续数值表示。
动作序列 · Action chunk
一次预测接下来若干步动作,再执行其中一部分并重新观察。长度会影响平滑性与反馈频率。
闭环控制 · Closed loop
执行后再次观察,根据环境的新状态调整动作;不同系统的反馈速度与接口并不一样。

ACT 与 Diffusion Policy:动作从哪里来

先看 ACT / ALOHA 的项目视频和方法图。选一个双臂操作任务,沿着示范数据、相机输入、动作预测去理解它。再看 Diffusion Policy,比较另一种动作建模方式。

第一次读到这里,能说清模型看到什么、输出什么、怎样判断任务完成,就可以带着问题继续。

模仿学习、VLA 与控制

操作与模仿学习。 从人给出的示范中学习动作。继续看数据怎样采集、动作怎样表示、训练与部署有什么差别。用 LeRobot看项目结构和数据入口。

VLA 与泛化。 语言、视觉和动作怎样连接?换指令、物体或环境后能否继续工作?配合多模态看模型,用 Open X-Embodiment看不同来源的机器人数据。

强化学习与控制。 如果动作需要通过反馈改进,就回强化学习。想理解接触、几何与控制本身,可以查 MIT Robotic Manipulation;动力学与控制还可进入 Underactuated Robotics。

从机器人数据到仿真实验

先在数据里找到一段真实任务,看看图像与动作怎样对应,再尝试所选项目的推理或仿真例子。RoboTwin是继续了解仿真任务、数据和评价的入口。

真实机器人、仿真和只读离线数据需要的条件不同。选中项目后先看设备、显存、系统与数据要求,再决定做到哪一层。

具身路线与细分论文索引

Lumina 具身智能指南用来查看更完整的版图。已有问题后,再查 RL-VLA、人形机器人学习或高效 VLA的论文索引。

看一次成功演示之后,也问问失败集中在哪里、起始条件怎样设定。这个问题会把你带回实验与评估。

具身社区、团队与 Scaling

Lumina、课程和项目与具身细分 paper list都保留在目录里。想认识具体做这些事的人,去课题组入口;数据和 scaling 方面也可读邹嘉轩的观点。

代表论文

先看项目的任务视频,再读方法图;把相同任务的输入、动作输出和训练数据列在一起。

2022 · arXiv

RT-1: Robotics Transformer for Real-World Control at Scale

RT-1: Robotics Transformer for Real-World Control at Scale · Brohan et al., RT-1, Figure 1(a)
论文原图 · Brohan et al., RT-1, Figure 1(a) · 论文原文

它在解决什么

一个模型能否从多任务机器人数据学习按指令行动?

核心想法

把图像特征与语言条件送入 Transformer,预测离散化后的机器人动作。

为什么选这篇

它让数据规模、任务多样性与机器人泛化之间的关系变得具体。

第一遍读哪里

先看输入输出和数据采集,再看新任务、干扰与新环境的评估设置。

读完还要问

结果依赖特定机器人与动作接口。

2023 · Robotics: Science and Systems

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion · Chi et al. · Fig. 3
论文原图 · Chi et al. · Fig. 3 · 论文原文

它在解决什么

同一场景有多种可行动作时,怎样学出连贯的动作序列?

核心想法

以观察为条件,逐步去噪生成动作序列,执行一部分后再观察与预测。

为什么选这篇

它是理解生成模型怎样进入机器人控制的直观案例。

第一遍读哪里

先看动作去噪与滚动执行,再看 Push-T 的成功和失败视频。

读完还要问

多步去噪带来推理开销;示范覆盖与控制频率仍会限制部署。

2023 · CoRL

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control · Zitkovich et al. · Fig. 1
论文原图 · Zitkovich et al. · Fig. 1 · 论文原文

它在解决什么

互联网上学到的视觉语言知识能否帮助机器人理解新指令?

核心想法

把机器人动作写成 token,与视觉语言数据联合微调,让模型直接输出动作。

为什么选这篇

它帮助理解 VLA 的出发点:语义知识怎样接到已有动作能力。

第一遍读哪里

先看动作编码,再看语义泛化的任务与失败边界。

读完还要问

语义泛化不自动带来新的底层运动技能,机器人示范仍然重要。

2024 · arXiv

π0: A Vision-Language-Action Flow Model for General Robot Control

π0: A Vision-Language-Action Flow Model for General Robot Control · Physical Intelligence · Fig. 1
论文原图 · Physical Intelligence · Fig. 1 · 论文原文

它在解决什么

怎样把视觉语言模型接到连续动作,让同一个策略学习多种机器人的任务?

核心想法

在预训练视觉语言模型上接入动作专家,用 flow matching 生成连续动作序列;先用多种机器人的示范预训练,再用任务数据微调。

为什么选这篇

它把视觉语言预训练、动作生成和跨机器人数据放进同一套方案,接上了前面的 RT-2 与 Diffusion Policy。

第一遍读哪里

从第一页总览图看数据和任务,再读动作专家的结构;对照预训练后直接执行与任务微调后的实验。

2025 · arXiv

π0.5: a Vision-Language-Action Model with Open-World Generalization

π0.5: a Vision-Language-Action Model with Open-World Generalization · Physical Intelligence · Fig. 1
论文原图 · Physical Intelligence · Fig. 1 · 论文原文

它在解决什么

机器人到了训练时没去过的家里,还能完成整理房间这样的长任务吗?

核心想法

在 π0 基础上联合训练机器人动作、子任务预测、物体检测和网络视觉语言数据,把高层子任务与连续动作连接起来。

为什么选这篇

它把问题推进到新家庭环境中的多阶段操作,适合看训练数据的组成怎样影响泛化。

第一遍读哪里

先看第一页的数据来源与部署场景,再看新家庭环境的测试设置,以及不同数据来源的消融实验。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗