让机器人把杯子放到架子上,需要看清杯子与架子的位置,选动作,控制身体,还要应对杯子滑了、角度变了、之前没见过的环境。你在视频里看到几秒钟的动作,背后连着数据、学习、控制和系统。
具身智能研究一个有身体、能行动的系统怎样理解环境并完成任务。机器人拿杯子时,识别出杯子只是开始:它还要决定从哪抓、移动多远、接触后怎样调整。感知、规划、控制和学习在这里接到一起,最终要落实到身体与环境的真实互动。
这页先从机器人操作认识问题,再向导航、移动和更复杂的身体扩展。示范学习让模型模仿人做过的动作;VLA 把视觉、语言与动作接起来;强化学习通过交互反馈改进策略。它们可以组合,数据覆盖、动作接口和评估条件往往和模型同样关键。
主要任务- 根据相机和身体状态执行抓取、放置等操作任务。
- 把人的指令转成适合具体机器人执行的动作。
- 在物体位置、背景或任务变化时继续行动,并用反馈修正偏差。
看机器人演示时,先问它看见了什么、执行什么动作、在哪些初始条件下测过,再讨论泛化。
观察、动作与反馈- 01图像与关节状态
- 02编码输入
- 03生成动作序列
- 04抓取与放置
- 05观察执行结果
发展路线与代表工作
- 2022
用多任务示范训练动作模型
RT-1 把语言指令、相机观察与机器人动作连接起来,研究真实机器人数据的规模与多样性。
- 2023
把动作序列作为生成对象
Diffusion Policy 用去噪过程生成连续动作序列,让多种合理动作的分布有更合适的表达。
- 2023
把视觉语言知识带进控制
RT-2 把动作编码成 token,与视觉语言任务一起训练,探索语义知识怎样帮助机器人选动作。它与动作生成方法可以交叉。
- 2024
用视觉语言模型生成连续动作
π0 将预训练视觉语言模型与 flow matching 动作专家结合,用跨机器人数据学习通用策略,再针对任务微调。
- 2025
把任务带到新的家庭环境
π0.5 联合训练多种数据与任务,研究机器人在未见过的家庭环境中完成多阶段操作。
关键概念
- 模仿学习 · Imitation learning
- 从示范中的观察与动作配对学习策略。示范没覆盖到的处境,往往也是部署时容易出问题的地方。
- VLA · Vision–Language–Action
- 接收视觉与语言条件、输出动作的模型类别;动作可以是离散 token,也可以用连续数值表示。
- 动作序列 · Action chunk
- 一次预测接下来若干步动作,再执行其中一部分并重新观察。长度会影响平滑性与反馈频率。
- 闭环控制 · Closed loop
- 执行后再次观察,根据环境的新状态调整动作;不同系统的反馈速度与接口并不一样。
ACT 与 Diffusion Policy:动作从哪里来
先看 ACT / ALOHA 的项目视频和方法图。选一个双臂操作任务,沿着示范数据、相机输入、动作预测去理解它。再看 Diffusion Policy,比较另一种动作建模方式。
第一次读到这里,能说清模型看到什么、输出什么、怎样判断任务完成,就可以带着问题继续。
模仿学习、VLA 与控制
操作与模仿学习。 从人给出的示范中学习动作。继续看数据怎样采集、动作怎样表示、训练与部署有什么差别。用 LeRobot看项目结构和数据入口。
VLA 与泛化。 语言、视觉和动作怎样连接?换指令、物体或环境后能否继续工作?配合多模态看模型,用 Open X-Embodiment看不同来源的机器人数据。
强化学习与控制。 如果动作需要通过反馈改进,就回强化学习。想理解接触、几何与控制本身,可以查 MIT Robotic Manipulation;动力学与控制还可进入 Underactuated Robotics。
从机器人数据到仿真实验
先在数据里找到一段真实任务,看看图像与动作怎样对应,再尝试所选项目的推理或仿真例子。RoboTwin是继续了解仿真任务、数据和评价的入口。
真实机器人、仿真和只读离线数据需要的条件不同。选中项目后先看设备、显存、系统与数据要求,再决定做到哪一层。
具身路线与细分论文索引
Lumina 具身智能指南用来查看更完整的版图。已有问题后,再查 RL-VLA、人形机器人学习或高效 VLA的论文索引。
看一次成功演示之后,也问问失败集中在哪里、起始条件怎样设定。这个问题会把你带回实验与评估。
具身社区、团队与 Scaling
Lumina、课程和项目与具身细分 paper list都保留在目录里。想认识具体做这些事的人,去课题组入口;数据和 scaling 方面也可读邹嘉轩的观点。
代表论文
先看项目的任务视频,再读方法图;把相同任务的输入、动作输出和训练数据列在一起。
入门练习
卡在某一步?把过程带到 AMA 一起聊 ↗