Lookout:研究者和实验室最近在做什么?
有时你不知道自己可以做什么,只是因为还没见过。看看别的实验室、公司和研究者正在解决什么问题,会给你新的参照,也会改变你对一个方向的认识。
AI 与机器人公司
语言、多模态与 AI 系统
腾讯 · 混元
语言、多模态、图像与视频生成;从混元开源项目进入模型、报告与示例。
小米 · MiMo
语言推理、视觉与语音模型;论文入口集中展示训练方法和模型设计。
字节跳动 · Seed
大模型、语音、视觉、世界模型与 AI 系统;研究页可以按主题追踪项目。
月之暗面 · Kimi
长上下文、推理与 Agent;从 Kimi 的开源模型看训练、工具使用和评测。
DeepSeek
MoE、训练效率与推理模型;技术报告能串起架构、训练和工程取舍。
阿里巴巴 · Qwen
语言、代码、视觉语言与全模态模型;按模型系列找权重、示例和报告。
MiniMax
长上下文、推理及多模态生成;可对照注意力设计与推理成本读报告。
智谱 · GLM
语言推理、代码和 Agent;GLM 系列提供模型实现、使用方法与研究材料。
Google DeepMind
Gemini、机器人、强化学习与科学发现;论文页连接模型报告和具体研究。
OpenAI
语言、多模态、推理与 Agent;研究发布和系统卡介绍能力、评测与模型行为。
Anthropic
Claude、可解释性与对齐;研究文章常展开实验设计和模型内部行为。
Meta AI
Llama、视觉与多模态研究;开放模型报告提供数据、训练和部署的系统描述。
机器人与具身智能
这些团队从不同地方推进机器人能力:仿真交互、人类操作数据、通用模型、技能适应,以及真实机器上的控制。下面把研究重点和可以继续读的工作放在一起。
Physical Intelligence · π
研究让机器人完成多种操作任务的通用模型。π0、π0.5 把视觉、语言与动作连接起来,openpi 提供模型与训练、推理代码。
银河通用 · Galbot
围绕具身模型、机器人操作与移动作业开展研发,面向零售、搬运等场景。开发者入口可以继续看感知、规划、控制、导航接口与仿真资源。
智元机器人 · AGIBOT
研发人形机器人与具身智能模型,也开放操作数据和开发工具。AgiBot World 可以用来了解真实机器人数据如何组织,开源项目连接模型与机器人平台。
宇树科技 · Unitree
研发四足与人形机器人,G1、H1 等平台常见于运动控制研究。Unitree RL Gym 提供强化学习训练与部署入口,可以接着看策略如何从仿真走到真机。
星海图 · Galaxea
同时研发轮臂机器人和具身模型,并开放训练与部署工具。G0.5 用同一个自回归模型生成推理与动作,结合跨本体动作编码和视觉历史记忆。
Fast-WAM 比较世界模型的两种作用:训练时学习预测未来,以及执行时真的生成未来。它保留前者、跳过后者,研究动作质量与推理延迟的取舍。
苏度 · Sudo
从仿真训练出发,先解决陌生物体的抓取。官方发布的 sudo R1 使用纯仿真训练数据,每一步动作都根据最新观察调整,闭环频率为 15–25 Hz。
重点看目标移动、抓取中受干扰和狭窄空间绕障时,策略如何继续执行。官网提供技术说明和 60 分钟连续抓取视频。
它石智航 · TARS
研究如何把人类日常操作变成机器人学习的数据。WIYH 提供穿戴式采集设备、自动标注流程,以及超过 1,000 小时的多模态人类操作数据。
沿着 WIYH 看采集、标注与技能迁移;AWE 系列则关注视触觉融合和精细接触操作,包括柔性线束装配。
自变量 · X Square
研究具身基础模型,以及机器人如何适应新任务。HOST 从一段人类示范视频获取新操作技能,在推理时利用示范,不更新模型参数。
WALL-SS 是动作可控的生成式机器人模拟器,研究长时序交互,以及仿真中的任务结果和策略排名能否对应真实机器人。
穹彻 · Noematrix
围绕机器人操作研发具身模型、AnySkill 原子技能库,以及从采集到部署的工具链,涉及抓取、折叠和接触操作。
联合研究 RoboPocket 把策略预测的轨迹叠在手机画面上,让采集者看到潜在错误、补充纠正示范,再通过在线微调更新策略。
破壳 · Pokebot
由许华哲创办,面向家庭场景研究机器人操作。官网展示做饭、叠衣服、系香囊和穿扎带等任务。
可以从演示里看长任务如何衔接、双臂怎样配合,以及柔性物体处理和出错后的恢复。
从一项工作认识做它的人
看到一个让你好奇的演示,先找到原项目。读问题和方法,再看看作者还做过什么,相关工作来自哪些组。沿这条线,你会逐渐认识一个社区。
例如从 ACT / ALOHA 看示范与动作,再追机器人数据和策略学习;从 ReAct 看工具和反馈,再追长任务、恢复与评测。
遇到值得问的问题,可以写下来,回头联系作者或学长。
可以从哪些地方看
OpenAI 发布入口
看模型、研究和工程发布,遇到相关工作再读技术材料和评价条件。
Anthropic Research
看模型内部机制、对齐、实际使用与社会影响等研究;具体文章的出发点和方法也值得读。
**Google DeepMind 论文入口**与 Google Research
用关键词找自己的方向,再沿作者与相关论文继续看。
Berkeley AI Research Blog
从实验室成员解释一项工作的方式,了解研究问题如何被介绍和展开。
Hugging Face Daily Papers
发现论文和讨论,再回原文、代码和作者页面。
媒体和个人博客怎样一起看
机器之心、量子位、新智元、小红书、知乎、B 站、X 和 YouTube 都能让你碰到新东西。对一条消息产生兴趣后,顺着出处读原论文或发布页。
Z Potentials
AI 团队、创业者和技术访谈。看看不同团队在做什么,为什么选择这个问题,技术怎样变成产品。
葬AI
AI 产品体验和行业评论,表达直接、个人观点鲜明。可以从这里看看新产品怎么用,以及大家在争论什么。
个人博客里还会有结果之外的过程。苏剑林适合按数学与模型问题查,Simon Willison有工具实践记录,Karpathy有课程、项目和个人文章。具体经验另见经验栏目。
听研究者讲自己的工作
张小珺 Jùn|商业访谈录
与研究者、创业者长时间对谈,聊技术、工作经历和重要选择。
推荐谢赛宁这一期:从求学、研究经历聊到表征学习、research taste、世界模型和创业。可以先听经历与研究选择,再挑感兴趣的技术部分。
WhyNotTV
研究者访谈与求学经历分享,聊具体做过的工作,也聊一路上的选择。
- 机器人博士前两年总结——任尔东西南北风:何泰然回顾在 CMU 读机器人博士的前两年,串起足式运动、人形机器人遥操作与控制等研究,以及一起完成这些工作的合作者。
- 翁家翌访谈:聊本科接触强化学习、开源项目、申请经历,以及在 OpenAI 做后训练和基础设施的工作。
给自己做一份科研简报
在这些来源里找到了关注的方向,可以让工具定期挑选与你的问题相关的新工作。irene 的经验是先试读一期,再调整选题,最后安排推送时间。
我正在关注[具体问题]。请从最近一周的论文、代码、技术博客和实验室公告里选约五项工作,附日期和原始链接。每项说明做了什么、与我的问题有什么关系,以及接下来值得看哪张图、试哪个项目或追问什么。
参考我提供的最近七天简报和已读清单,去掉重复内容。旧项目出现新结果时,说明新在哪里。
把标题、链接、推送日期和阅读状态留在一份清单中,下一期也交给工具。兴趣权重、完整提示词和定时安排见科研简报工作流;收到论文后,再按阅读目的决定读多深。
看完一项新工作,记下哪些问题?
可以只写几句:这项工作在解决什么,和我原来知道的有什么差别,我想进一步看哪里。遇到值得讨论的,把文章和自己的问题一起发给同学。
如果一段时间总在同一个主题上停下来,也许它就是值得去方向页继续探索的线索。
研究社区与知识分享
OpenEnvision
OpenEnvision(OE)是连接学术界与产业界的开放 AI 研究社区,关注世界模型、多模态、视觉与具身智能,也通过整理博客、访谈和课程,为社区分享研究知识。
- BlogrXiv:AI 研究博客与技术文章:汇集研究博客、实验室文章和技术笔记,可以按方向找机制解释、工程经验与科研方法,再进入作者原文。
- ScholarTube:AI 访谈、播客与课程:收集研究者长访谈、视频播客、完整课程与学术报告,覆盖 Agent、世界模型、视觉、机器人及科研方法,链接到原始视频。
也欢迎向 BlogrXiv 和 ScholarTube 推荐值得分享的文章与视频。
Lumina
Lumina关注具身智能的研究、开源项目与社区交流。想系统了解这个方向,可以读具身智能指南;想听研究者讲正在做的工作,可以从官网的 Talks、具身观察和社区活动进入。
AgentHub
AgentHub(群谈)把 Agent 社区里的讨论整理成日报和周报,涉及智能体研究、工具使用、工程实践与行业动态。可以按日期翻阅,也可以看不同群组的讨论与外部资讯,了解大家最近遇到什么问题、怎样比较技术方案,以及同一个问题有哪些不同判断。