AI 的不同方向,都在研究什么?
如果一个演示让你好奇,就顺着它问:输入是什么,想得到什么,怎样判断做得好,现在还卡在哪里。下面这些入口从具体事情讲起。
模型怎样理解与生成
- 大语言模型:模型怎样从文本中学习,训练、数据和计算怎样影响它的能力。
- 计算机视觉:从图像里认出东西、找到位置,再到理解场景和三维结构。
- 多模态:把图像、语言等信息接起来,让模型能利用不同来源回答问题。
- 生成模型:怎样从噪声或简单分布生成图像,怎样控制内容和过程。
模型怎样行动
- Agent:给模型工具和环境,观察它怎样把一项任务做完。
- 强化学习:行动会改变后面的处境,怎样利用反馈学会选择。
- World Model:预测行动之后会发生什么,再利用这种预测。
- 具身智能:机器人怎样从观察走到动作,在真实环境里把事情做好。
这些页会互相连接。机器人可以用视觉、生成模型和 RL,Agent 也可以借助 RL 学习。读到交叉的地方,顺着自己的问题走。
模型怎样真正用起来
每页都放了一个开始方式、需要回补的基础,以及几份继续读的材料。想单独找论文,去论文入口;想看研究者最近在关心什么,去 Lookout。