AI 的不同方向,都在研究什么?

如果一个演示让你好奇,就顺着它问:输入是什么,想得到什么,怎样判断做得好,现在还卡在哪里。下面这些入口从具体事情讲起。

模型怎样理解与生成

  • 大语言模型:模型怎样从文本中学习,训练、数据和计算怎样影响它的能力。
  • 计算机视觉:从图像里认出东西、找到位置,再到理解场景和三维结构。
  • 多模态:把图像、语言等信息接起来,让模型能利用不同来源回答问题。
  • 生成模型:怎样从噪声或简单分布生成图像,怎样控制内容和过程。

模型怎样行动

  • Agent:给模型工具和环境,观察它怎样把一项任务做完。
  • 强化学习:行动会改变后面的处境,怎样利用反馈学会选择。
  • World Model:预测行动之后会发生什么,再利用这种预测。
  • 具身智能:机器人怎样从观察走到动作,在真实环境里把事情做好。

这些页会互相连接。机器人可以用视觉、生成模型和 RL,Agent 也可以借助 RL 学习。读到交叉的地方,顺着自己的问题走。

模型怎样真正用起来

  • 效率与系统:为什么程序慢、显存不够,怎样在质量、延迟和成本之间做选择。
  • AI 交叉学科:当问题来自分子、医学图像或关系数据,模型之外还需要理解什么。

每页都放了一个开始方式、需要回补的基础,以及几份继续读的材料。想单独找论文,去论文入口;想看研究者最近在关心什么,去 Lookout。

继续找课程、论文和研究者

各方向完整资料保留了 Lumina、awesome、课程、论文和项目。想知道这些问题有哪些人在做,继续看课题组入口。