挑一篇论文读

代表作小卡

先挑一个方向,再选一篇看它怎样提出问题、怎样验证想法。卡片里有短介绍、阅读切入点和原文。

49 篇代表作

2012 · NIPS 2012

ImageNet Classification with Deep Convolutional Neural Networks

ImageNet Classification with Deep Convolutional Neural Networks · Krizhevsky et al. · Fig. 2
论文原图 · Krizhevsky et al. · Fig. 2 · 论文原文

它在解决什么

能否让网络从大量图片里学出识别物体的特征?

核心想法

用多层卷积从像素逐层提取特征,配合 GPU 训练、ReLU 和抑制过拟合的办法。

为什么选这篇

它适合用来认识数据规模、计算和训练方法怎样共同促成进展。

第一遍读哪里

先看网络结构与训练做法,再看分类结果和错误示例。

读完还要问

研究重点是预设类别的图像分类,不能直接回答物体在哪里。

2014 · NIPS 2014

Generative Adversarial Nets

Generative Adversarial Nets · Goodfellow et al., 2014 · Figure 1
论文原图 · Goodfellow et al., 2014 · Figure 1 · 论文原文

它在解决什么

怎样在不直接写出复杂图像概率的情况下学会生成?

核心想法

生成器把随机输入变成样本;判别器学习区分训练数据和生成样本,其反馈再推动生成器改进。

为什么选这篇

它把生成模型的训练写成两个模型之间的博弈,核心想法很适合画图理解。

第一遍读哪里

先看两者的目标和交替更新算法,再看实验样本。

读完还要问

两边的训练需要配合,可能不稳定,也可能只覆盖数据中的部分模式。

2015 · Nature

Human-level control through deep reinforcement learning

Human-level control through deep reinforcement learning · Mnih et al. · Fig. 1
论文原图 · Mnih et al. · Fig. 1 · 论文原文

它在解决什么

怎样从游戏画面学会选择离散动作?

核心想法

网络预测动作价值;经验回放与延迟更新的目标网络帮助稳定学习。

为什么选这篇

它把观察、动作价值和训练目标接得很清楚,是理解深度 RL 的入口。

第一遍读哪里

先看智能体与环境的交互,再追踪 Q 值更新与 Atari 评估。

读完还要问

原方法按离散动作估值;连续控制通常需要不同处理。

2016 · CVPR 2016

Deep Residual Learning for Image Recognition

Deep Residual Learning for Image Recognition · He et al. · Fig. 5
论文原图 · He et al. · Fig. 5 · 论文原文

它在解决什么

为什么网络加深之后,连训练集也可能学得更差?

核心想法

让一组层学习相对输入的改变量 F(x),再把输入加回去,得到 x + F(x)。

为什么选这篇

一个容易画清楚的结构变化,配合普通网络与残差网络的对照实验。

第一遍读哪里

先看退化问题和残差模块,再比较不同深度的训练误差。

读完还要问

残差连接改善优化,不保证任意加深都会更准;数据与计算成本仍然重要。

2016 · CVPR 2016

You Only Look Once: Unified, Real-Time Object Detection

You Only Look Once: Unified, Real-Time Object Detection · Redmon et al., YOLO, Figure 2
论文原图 · Redmon et al., YOLO, Figure 2 · 论文原文

它在解决什么

怎样在一次网络前向计算中同时预测物体类别和位置?

核心想法

从整张图直接预测一组框及相应分数,把识别和定位放进同一个训练目标。

为什么选这篇

和入门检测 demo 能对上:看得到框,也能分析漏检、误检和速度。

第一遍读哪里

先看检测流程和网格预测方式,再看定位误差的分析。

读完还要问

原版在小物体、密集物体和精确定位上有明显局限;今天名为 YOLO 的工具已有许多结构变化。

2017 · ICML

Neural Message Passing for Quantum Chemistry

Neural Message Passing for Quantum Chemistry · Gilmer et al. · Fig. 1
论文原图 · Gilmer et al. · Fig. 1 · 论文原文

它在解决什么

怎样从原子与它们的关系预测分子性质?

核心想法

节点通过消息传递更新表示,再把节点信息汇总为整个分子的预测。

为什么选这篇

它把图网络的抽象操作落在具体的量子化学预测任务上。

第一遍读哪里

先看 message passing 与 readout,再看目标性质和数据设置。

2017 · NIPS 2017

Attention Is All You Need

Attention Is All You Need · Vaswani et al. · Fig. 1
论文原图 · Vaswani et al. · Fig. 1 · 论文原文

它在解决什么

序列模型能否摆脱逐步递归,仍然处理词句之间的依赖?

核心想法

让每个位置通过注意力读取其他位置,再结合前馈网络与位置信息处理序列。

为什么选这篇

后面的 GPT 等模型会复用其中的结构,先认识输入怎样流动。

第一遍读哪里

先看模型结构和注意力的解释,再对照机器翻译实验。

读完还要问

原文是编码器—解码器翻译模型。

2017 · arXiv

Proximal Policy Optimization Algorithms

Proximal Policy Optimization Algorithms · Schulman et al. (2017), Fig. 1
论文原图 · Schulman et al. (2017), Fig. 1 · 论文原文

它在解决什么

怎样让策略更新容易实现,又不轻易跨得太大?

核心想法

常用版本对新旧动作概率的比值做裁剪,让过度改变策略不再获得额外的目标收益。

为什么选这篇

它是读策略梯度与理解许多 RL 实现的实用起点。

第一遍读哪里

先看 clipped surrogate objective,再看采样与多轮小批次更新。

读完还要问

裁剪不是性能单调提升的保证;数据采集和实现细节仍影响结果。

2018 · Physical Review Letters

Deep Potential Molecular Dynamics: A Scalable Model with the Accuracy of Quantum Mechanics

Deep Potential Molecular Dynamics: A Scalable Model with the Accuracy of Quantum Mechanics · Zhang et al., Deep Potential Molecular Dynamics, Figure 1
论文原图 · Zhang et al., Deep Potential Molecular Dynamics, Figure 1 · 论文原文

它在解决什么

怎样降低分子动力学中精确计算能量与力的成本?

核心想法

从第一性原理数据学习原子局部环境与能量的关系,同时把问题的对称性纳入模型。

为什么选这篇

它展示 AI 怎样替代计算链中的一个昂贵环节。

第一遍读哪里

先看能量与力怎样进入模拟,再看训练数据与物理量对照。

读完还要问

模型准确性依赖训练覆盖的构型与参考计算,外推到新条件需要检验。

2018 · OpenAI technical report · 2018

Improving Language Understanding by Generative Pre-Training

Improving Language Understanding by Generative Pre-Training · Radford et al., 2018 · Figure 1
论文原图 · Radford et al., 2018 · Figure 1 · 论文原文

它在解决什么

大量没有任务标签的文本,怎样帮助有标签的语言理解任务?

核心想法

先训练模型预测文本后续,再用任务数据微调;把不同任务整理成可输入的序列。

为什么选这篇

它把“先学通用表示,再迁移”的做法讲得很具体。

第一遍读哪里

看 Figure 1 的两阶段训练和右侧任务输入转换。

读完还要问

这里仍需要下游任务微调。

2018 · ICML

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor · Haarnoja et al. (2018), Fig. 1
论文原图 · Haarnoja et al. (2018), Fig. 1 · 论文原文

它在解决什么

怎样反复利用交互数据,并避免策略太早只选一种动作?

核心想法

策略追求回报,也保留一定随机性;价值网络评价动作,回放缓冲区提供旧经验。

为什么选这篇

用它比较 PPO,容易看清数据复用和探索目标的区别。

第一遍读哪里

先看最大熵目标,再追踪 actor、critic 与 replay buffer 的关系。

读完还要问

该论文主要研究连续控制;熵与奖励的尺度会影响行为。

2018 · arXiv

World Models

World Models · Ha & Schmidhuber · Fig. 4
论文原图 · Ha & Schmidhuber · Fig. 4 · 论文原文

它在解决什么

能否先学环境表示,再用很小的控制器完成任务?

核心想法

视觉模块压缩画面,循环模型学习变化,控制器利用二者提供的信息选动作。

为什么选这篇

交互页面让几个模块各自做什么非常直观。

第一遍读哪里

先看 Agent Model 与 Car Racing,再看在 VizDoom 的想象环境中训练。

读完还要问

控制器可能利用模型误差;模型内高回报需要回到原环境检验。

2019 · KDD

Optuna: A Next-generation Hyperparameter Optimization Framework

Optuna: A Next-generation Hyperparameter Optimization Framework · Akiba et al. · Figure 6
论文原图 · Akiba et al. · Figure 6 · 论文原文

它在解决什么

怎样用有限的训练预算找到好的配置?

核心想法

以程序定义搜索空间,结合采样和剪枝,在多次试验之间分配预算。

第一遍读哪里

先看搜索空间和试验循环,再看提前停止怎样节省计算。

2020 · arXiv

Qlib: An AI-oriented Quantitative Investment Platform

Qlib: An AI-oriented Quantitative Investment Platform · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

数据、模型、组合与回测怎样组成一个研究流程?

核心想法

把金融数据处理和机器学习流程连接到策略评价,使不同模型可以在统一流程中比较。

第一遍读哪里

沿框架图追踪数据流,再找一个例子的时间划分、标签和回测配置。

2020 · NeurIPS 2020

Denoising Diffusion Probabilistic Models

Denoising Diffusion Probabilistic Models · Ho et al. · Fig. 1
论文原图 · Ho et al. · Fig. 1 · 论文原文

它在解决什么

能否通过学习一系列去噪任务来生成清晰图像?

核心想法

训练时给真实图像加入已知噪声,模型学习预测噪声;采样时反复调用模型,从随机状态逐渐形成样本。

为什么选这篇

训练与采样的对应关系清楚,是理解后续扩散工作的好入口。

第一遍读哪里

把训练和采样两个算法并排看,先弄懂模型每次收到什么、预测什么。

读完还要问

原始采样需要许多次顺序计算。

2020 · NeurIPS 2020

Language Models are Few-Shot Learners

Language Models are Few-Shot Learners · Brown et al., 2020 · Figure 2.1
论文原图 · Brown et al., 2020 · Figure 2.1 · 论文原文

它在解决什么

能否给模型几个例子,就让它完成新任务而不更新权重?

核心想法

扩大自回归语言模型,在提示里放任务说明与示例,分别评测零样本、单样本和少样本表现。

为什么选这篇

它帮助你区分上下文学习与参数微调,也能接到 scaling 问题。

第一遍读哪里

先看三种评测设置,再选一个自己懂的任务读结果。

读完还要问

少样本效果依赖任务和提示;网络训练语料与测试数据的重合也影响评估。

2020 · SC 2020

ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

ZeRO: Memory Optimizations Toward Training Trillion Parameter Models · Rajbhandari et al. (2020), Fig. 1
论文原图 · Rajbhandari et al. (2020), Fig. 1 · 论文原文

它在解决什么

多卡训练中,每张卡都保存相同状态,会浪费多少显存?

核心想法

按阶段分片优化器状态、梯度和参数,需要时再通信取回,让多张卡分担存储。

为什么选这篇

它能帮助你读懂训练显存的组成,而不只盯着模型参数量。

第一遍读哪里

先看三阶段各自分片的对象,再比较内存和通信分析。

读完还要问

减少冗余存储会改变通信模式;网络带宽与卡数会影响收益。

2020 · Nature

Mastering Atari, Go, chess and shogi by planning with a learned model

Mastering Atari, Go, chess and shogi by planning with a learned model · Schrittwieser et al. (2020), Fig. 1
论文原图 · Schrittwieser et al. (2020), Fig. 1 · 论文原文

它在解决什么

不知道环境动力学规则时,能否学一个帮助搜索的模型?

核心想法

在内部状态里预测奖励、价值与动作策略,用树搜索比较选择。

为什么选这篇

它说明有用的模型不必还原所有像素,预测目标可以围绕决策来设计。

第一遍读哪里

先看 planning、acting、training 的流程,再看游戏实验。

读完还要问

论文测试的是特定游戏与动作接口。

2021 · Nature

Highly accurate protein structure prediction with AlphaFold

Highly accurate protein structure prediction with AlphaFold · Jumper et al., AlphaFold, Figure 1(e) · CC BY 4.0
论文原图 · Jumper et al., AlphaFold, Figure 1(e) · CC BY 4.0 · 论文原文

它在解决什么

怎样从氨基酸序列等信息预测蛋白质的三维结构?

核心想法

整合进化相关序列与残基间关系,反复更新表示并生成三维结构。

为什么选这篇

它展示数据、几何与系统设计围绕一个学科难题怎样配合。

第一遍读哪里

先看整体结构与 CASP14 评价,再看置信度的含义。

2021 · ICLR

Fourier Neural Operator for Parametric Partial Differential Equations

Fourier Neural Operator for Parametric Partial Differential Equations · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从一组初始条件直接预测连续物理场?

核心想法

在频域中参数化积分核,学习函数到函数的映射,用于一类偏微分方程问题。

第一遍读哪里

先看算子层与输入输出,再对照不同分辨率和方程设置下的误差。

2021 · ICML 2021

Learning Transferable Visual Models From Natural Language Supervision

Learning Transferable Visual Models From Natural Language Supervision · Radford et al. · Fig. 1
论文原图 · Radford et al. · Fig. 1 · 论文原文

它在解决什么

能否用图片配文学习视觉概念,而不只依赖固定类别标签?

核心想法

同时训练图像与文字编码器,让正确配对比错误配对更相似;预测时可比较图片与不同文字描述。

为什么选这篇

它把图文检索和零样本分类统一到一个容易观察的匹配问题。

第一遍读哪里

先看图文训练与零样本预测的流程,再改官方示例中的候选文字。

读完还要问

CLIP 输出表示或匹配分数,本身不是聊天模型;匹配正确也不等于理解复杂关系。

2021 · ICLR 2021

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale · Dosovitskiy et al. · Fig. 1
论文原图 · Dosovitskiy et al. · Fig. 1 · 论文原文

它在解决什么

图像分类是否必须依赖卷积这种局部结构?

核心想法

把图像切成小块,转换成向量,再用 Transformer 在块之间交换信息。

为什么选这篇

它把视觉与语言中的序列处理联系起来,也强调预训练数据规模的作用。

第一遍读哪里

先看图像块如何进入网络,再看不同预训练规模的比较。

读完还要问

原论文的强结果依赖大规模预训练,不能据此认为小数据上 Transformer 一定胜过 CNN。

2022 · arXiv

RT-1: Robotics Transformer for Real-World Control at Scale

RT-1: Robotics Transformer for Real-World Control at Scale · Brohan et al., RT-1, Figure 1(a)
论文原图 · Brohan et al., RT-1, Figure 1(a) · 论文原文

它在解决什么

一个模型能否从多任务机器人数据学习按指令行动?

核心想法

把图像特征与语言条件送入 Transformer,预测离散化后的机器人动作。

为什么选这篇

它让数据规模、任务多样性与机器人泛化之间的关系变得具体。

第一遍读哪里

先看输入输出和数据采集,再看新任务、干扰与新环境的评估设置。

读完还要问

结果依赖特定机器人与动作接口。

2022 · CVPR 2022

High-Resolution Image Synthesis with Latent Diffusion Models

High-Resolution Image Synthesis with Latent Diffusion Models · Rombach et al. · Fig. 3
论文原图 · Rombach et al. · Fig. 3 · 论文原文

它在解决什么

扩散能否少处理一些像素,同时保留生成图像的关键细节?

核心想法

先用自编码器压缩图片,在潜表示上训练扩散,再解码;交叉注意力让文字等条件参与去噪。

为什么选这篇

它把图像压缩、生成质量和计算成本放在同一个设计里,也是理解 Stable Diffusion 的基础。

第一遍读哪里

先沿编码、扩散、解码走一遍,再看压缩程度的比较。

读完还要问

压缩会损失信息;会按文字生成,不代表能稳定满足复杂数量与空间关系。

2022 · NeurIPS 2022

Training language models to follow instructions with human feedback

Training language models to follow instructions with human feedback · Ouyang et al. · Fig. 2
论文原图 · Ouyang et al. · Fig. 2 · 论文原文

它在解决什么

模型会续写文字后,怎样让它更按用户的要求回答?

核心想法

用示范答案微调,再从回答排序学习奖励模型,通过强化学习调整输出行为。

为什么选这篇

它把预训练能力和回答方式分开,便于理解后训练的作用。

第一遍读哪里

先沿训练流程理解示范、排序和策略更新各自需要什么数据。

读完还要问

标注者偏好受人群和任务分布影响;更受偏好的回答仍可能有事实错误。

2022 · NeurIPS 2022

FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness · Dao et al. · Fig. 1
论文原图 · Dao et al. · Fig. 1 · 论文原文

它在解决什么

注意力很慢时,瓶颈是否在搬数据,而不只在乘法次数?

核心想法

把计算分块放进更快的片上内存,避免把完整注意力矩阵反复写入显存。

为什么选这篇

它说明相同数学计算可以有很不一样的执行效率。

第一遍读哪里

先看 GPU 内存层级和分块示意,再读 IO 分析与运行时间。

读完还要问

精确版本没有消除稠密注意力的二次计算量;加速幅度取决于形状、硬件和实现。

2023 · ICLR 2023

ReAct: Synergizing Reasoning and Acting in Language Models

ReAct: Synergizing Reasoning and Acting in Language Models · Yao et al. · Fig. 1
论文原图 · Yao et al. · Fig. 1 · 论文原文

它在解决什么

模型能否边获取外部信息,边调整解题过程?

核心想法

在一条轨迹中交替生成推理文本与行动,并把环境观察接回上下文。

为什么选这篇

它让“模型去做事”变成一段能逐步检查的执行过程。

第一遍读哪里

先看项目页的 HotpotQA 示例,再看 ALFWorld 的失败轨迹。

读完还要问

工具反馈会提供新证据,但模型仍可能忽略它或反复做错;显式推理文本也不等于完整的内部计算。

2023 · NeurIPS 2023

Toolformer: Language Models Can Teach Themselves to Use Tools

Toolformer: Language Models Can Teach Themselves to Use Tools · Schick et al., 2023 · Figure 2
论文原图 · Schick et al., 2023 · Figure 2 · 论文原文

它在解决什么

怎样获得教模型调用工具的数据,而不逐条人工标注?

核心想法

生成候选调用,实际执行,保留让后续文本更容易预测的调用,再用这些数据微调模型。

为什么选这篇

与 ReAct 对照读,可以分清执行时的组织方式和训练时学到的能力。

第一遍读哪里

看 Figure 2 的采样、执行、筛选流程,再看工具使用实例。

读完还要问

原方法对多次调用串联和交互式工具有局限;预测后续文本的收益不等同于完成长任务的收益。

2023 · NeurIPS 2023

Reflexion: Language Agents with Verbal Reinforcement Learning

Reflexion: Language Agents with Verbal Reinforcement Learning · Shinn et al., 2023 · Figure 2(a)
论文原图 · Shinn et al., 2023 · Figure 2(a) · 论文原文

它在解决什么

一次尝试失败后,怎样让下一次用上这次的教训?

核心想法

把任务反馈整理成文字反思,保存到记忆,再作为下一次尝试的输入。

为什么选这篇

它是理解“改上下文”和“更新参数”差别的具体例子。

第一遍读哪里

顺着方法中的执行、评估、反思和再次尝试读一遍。

读完还要问

反馈质量决定反思有没有依据;它不是通过梯度更新权重的传统强化学习训练。

2023 · UIST 2023

Generative Agents: Interactive Simulacra of Human Behavior

Generative Agents: Interactive Simulacra of Human Behavior · Park et al. · Smallville
论文原图 · Park et al. · Smallville · 论文原文

它在解决什么

让 25 个角色住在一座小镇里,怎样让他们记住经历、安排生活并彼此交往?

核心想法

用自然语言记录观察,按相关性、重要性和时间检索记忆,再通过反思提炼经验、制定和调整计划。

为什么选这篇

聚会邀请怎样在人际网络中传播,可以沿着每个角色的记忆、对话与行动追踪。

第一遍读哪里

先看 Smallville 小镇图和情人节聚会案例,再读记忆检索、反思和规划的架构。

2023 · arXiv 2023

Voyager: An Open-Ended Embodied Agent with Large Language Models

Voyager: An Open-Ended Embodied Agent with Large Language Models · Wang et al. · Fig. 1
论文原图 · Wang et al. · Fig. 1 · 论文原文

它在解决什么

从砍树到挖钻石,Agent 怎样把会做的事积累下来,继续探索?

核心想法

自动课程提出任务,GPT-4 根据环境反馈生成和修正可执行代码;成功技能存入技能库,供后续任务检索、组合和复用。

为什么选这篇

科技树把长期能力积累呈现得很直观:后续技能建立在采集、合成与工具使用之上。

第一遍读哪里

先看科技树与物品探索主图,再看自动课程、技能库和代码调试循环。

2023 · arXiv

DreamDiffusion: Generating High-Quality Images from Brain EEG Signals

DreamDiffusion: Generating High-Quality Images from Brain EEG Signals · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

脑电表征怎样连接到图像生成模型?

核心想法

通过时间掩码信号建模学习 EEG 表征,结合 CLIP 视觉监督,将信号用于条件生成。

第一遍读哪里

沿训练阶段找每种数据与监督的作用,再看被试划分和对照。

2023 · Robotics: Science and Systems

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion · Chi et al. · Fig. 3
论文原图 · Chi et al. · Fig. 3 · 论文原文

它在解决什么

同一场景有多种可行动作时,怎样学出连贯的动作序列?

核心想法

以观察为条件,逐步去噪生成动作序列,执行一部分后再观察与预测。

为什么选这篇

它是理解生成模型怎样进入机器人控制的直观案例。

第一遍读哪里

先看动作去噪与滚动执行,再看 Push-T 的成功和失败视频。

读完还要问

多步去噪带来推理开销;示范覆盖与控制频率仍会限制部署。

2023 · CoRL

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control · Zitkovich et al. · Fig. 1
论文原图 · Zitkovich et al. · Fig. 1 · 论文原文

它在解决什么

互联网上学到的视觉语言知识能否帮助机器人理解新指令?

核心想法

把机器人动作写成 token,与视觉语言数据联合微调,让模型直接输出动作。

为什么选这篇

它帮助理解 VLA 的出发点:语义知识怎样接到已有动作能力。

第一遍读哪里

先看动作编码,再看语义泛化的任务与失败边界。

读完还要问

语义泛化不自动带来新的底层运动技能,机器人示范仍然重要。

2023 · ICCV 2023

Scalable Diffusion Models with Transformers

Scalable Diffusion Models with Transformers · Peebles & Xie · Fig. 3
论文原图 · Peebles & Xie · Fig. 3 · 论文原文

它在解决什么

扩散模型中的去噪网络能否改用适合扩大规模的 Transformer?

核心想法

把潜表示切成小块,用 Transformer 预测扩散所需的量,并比较深度、宽度和块大小。

为什么选这篇

它让你分清生成目标与网络结构,也能读到围绕计算量的系统比较。

第一遍读哪里

先看模型结构,再把各规模的计算量与生成指标对照起来。

读完还要问

原论文主要研究类别条件的 ImageNet 图像生成,不能直接当作文本生成视频能力的证据。

2023 · ICML 2023

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models · Li et al., BLIP-2, Figure 1
论文原图 · Li et al., BLIP-2, Figure 1 · 论文原文

它在解决什么

能否复用已经训练好的视觉模型和语言模型,减少重新训练的成本?

核心想法

冻结两侧模型,用可训练的 Q-Former 提取少量视觉特征,再学习把这些特征接到语言模型上。

为什么选这篇

它让“给语言模型接上眼睛”落到具体模块和训练阶段。

第一遍读哪里

先看两阶段框架,标出冻结和训练的部分,再追踪视觉信息怎样变成语言输入。

读完还要问

冻结模型仍带有原模型的能力边界;错误视觉信息可能伴随流畅但不准确的回答。

2023 · NeurIPS 2023

Visual Instruction Tuning

Visual Instruction Tuning · Liu et al., Visual Instruction Tuning, Figure 1
论文原图 · Liu et al., Visual Instruction Tuning, Figure 1 · 论文原文

它在解决什么

怎样让接收图像的模型按自然语言要求回答问题?

核心想法

用投影连接图像编码器与语言模型,再用视觉指令数据训练。原作利用图片的文字描述与框信息,请纯文本 GPT-4 生成部分训练对话。

为什么选这篇

它说明架构连接之外,训练数据的组织也能改变模型的交互方式。

第一遍读哪里

先看指令数据如何构造,再看连接结构和分阶段训练。

读完还要问

回答可能出现图片中不存在的细节。

2023 · ICML 2023

SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models · Xiao et al. (2023), Fig. 2
论文原图 · Xiao et al. (2023), Fig. 2 · 论文原文

它在解决什么

激活中少量特别大的数,为什么会让 INT8 量化困难?

核心想法

在权重与激活之间重新分配尺度,先做等价变换,再量化为低精度数值。

为什么选这篇

它把异常值、数值误差与硬件执行连在一个具体例子中。

第一遍读哪里

先看激活异常值和尺度迁移的示意,再看精度与速度的对比。

读完还要问

等价的是量化前的尺度变换,量化后仍有误差;需要代表性的校准数据及合适的 INT8 算子。

2023 · SOSP 2023

Efficient Memory Management for Large Language Model Serving with PagedAttention

Efficient Memory Management for Large Language Model Serving with PagedAttention · Kwon et al. (2023), Fig. 6
论文原图 · Kwon et al. (2023), Fig. 6 · 论文原文

它在解决什么

不同长度的请求不断进入和结束,怎样少浪费 KV cache 显存?

核心想法

把缓存切成块,用映射表组织不连续的物理存储,并支持必要的缓存共享。

为什么选这篇

它把操作系统中的分页思路带到模型服务,解释了并发能力从哪里来。

第一遍读哪里

先看缓存碎片问题和块映射,再看固定延迟条件下的吞吐比较。

读完还要问

它优化缓存管理;更多并发的收益仍要结合延迟目标和请求长度衡量。

2024 · ICLR 2024

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · Jimenez et al., 2024 · Figure 1
论文原图 · Jimenez et al., 2024 · Figure 1 · 论文原文

它在解决什么

模型能否读懂仓库和 issue,提交真正解决问题的代码修改?

核心想法

从真实项目收集 issue 与修复,给模型仓库和问题,再通过测试评价补丁。

为什么选这篇

它把读代码、定位、修改和验证放到一个完整任务里。

第一遍读哪里

先读任务构建与评价方式,再看一种失败案例。

读完还要问

原始数据来自 Python 仓库;测试通过不能覆盖全部软件质量,也不能直接代表其他语言和工作流。

2024 · Nature

Solving olympiad geometry without human demonstrations

Solving olympiad geometry without human demonstrations · Google DeepMind · AlphaGeometry 官方方法示意图
论文原图 · Google DeepMind · AlphaGeometry 官方方法示意图 · 论文原文

它在解决什么

怎样把辅助构造与符号推理连接成证明过程?

核心想法

符号引擎先推导已有条件,语言模型在需要时提出辅助构造,再继续搜索证明。

第一遍读哪里

沿一个简单几何题追踪新增构造及其带来的推导,再看训练数据如何合成。

2024 · arXiv

π0: A Vision-Language-Action Flow Model for General Robot Control

π0: A Vision-Language-Action Flow Model for General Robot Control · Physical Intelligence · Fig. 1
论文原图 · Physical Intelligence · Fig. 1 · 论文原文

它在解决什么

怎样把视觉语言模型接到连续动作,让同一个策略学习多种机器人的任务?

核心想法

在预训练视觉语言模型上接入动作专家,用 flow matching 生成连续动作序列;先用多种机器人的示范预训练,再用任务数据微调。

为什么选这篇

它把视觉语言预训练、动作生成和跨机器人数据放进同一套方案,接上了前面的 RT-2 与 Diffusion Policy。

第一遍读哪里

从第一页总览图看数据和任务,再读动作专家的结构;对照预训练后直接执行与任务微调后的实验。

2025 · arXiv

Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents

Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

编码 Agent 能否通过修改自身代码改善能力?

核心想法

维护多个 Agent 版本,生成自我修改,再用编码任务筛选,形成持续扩展的版本树。

第一遍读哪里

从一处具体代码改动读起,再看版本选择、评价任务和计算预算。

2025 · arXiv

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search · Yamada et al. · Figure 1
论文原图 · Yamada et al. · Figure 1 · 论文原文

它在解决什么

怎样用实验结果引导下一轮研究?

核心想法

用 Agent 驱动的树搜索组织实验,连接方案、执行、分析与论文撰写。

第一遍读哪里

先看一次完整实验分支,检查最终论述能否对应到实际结果。

2025 · arXiv

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样把家族信息与验证反馈用于蛋白质设计?

核心想法

以贝叶斯流网络建模蛋白质,利用 MSA 上下文,并探索增加推理时搜索预算的设计流程。

第一遍读哪里

分别追踪生成条件、验证器与实验测量;比较它们在迭代中的作用。

2025 · arXiv

CMRINet: Joint Groupwise Registration and Segmentation for Cardiac Function Quantification from Cine-MRI

CMRINet: Joint Groupwise Registration and Segmentation for Cardiac Function Quantification from Cine-MRI · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从动态心脏 MRI 同时获得结构和运动信息?

核心想法

联合处理组间配准与分割,把时序图像分析连接到心脏功能量化。

第一遍读哪里

先看电影 MRI 的时间维度,再看两项任务怎样配合,以及功能指标怎样计算。

2025 · arXiv

π0.5: a Vision-Language-Action Model with Open-World Generalization

π0.5: a Vision-Language-Action Model with Open-World Generalization · Physical Intelligence · Fig. 1
论文原图 · Physical Intelligence · Fig. 1 · 论文原文

它在解决什么

机器人到了训练时没去过的家里,还能完成整理房间这样的长任务吗?

核心想法

在 π0 基础上联合训练机器人动作、子任务预测、物体检测和网络视觉语言数据,把高层子任务与连续动作连接起来。

为什么选这篇

它把问题推进到新家庭环境中的多阶段操作,适合看训练数据的组成怎样影响泛化。

第一遍读哪里

先看第一页的数据来源与部署场景,再看新家庭环境的测试设置,以及不同数据来源的消融实验。

2025 · Nature

Mastering diverse control tasks through world models

Mastering diverse control tasks through world models · Hafner et al. (2025), Fig. 1 (CC BY 4.0)
论文原图 · Hafner et al. (2025), Fig. 1 (CC BY 4.0) · 论文原文

它在解决什么

怎样让同一套世界模型学习算法适应不同任务的信号尺度?

核心想法

用交互经验训练世界模型,在预测轨迹中训练 actor 与 critic,并稳定不同损失与信号的尺度。

为什么选这篇

它把世界模型与行为学习连起来,也展示跨任务评估应怎样组织。

第一遍读哪里

先看训练流程图与 Learning algorithm,再看任务分组和消融。

读完还要问

统一配置不等于一个预训练模型直接通吃所有任务;各任务仍需训练与交互。

2026 · ICML

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从组织图像预测空间基因表达并保留结构关系?

核心想法

结合空间图编码与基因基础模型表征,用扩散过程建模表达分布。

第一遍读哪里

先看输入图像、空间邻接和表达输出,再比较逐点误差与结构评价。

下面按问题选了几篇论文,每篇附有阅读切入点。读法可以参考找资料和读论文。

第一次认识一篇论文

ResNet
看作者遇到了什么训练问题,结构改动是什么,用哪些比较说明它有效。可以配李沐精读,再回到视觉。

Attention Is All You Need
先沿架构图追输入输出,再看 attention 解决了哪一部分计算。图解可以帮你走第一遍。接基础与架构。

ReAct
先读一条完整轨迹:模型什么时候行动,看到反馈后发生什么变化。再看论文怎样比较只有推理、只有行动与两者结合。接 Agent。

沿着自己的兴趣继续

  • BERT:训练目标怎样影响学到的表示,以及表示怎样用于任务。接 LLM。
  • LoRA:减少需要训练的参数,具体节省了什么,又怎样评价效果。接 LLM与系统。
  • CLIP:图文匹配怎样成为训练任务,训练之后又怎样使用。接多模态。
  • DDPM:带噪数据、学习目标与生成过程如何联系。配生成方向读。
  • World Models:压缩观察、预测动态与选择动作怎样组合。接世界模型。
  • DreamerV3:学到的模型怎样用于行为学习,评价覆盖什么任务。接 RL。
  • ACT / ALOHA:把示范、动作预测与实际机器人任务对应起来。接具身。
  • Diffusion Policy:生成建模怎样用于动作,为什么要这样表示动作。接生成与具身。

已经有问题,再翻长清单

Agent · 多模态 · World Models · 具身指南 · AI for Science

想认识新工作,可以看 Hugging Face Daily Papers。

跟着有经验的人读一次

李沐论文精读适合拿自己的阅读记录对照;需要方向 paper list 和更多项目,查方向资料目录。