大语言模型:理解、生成、推理

你每天用的对话模型,背后有一连串问题:文字怎样变成模型能处理的东西,模型从什么数据中学习,为什么换一种训练方式会改变回答,又怎样知道它真的做得更好。

想研究 LLM,可以从这些环节中的一个往下挖。

大语言模型把文字转成 token 序列,从大量文本中学习词句之间的关系,再根据上下文生成后续内容。同一个模型因此可以被用于问答、摘要、代码和翻译;任务不再总是对应一个单独训练的分类器,而常常通过指令、示例和上下文来表达。

这个方向既研究能力怎样从数据和训练中形成,也研究怎样把能力用到具体任务。预训练、指令微调、偏好学习与推理时的搜索,是不同环节;读一篇工作时,先问它改了哪里、用什么任务验证,才能理解“回答更好”到底好在什么地方。

主要任务
  • 把分散的文本整理成摘要、结构化信息或可继续查询的回答。
  • 根据自然语言要求生成、修改和解释文字与代码。
  • 把不同任务放进同一种语言接口,研究模型能否迁移到新的要求。

先分清模型结构、训练目标和使用方式;会写长答案、会按指令回答和推理正确,是三个需要分别检验的现象。

文字怎样生成回答
  1. 01文字 → tokens
  2. 02表示与注意力
  3. 03下一个 token 的分布
  4. 04选择 token 并接回输入

发展路线与代表工作

BERT 2018

双向编码与文本表示

GPT 2018

自回归生成与规模扩展

继续看各家的模型与技术报告
  1. 2017

    结构:让序列里的位置相互交换信息

    Transformer 用注意力组织序列计算,为后来的不同预训练模型提供了重要结构。它原本研究机器翻译。

  2. 2018

    迁移:先从文本学习,再适配任务

    GPT 把生成式语言预训练与有标签任务微调接起来。重点是复用学习到的表示。

  3. 2020

    提示:把任务示例放进上下文

    GPT-3 系统考察规模和少样本提示:使用阶段可以给示例,而不为每个任务更新参数。

  4. 2022

    行为:让输出更贴近人的要求

    InstructGPT 将示范、偏好比较与强化学习结合。模型如何回答,成为单独的训练问题。

关键概念

Token / 分词单元
模型处理的离散片段,可以是一个词、一个字或词的一部分。相同文字在不同 tokenizer 下可能有不同长度。
自回归
每次根据已有上下文预测后续 token,再把新 token 接回上下文继续生成。训练时可以并行计算多个位置的预测。
预训练与后训练
预训练建立基础能力;后训练在此基础上调整任务能力或行为。指令微调和偏好学习是常见后训练方法。
上下文学习
把说明和示例放进输入来改变表现,这次使用不更新模型权重。它不同于用这些示例微调参数。

分词、表示与下一 token 预测

用 Hugging Face LLM Course认识模型、tokenizer 和数据。拿同一句话看分词结果,再看模型输入输出。碰到 embedding、矩阵运算、梯度,回基础页补对应部分。

接下来用 LLMs from Scratch 的配套代码,沿着文本、token、attention、输出一路读。仓库提供书的配套材料;具体阅读范围从你想弄懂的模块开始。

预训练、后训练与推理效率

想知道能力怎样学出来,看数据、训练目标与优化。等你能解释一段训练代码后,可以进入 Stanford CS336(2025),先沿课程目录选数据、训练或系统中的一个专题。

想知道模型怎样变得更适合某项任务,从微调、反馈与评测进入。先固定任务和评价方式,比较基础模型与调整后的模型;涉及奖励与策略更新时,接强化学习。

想知道模型为什么又慢又贵,看效率与系统。模型规模、上下文、精度、缓存和硬件,会一起影响你能做怎样的实验。

语言本身的表示、语义和任务也值得学。CS224N能把这些问题和模型方法连起来。

Transformer、BERT 与 LoRA

Transformer看结构;BERT看预训练目标和表示;LoRA看如何减少适配模型需要训练的参数。可以配李沐论文精读读其中一篇。

再读邹嘉轩的 pretrain 和 scaling 作为一种方法论和科学观,看看一位研究者怎样把训练规模、数据、稳定性和问题选择联系起来。

观察小模型的分词与输出

选一个你能运行的小模型和一小组文本,记录分词、输入长度、输出与错误。改一种设置,再观察它影响了什么。模型和设备条件按所选教程确认。

如果你关心模型怎样用工具做事情,接着看 Agent;想让它读图,就去多模态。

位置编码、优化器与 Scaling

位置编码和优化器可以查苏剑林选文;想理解 scaling 怎样做实验、怎样外推,可以看邹嘉轩的文章。完整课程与项目在LLM 资料目录。

模型家族与技术报告

读报告时可以沿着一个问题比较:数据怎样选,训练目标怎样变,推理能力怎样测,成本又花在哪里。下面按团队整理原文和阅读重点。

腾讯 · 混元

团队研究与后续发布 ↗

小米 · MiMo

  • MiMo ↗2025 · 技术报告

    预训练与后训练怎样共同改善推理。

  • MiMo-Audio ↗2025 · 技术报告

    语音表示、音频语言建模与语音任务评测。

  • MiMo-V2-Flash ↗2026 · 技术报告

    模型架构、注意力设计与推理效率。

团队研究与后续发布 ↗

字节跳动 · Seed

团队研究与后续发布 ↗

月之暗面 · Kimi

  • Kimi K2 ↗2025 · 技术报告

    MoE、优化器与大规模工具交互训练。

  • Kimi K2.5 ↗2026 · 技术报告

    视觉与语言训练、工具使用和并行 Agent。

团队研究与后续发布 ↗

DeepSeek

  • DeepSeek-V3 ↗2024 · 技术报告

    MoE、MLA、负载均衡与 FP8 训练。

  • DeepSeek-R1 ↗2025 · 技术报告

    推理强化学习、冷启动数据与蒸馏。

  • DeepSeek-V3.2 ↗2025 · 技术报告

    稀疏注意力、推理强化学习与 Agent 任务合成。

  • DeepSeek-V4 ↗2026 · 技术报告

    混合压缩注意力、长上下文与后训练流程。

团队研究与后续发布 ↗

阿里巴巴 · Qwen

  • Qwen2.5 ↗2024 · 技术报告

    预训练数据、指令微调与不同规模模型的能力。

  • Qwen2.5-VL ↗2025 · 技术报告

    动态分辨率、视频理解与视觉定位。

  • Qwen3 ↗2025 · 技术报告

    稠密与 MoE、思考模式、多语言和蒸馏。

  • Qwen3-Omni ↗2025 · 技术报告

    文本、图像、音频和视频的统一处理。

团队研究与后续发布 ↗

MiniMax

  • MiniMax-01 ↗2025 · 技术报告

    Lightning Attention、MoE 与长上下文。

  • MiniMax-M1 ↗2025 · 技术报告

    长上下文推理与测试时计算。

团队研究与后续发布 ↗

智谱 · GLM

  • GLM-4.5 ↗2025 · 技术报告

    混合推理模式、多阶段后训练、代码与 Agent。

  • GLM-5 ↗2026 · 技术报告

    长任务 Agent、异步强化学习与软件工程评测。

团队研究与后续发布 ↗

Google DeepMind

  • Gemini 1.5 ↗2024 · 技术报告

    长上下文检索、跨模态理解与百万 token 评测。

  • Gemini 2.5 ↗2025 · 技术报告

    推理、多模态与 Agent 能力的训练和评测。

团队研究与后续发布 ↗

OpenAI

  • GPT-4 ↗2023 · 技术报告

    规模预测、能力评测与后训练。

  • GPT-4o ↗2024 · 系统卡

    多模态输入输出与语音交互的系统评测。

团队研究与后续发布 ↗

Anthropic

团队研究与后续发布 ↗

Meta AI

  • Llama 3 ↗2024 · 技术报告

    数据配比、预训练、后训练和大规模训练基础设施。

团队研究与后续发布 ↗

代表论文

按结构、预训练、上下文学习、后训练读这四篇,每篇先抓住它改变的环节。

2017 · NIPS 2017

Attention Is All You Need

Attention Is All You Need · Vaswani et al. · Fig. 1
论文原图 · Vaswani et al. · Fig. 1 · 论文原文

它在解决什么

序列模型能否摆脱逐步递归,仍然处理词句之间的依赖?

核心想法

让每个位置通过注意力读取其他位置,再结合前馈网络与位置信息处理序列。

为什么选这篇

后面的 GPT 等模型会复用其中的结构,先认识输入怎样流动。

第一遍读哪里

先看模型结构和注意力的解释,再对照机器翻译实验。

读完还要问

原文是编码器—解码器翻译模型。

2018 · OpenAI technical report · 2018

Improving Language Understanding by Generative Pre-Training

Improving Language Understanding by Generative Pre-Training · Radford et al., 2018 · Figure 1
论文原图 · Radford et al., 2018 · Figure 1 · 论文原文

它在解决什么

大量没有任务标签的文本,怎样帮助有标签的语言理解任务?

核心想法

先训练模型预测文本后续,再用任务数据微调;把不同任务整理成可输入的序列。

为什么选这篇

它把“先学通用表示,再迁移”的做法讲得很具体。

第一遍读哪里

看 Figure 1 的两阶段训练和右侧任务输入转换。

读完还要问

这里仍需要下游任务微调。

2020 · NeurIPS 2020

Language Models are Few-Shot Learners

Language Models are Few-Shot Learners · Brown et al., 2020 · Figure 2.1
论文原图 · Brown et al., 2020 · Figure 2.1 · 论文原文

它在解决什么

能否给模型几个例子,就让它完成新任务而不更新权重?

核心想法

扩大自回归语言模型,在提示里放任务说明与示例,分别评测零样本、单样本和少样本表现。

为什么选这篇

它帮助你区分上下文学习与参数微调,也能接到 scaling 问题。

第一遍读哪里

先看三种评测设置,再选一个自己懂的任务读结果。

读完还要问

少样本效果依赖任务和提示;网络训练语料与测试数据的重合也影响评估。

2022 · NeurIPS 2022

Training language models to follow instructions with human feedback

Training language models to follow instructions with human feedback · Ouyang et al. · Fig. 2
论文原图 · Ouyang et al. · Fig. 2 · 论文原文

它在解决什么

模型会续写文字后,怎样让它更按用户的要求回答?

核心想法

用示范答案微调,再从回答排序学习奖励模型,通过强化学习调整输出行为。

为什么选这篇

它把预训练能力和回答方式分开,便于理解后训练的作用。

第一遍读哪里

先沿训练流程理解示范、排序和策略更新各自需要什么数据。

读完还要问

标注者偏好受人群和任务分布影响;更受偏好的回答仍可能有事实错误。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗