大语言模型:理解、生成、推理
你每天用的对话模型,背后有一连串问题:文字怎样变成模型能处理的东西,模型从什么数据中学习,为什么换一种训练方式会改变回答,又怎样知道它真的做得更好。
想研究 LLM,可以从这些环节中的一个往下挖。
大语言模型把文字转成 token 序列,从大量文本中学习词句之间的关系,再根据上下文生成后续内容。同一个模型因此可以被用于问答、摘要、代码和翻译;任务不再总是对应一个单独训练的分类器,而常常通过指令、示例和上下文来表达。
这个方向既研究能力怎样从数据和训练中形成,也研究怎样把能力用到具体任务。预训练、指令微调、偏好学习与推理时的搜索,是不同环节;读一篇工作时,先问它改了哪里、用什么任务验证,才能理解“回答更好”到底好在什么地方。
- 把分散的文本整理成摘要、结构化信息或可继续查询的回答。
- 根据自然语言要求生成、修改和解释文字与代码。
- 把不同任务放进同一种语言接口,研究模型能否迁移到新的要求。
先分清模型结构、训练目标和使用方式;会写长答案、会按指令回答和推理正确,是三个需要分别检验的现象。
- 01文字 → tokens
- 02表示与注意力
- 03下一个 token 的分布
- 04选择 token 并接回输入
发展路线与代表工作
- 2017
- 2018
- 2020
- 2022
关键概念
- Token / 分词单元
- 模型处理的离散片段,可以是一个词、一个字或词的一部分。相同文字在不同 tokenizer 下可能有不同长度。
- 自回归
- 每次根据已有上下文预测后续 token,再把新 token 接回上下文继续生成。训练时可以并行计算多个位置的预测。
- 预训练与后训练
- 预训练建立基础能力;后训练在此基础上调整任务能力或行为。指令微调和偏好学习是常见后训练方法。
- 上下文学习
- 把说明和示例放进输入来改变表现,这次使用不更新模型权重。它不同于用这些示例微调参数。
分词、表示与下一 token 预测
用 Hugging Face LLM Course认识模型、tokenizer 和数据。拿同一句话看分词结果,再看模型输入输出。碰到 embedding、矩阵运算、梯度,回基础页补对应部分。
接下来用 LLMs from Scratch 的配套代码,沿着文本、token、attention、输出一路读。仓库提供书的配套材料;具体阅读范围从你想弄懂的模块开始。
预训练、后训练与推理效率
想知道能力怎样学出来,看数据、训练目标与优化。等你能解释一段训练代码后,可以进入 Stanford CS336(2025),先沿课程目录选数据、训练或系统中的一个专题。
想知道模型怎样变得更适合某项任务,从微调、反馈与评测进入。先固定任务和评价方式,比较基础模型与调整后的模型;涉及奖励与策略更新时,接强化学习。
想知道模型为什么又慢又贵,看效率与系统。模型规模、上下文、精度、缓存和硬件,会一起影响你能做怎样的实验。
语言本身的表示、语义和任务也值得学。CS224N能把这些问题和模型方法连起来。
Transformer、BERT 与 LoRA
Transformer看结构;BERT看预训练目标和表示;LoRA看如何减少适配模型需要训练的参数。可以配李沐论文精读读其中一篇。
再读邹嘉轩的 pretrain 和 scaling 作为一种方法论和科学观,看看一位研究者怎样把训练规模、数据、稳定性和问题选择联系起来。
观察小模型的分词与输出
选一个你能运行的小模型和一小组文本,记录分词、输入长度、输出与错误。改一种设置,再观察它影响了什么。模型和设备条件按所选教程确认。
如果你关心模型怎样用工具做事情,接着看 Agent;想让它读图,就去多模态。
位置编码、优化器与 Scaling
位置编码和优化器可以查苏剑林选文;想理解 scaling 怎样做实验、怎样外推,可以看邹嘉轩的文章。完整课程与项目在LLM 资料目录。
模型家族与技术报告
读报告时可以沿着一个问题比较:数据怎样选,训练目标怎样变,推理能力怎样测,成本又花在哪里。下面按团队整理原文和阅读重点。
腾讯 · 混元
- Hunyuan-Large ↗2024 · 技术报告
MoE 架构、数据合成和训练扩展。
小米 · MiMo
- MiMo ↗2025 · 技术报告
预训练与后训练怎样共同改善推理。
- MiMo-Audio ↗2025 · 技术报告
语音表示、音频语言建模与语音任务评测。
- MiMo-V2-Flash ↗2026 · 技术报告
模型架构、注意力设计与推理效率。
字节跳动 · Seed
- Seed1.5-Thinking ↗2025 · 技术报告
推理强化学习、训练稳定性与能力评测。
月之暗面 · Kimi
- Kimi K2 ↗2025 · 技术报告
MoE、优化器与大规模工具交互训练。
- Kimi K2.5 ↗2026 · 技术报告
视觉与语言训练、工具使用和并行 Agent。
DeepSeek
- DeepSeek-V3 ↗2024 · 技术报告
MoE、MLA、负载均衡与 FP8 训练。
- DeepSeek-R1 ↗2025 · 技术报告
推理强化学习、冷启动数据与蒸馏。
- DeepSeek-V3.2 ↗2025 · 技术报告
稀疏注意力、推理强化学习与 Agent 任务合成。
- DeepSeek-V4 ↗2026 · 技术报告
混合压缩注意力、长上下文与后训练流程。
阿里巴巴 · Qwen
- Qwen2.5 ↗2024 · 技术报告
预训练数据、指令微调与不同规模模型的能力。
- Qwen2.5-VL ↗2025 · 技术报告
动态分辨率、视频理解与视觉定位。
- Qwen3 ↗2025 · 技术报告
稠密与 MoE、思考模式、多语言和蒸馏。
- Qwen3-Omni ↗2025 · 技术报告
文本、图像、音频和视频的统一处理。
MiniMax
- MiniMax-01 ↗2025 · 技术报告
Lightning Attention、MoE 与长上下文。
- MiniMax-M1 ↗2025 · 技术报告
长上下文推理与测试时计算。
智谱 · GLM
Google DeepMind
- Gemini 1.5 ↗2024 · 技术报告
长上下文检索、跨模态理解与百万 token 评测。
- Gemini 2.5 ↗2025 · 技术报告
推理、多模态与 Agent 能力的训练和评测。
OpenAI
Anthropic
- Claude Sonnet 4.5 ↗2025 · 系统卡
编码与 Agent 评测、对齐及模型行为测试。
Meta AI
- Llama 3 ↗2024 · 技术报告
数据配比、预训练、后训练和大规模训练基础设施。
代表论文
按结构、预训练、上下文学习、后训练读这四篇,每篇先抓住它改变的环节。