从一段话得到图像,或者从噪声逐步生成一个样本,背后需要学习数据的规律,也需要一条能实际采样的计算过程。研究可以发生在训练目标、生成路径、控制条件或速度上。
生成模型学习一批数据中反复出现的规律,再据此产生新的样本。对图像来说,它既可以从随机数出发画图,也可以根据文字、草图或已有图片补全内容。研究关心的不只是画面好不好看,还包括结果是否听从条件、多次生成是否丰富、需要多少计算。
这页用图像生成认识几种重要做法:GAN 通过生成器与判别器的对抗学习,扩散模型学习在不同噪声程度下去噪,潜空间方法把主要计算移到压缩表示中。它们回答的问题有交集,也可以组合。
主要任务- 内容生成:从文字或其他条件得到图像,为设计、创作和数据研究提供样本。
- 图像编辑与恢复:补全缺失区域、按要求修改内容,或恢复低质量图像。
- 复杂输出建模:把生成方法用于音频、视频或动作序列,表达可能存在的多种结果。
看生成模型时同时问三件事:学的是什么目标,生成一次要做多少步,结果怎样衡量;挑一张漂亮图片回答不了这些问题。
从噪声到图像- 01随机噪声
- 02去噪网络
- 03迭代生成
- 04条件引导
发展路线与代表工作
- 2014
让生成与辨别相互推动
GAN 用判别器的反馈训练生成器。它提供了一条通过对抗目标学习数据分布的路线。
- 2020
把生成拆成一串去噪步骤
DDPM 在不同噪声水平训练预测,再从随机噪声逐步采样。它是与 GAN 并行的重要生成路线。
- 2022
在哪里去噪更省计算
LDM 先压缩图像,在较小的潜表示中做扩散,最后解码回像素;文本等条件可在去噪时参与。
- 2023
去噪网络也可以用 Transformer
DiT 研究用 Transformer 处理潜空间中的小块,以及模型计算量与生成质量的关系。
关键概念
- 噪声 / noise
- 这里通常是按给定概率分布抽取的随机扰动。训练时知道加了什么噪声,便能构造有答案的学习任务。
- 去噪目标 / denoising
- 根据带噪输入和当前噪声程度预测噪声、干净样本或相关量。DDPM 的常用形式是预测所加噪声,再据此计算采样更新。
- 潜空间 / latent space
- 编码器把图片压成较小的数字表示,解码器将其还原。计算量会下降,但压缩丢失的细节也会影响最终图像。
- 采样器 / sampler
- 规定怎样用模型的预测从初始随机状态得到样本。步数、更新公式和随机性都会影响速度与结果,不能只比较步数。
从一次扩散采样开始
从 Hugging Face Diffusion Course 的第一单元进入,观察带噪样本与去噪预测之间的关系。配合一份小例子看每一步的输入输出。
接着读 Lilian Weng 的 Diffusion Models或 Yang Song 的 score-based generative modeling,选一种讲法往下走。
扩散与 Flow Matching 的数学
概率分布、噪声、梯度和微分方程会逐渐出现。用基础页补当前卡点,再接 MIT Flow Matching and Diffusion(2025)的讲义与练习。
第一遍先分清训练时模型在学什么、生成时怎么使用它。之后再比较不同方法的目标和采样过程。
采样步数怎样影响速度和结果
固定模型与输入条件,改变采样步数,记录时间与生成结果怎样变化。如果只挑最好看的图,很难知道改动整体是否有效;把相同条件下的一组结果一起保留下来。
这些方法也可能用于预测机器人动作,接 Diffusion Policy和具身页。如果关心生成过程怎样用于环境预测和决策,再读 World Model。
扩散推导与模型比较
中文推导可以看苏剑林的扩散系列入口,比较实验可以看 LoopDiT。课程与其他项目集中在生成模型资料目录。
代表论文
先对照 GAN 和 DDPM 理解两种训练思路,再读 LDM 的计算取舍,最后用 DiT 连接 Transformer 与扩散。
入门练习
卡在某一步?把过程带到 AMA 一起聊 ↗