生成模型:图像是怎样一步步得到的

从一段话得到图像,或者从噪声逐步生成一个样本,背后需要学习数据的规律,也需要一条能实际采样的计算过程。研究可以发生在训练目标、生成路径、控制条件或速度上。

生成模型学习一批数据中反复出现的规律,再据此产生新的样本。对图像来说,它既可以从随机数出发画图,也可以根据文字、草图或已有图片补全内容。研究关心的不只是画面好不好看,还包括结果是否听从条件、多次生成是否丰富、需要多少计算。

这页用图像生成认识几种重要做法:GAN 通过生成器与判别器的对抗学习,扩散模型学习在不同噪声程度下去噪,潜空间方法把主要计算移到压缩表示中。它们回答的问题有交集,也可以组合。

主要任务
  • 内容生成:从文字或其他条件得到图像,为设计、创作和数据研究提供样本。
  • 图像编辑与恢复:补全缺失区域、按要求修改内容,或恢复低质量图像。
  • 复杂输出建模:把生成方法用于音频、视频或动作序列,表达可能存在的多种结果。

看生成模型时同时问三件事:学的是什么目标,生成一次要做多少步,结果怎样衡量;挑一张漂亮图片回答不了这些问题。

从噪声到图像
  1. 01随机噪声
  2. 02去噪网络
  3. 03迭代生成
  4. 04条件引导

发展路线与代表工作

  1. 2014

    让生成与辨别相互推动

    GAN 用判别器的反馈训练生成器。它提供了一条通过对抗目标学习数据分布的路线。

  2. 2020

    把生成拆成一串去噪步骤

    DDPM 在不同噪声水平训练预测,再从随机噪声逐步采样。它是与 GAN 并行的重要生成路线。

  3. 2022

    在哪里去噪更省计算

    LDM 先压缩图像,在较小的潜表示中做扩散,最后解码回像素;文本等条件可在去噪时参与。

  4. 2023

    去噪网络也可以用 Transformer

    DiT 研究用 Transformer 处理潜空间中的小块,以及模型计算量与生成质量的关系。

关键概念

噪声 / noise
这里通常是按给定概率分布抽取的随机扰动。训练时知道加了什么噪声,便能构造有答案的学习任务。
去噪目标 / denoising
根据带噪输入和当前噪声程度预测噪声、干净样本或相关量。DDPM 的常用形式是预测所加噪声,再据此计算采样更新。
潜空间 / latent space
编码器把图片压成较小的数字表示,解码器将其还原。计算量会下降,但压缩丢失的细节也会影响最终图像。
采样器 / sampler
规定怎样用模型的预测从初始随机状态得到样本。步数、更新公式和随机性都会影响速度与结果,不能只比较步数。

从一次扩散采样开始

从 Hugging Face Diffusion Course 的第一单元进入,观察带噪样本与去噪预测之间的关系。配合一份小例子看每一步的输入输出。

接着读 Lilian Weng 的 Diffusion Models或 Yang Song 的 score-based generative modeling,选一种讲法往下走。

扩散与 Flow Matching 的数学

概率分布、噪声、梯度和微分方程会逐渐出现。用基础页补当前卡点,再接 MIT Flow Matching and Diffusion(2025)的讲义与练习。

第一遍先分清训练时模型在学什么、生成时怎么使用它。之后再比较不同方法的目标和采样过程。

采样步数怎样影响速度和结果

固定模型与输入条件,改变采样步数,记录时间与生成结果怎样变化。如果只挑最好看的图,很难知道改动整体是否有效;把相同条件下的一组结果一起保留下来。

这些方法也可能用于预测机器人动作,接 Diffusion Policy和具身页。如果关心生成过程怎样用于环境预测和决策,再读 World Model。

扩散推导与模型比较

中文推导可以看苏剑林的扩散系列入口,比较实验可以看 LoopDiT。课程与其他项目集中在生成模型资料目录。

代表论文

先对照 GAN 和 DDPM 理解两种训练思路,再读 LDM 的计算取舍,最后用 DiT 连接 Transformer 与扩散。

2014 · NIPS 2014

Generative Adversarial Nets

Generative Adversarial Nets · Goodfellow et al., 2014 · Figure 1
论文原图 · Goodfellow et al., 2014 · Figure 1 · 论文原文

它在解决什么

怎样在不直接写出复杂图像概率的情况下学会生成?

核心想法

生成器把随机输入变成样本;判别器学习区分训练数据和生成样本,其反馈再推动生成器改进。

为什么选这篇

它把生成模型的训练写成两个模型之间的博弈,核心想法很适合画图理解。

第一遍读哪里

先看两者的目标和交替更新算法,再看实验样本。

读完还要问

两边的训练需要配合,可能不稳定,也可能只覆盖数据中的部分模式。

2020 · NeurIPS 2020

Denoising Diffusion Probabilistic Models

Denoising Diffusion Probabilistic Models · Ho et al. · Fig. 1
论文原图 · Ho et al. · Fig. 1 · 论文原文

它在解决什么

能否通过学习一系列去噪任务来生成清晰图像?

核心想法

训练时给真实图像加入已知噪声,模型学习预测噪声;采样时反复调用模型,从随机状态逐渐形成样本。

为什么选这篇

训练与采样的对应关系清楚,是理解后续扩散工作的好入口。

第一遍读哪里

把训练和采样两个算法并排看,先弄懂模型每次收到什么、预测什么。

读完还要问

原始采样需要许多次顺序计算。

2022 · CVPR 2022

High-Resolution Image Synthesis with Latent Diffusion Models

High-Resolution Image Synthesis with Latent Diffusion Models · Rombach et al. · Fig. 3
论文原图 · Rombach et al. · Fig. 3 · 论文原文

它在解决什么

扩散能否少处理一些像素,同时保留生成图像的关键细节?

核心想法

先用自编码器压缩图片,在潜表示上训练扩散,再解码;交叉注意力让文字等条件参与去噪。

为什么选这篇

它把图像压缩、生成质量和计算成本放在同一个设计里,也是理解 Stable Diffusion 的基础。

第一遍读哪里

先沿编码、扩散、解码走一遍,再看压缩程度的比较。

读完还要问

压缩会损失信息;会按文字生成,不代表能稳定满足复杂数量与空间关系。

2023 · ICCV 2023

Scalable Diffusion Models with Transformers

Scalable Diffusion Models with Transformers · Peebles & Xie · Fig. 3
论文原图 · Peebles & Xie · Fig. 3 · 论文原文

它在解决什么

扩散模型中的去噪网络能否改用适合扩大规模的 Transformer?

核心想法

把潜表示切成小块,用 Transformer 预测扩散所需的量,并比较深度、宽度和块大小。

为什么选这篇

它让你分清生成目标与网络结构,也能读到围绕计算量的系统比较。

第一遍读哪里

先看模型结构,再把各规模的计算量与生成指标对照起来。

读完还要问

原论文主要研究类别条件的 ImageNet 图像生成,不能直接当作文本生成视频能力的证据。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗