Foundation
Diffusion Models
从“逐步破坏数据,再学习逆过程”理解扩散模型,以及噪声过程、预测目标、去噪主干、条件接口和求解器之间的分层关系。
Learning path
- DefinitionClarify what it is
- MechanismFollow the information flow
- EvolutionLocate landmark papers
- ResearchContinue into active topics
Concept map
From intuition to research connections
一句话定义
扩散模型(diffusion model)先用预先规定的过程把真实数据逐步变成噪声,再训练神经网络学习这个过程的反方向,从随机噪声逐步恢复出图像、视频或其他数据。
它不是某一个固定网络。U-Net、扩散 Transformer(Diffusion Transformer, DiT)或无注意力主干都可以承担“去噪器”;潜空间、条件控制和采样器则是另外几层设计。
一张图看懂原理
扩散模型训练和生成分别在做什么?
上半程的加噪规则通常固定且无需学习;模型学习的是在任意噪声级别判断怎样向更干净的数据移动。生成时必须多次调用这个模型,除非另行使用蒸馏或少步方法。
- 真实数据 x₀图像或潜变量来自训练分布
- 固定前向过程按噪声日程逐步破坏信号,并可直接采样任意时间步
- 学习去噪方向时间条件网络预测噪声、干净样本、速度或分数
- 反向生成过程从随机噪声开始,经数值更新逐步得到样本
真实数据经过逐步加噪成为高斯噪声;训练去噪网络后,生成过程从高斯噪声沿反向步骤逐步恢复样本。
前置概念与术语
- 概率分布(probability distribution):描述哪些样本更可能出现。生成模型的目标不是背诵单张图,而是近似数据分布。
- 高斯噪声(Gaussian noise):扩散过程常用的简单先验;容易采样,也便于推导带噪样本。
- 时间步(timestep):表示当前噪声强度,不是视频时间。网络需要知道自己正在处理多脏的输入。
- 分数函数(score function):对数概率密度相对于数据的梯度,可理解为“往更高概率区域移动的局部方向”。
- 去噪器(denoiser):接收带噪样本、时间步和可选条件的神经网络;U-Net 或 DiT 只是实现选择。
- 噪声日程(noise schedule):规定不同时间加入多少噪声;它会改变训练难度和采样轨迹。
- 网络函数求值次数(number of function evaluations, NFE):一次生成调用去噪网络多少次;它比笼统的“步数”更接近计算量,但仍需结合单步成本。
- 分类器自由引导(classifier-free guidance, CFG):组合有条件与无条件预测以增强条件一致性,通常会改变多样性并增加计算。
历史演化
哪些工作改变了扩散系统的基本组成方式?
这条时间线只保留范式节点:可工作的离散基线、连续时间统一、潜空间压缩、可扩展主干与条件接口。后续加速工作主要改造求解器或训练目标。
- 2020 · DDPM噪声预测目标与 U-Net 组合成稳定高质量离散扩散基线
- 2021 · Score SDE用连续时间统一 DDPM、分数模型、SDE 与 ODE 采样
- 2022 · LDM / U-ViT一条线把生成搬入压缩潜空间,另一条线验证 Transformer 去噪器
- 2023 · DiT / ControlNet可扩展 Transformer 主干与可复用空间条件接口分别成形
- 之后 · 少步与部署蒸馏、求解器、缓存、量化和无注意力主干开始分别降低系统成本
时间线从 2020 年 DDPM,经 2021 年 Score SDE、2022 年 LDM 与 U-ViT、2023 年 DiT 和 ControlNet,发展到少步与部署优化。
更早的 2015 年扩散概率建模工作提出了非平衡热力学路线;本库目前以 DDPM 作为现代图像扩散的可工作起点。这个边界很重要:DDPM 并非“最早发明扩散”,但它使高质量图像生成成为可复用基线。
核心机制
- 规定破坏过程:选择前向马尔可夫链或连续 SDE,使数据在足够高噪声时接近易采样先验。
- 随机噪声级别训练:一次训练只抽取一个时间步,把真实样本直接扰动到该级别,因此训练不必逐步跑完整条链。
- 学习局部逆方向:网络可以预测噪声 $\epsilon$、干净样本 $x_0$、速度参数 $v$ 或分数;不同参数化会改变损失权重与数值稳定性。
- 数值求解生成:推理从噪声开始,按离散反向链、反向 SDE 或概率流 ODE 更新。采样器决定怎样使用网络预测,不等于网络本身。
- 注入条件:文本、类别、边缘、深度、姿态或参考图可以通过交叉注意力、旁路适配器或引导项影响每一步。
Score SDE 给出最清楚的分层:噪声过程决定“怎样把数据变简单”,分数网络学习“局部往哪里走”,数值求解器决定“怎样沿这个方向走回去”。
主要方法分支
论文说“改进扩散模型”时,究竟改了哪一层?
从底向上检查表示空间、破坏过程、预测网络、条件接口和求解部署层。不同层的增益不能互相替代;例如少步采样不会消除潜空间解码误差。
- 表示空间像素扩散保留细节但成本高;潜空间扩散压缩计算,也引入重建上限
- 噪声与预测目标离散 DDPM、VE/VP SDE、噪声预测、x₀ 预测与速度预测改变训练几何
- 去噪主干U-Net、U-ViT、DiT 与无注意力模型负责同一类时间条件预测
- 条件与控制接口交叉注意力、CFG、ControlNet 与训练时或推理时引导解决不同控制粒度
- 采样与部署SDE/ODE 求解器、蒸馏、缓存、量化和时间步选择共同决定真实延迟
五层系统栈依次为表示空间、噪声与目标、去噪主干、条件控制、采样与部署。
- 离散扩散与连续分数模型:前者便于建立训练目标和马尔可夫链直觉;后者便于统一 SDE、ODE 与求解器。
- 像素空间与潜空间扩散:LDM 显著降低高分辨率计算,但自动编码器会限制细粒度精度。
- 卷积、Transformer 与无注意力去噪器:U-ViT 与 DiT 证明 Transformer 可扩展;无注意力扩散主干 提醒主干并未只剩一条路线。
- 条件与可控扩散:文本交叉注意力解决全局语义,ControlNet 以旁路结构接入边缘、深度、姿态等空间条件;它们不是同一个控制问题。
- 多步、少步与一步生成:求解器优化重用原模型,蒸馏则改变训练或学生模型。引导蒸馏 表明可把 CFG 行为压入更便宜的模型,但需额外训练与教师成本。
奠基论文导读
- DDPM:先读训练与采样算法,理解为什么训练可随机抽时间步,而生成需要顺序迭代。
- Score SDE:把 DDPM、分数函数、反向 SDE 和概率流 ODE 放进统一框架;重点是组件分层,不必先掌握全部随机微积分。
- Latent Diffusion Models:理解现代高分辨率系统为何先压缩图像,以及潜空间带来的效率—重建取舍。
- U-ViT:观察 Transformer 怎样被改造成时间条件去噪器,避免把 ViT 分类结构直接等同于生成主干。
- DiT:理解潜空间 patch 化、条件注入与缩放实验怎样推动 Transformer 成为主干平台。
- ControlNet:理解冻结基础模型、复制编码分支与零卷积怎样形成可复用的空间条件接口。
- 引导扩散蒸馏:区分“换数值求解器”和“训练少步学生”两种加速逻辑。
- Diffusion Models Without Attention:作为反例阅读,检验“DiT 必然是唯一可扩展主干”的强断言。
常见误区与局限
- 误区:扩散模型就是 U-Net 或 DiT。 正确边界:扩散描述概率过程和学习目标,主干只是去噪函数的实现。
- 误区:训练和生成都要跑完整加噪链。 正确边界:训练通常可直接采样任意时间步;生成才需要求解逆过程。
- 误区:步数越少,系统一定越快。 正确边界:还要检查每步调用次数、模型大小、CFG 双分支、并行度、解码器和硬件。
- 误区:潜空间扩散只带来好处。 正确边界:压缩降低计算,也可能丢失文字、纹理、几何和精确编辑所需的细节。
- 误区:FID 更低就全面更好。 正确边界:FID 依赖特征、参照集和样本数,也不直接测文本一致性、可控性、记忆、偏差或真实延迟。
- 局限:迭代生成成本。 多步顺序求值仍是扩散的系统瓶颈,少步方法则可能引入蒸馏成本、质量退化或任务迁移问题。
- 局限:证据随任务变化。 在 CIFAR-10 的优势不能外推到文本到图像、视频或专业视觉任务;必须回到对应数据与协议。
与研究专题的关系
- 图像生成 研究如何把扩散底座与文本条件、数据、可控性和统一生成—编辑接口接成完整系统。
- 图像编辑 更关注反演、身份保持、局部控制和真实图像轨迹,而不只是从噪声生成。
- 视频生成 在空间生成之外增加时间一致性、运动建模和更高计算成本。
- 扩散效率工程 专门比较求解器、蒸馏、缓存、量化、主干和表示压缩的真实成本。
- 生成模型评测 解释 FID、偏好评测、组合性与可靠性为何必须分开。
推荐阅读顺序
- 先读本页流程图,能口头区分前向加噪、去噪网络和反向求解。
- 阅读 DDPM 的算法与两项消融,建立离散直觉。
- 阅读 Score SDE 的图 1–2 与统一框架,建立连续时间分层。
- 阅读 LDM,理解现代高分辨率系统的表示空间。
- 在 U-ViT、DiT 和无注意力主干中做三方对照,再进入控制或效率专题。
证据基础
- sources/2026-07-14-ddpm:离散训练、噪声预测与高质量生成基线。
- sources/2026-07-14-score-sde:连续时间、分数函数、SDE/ODE 与采样统一框架。
- sources/2026-04-14-latent-diffusion-models:潜空间压缩与通用交叉注意力接口。
- sources/2026-04-15-all-are-worth-words、sources/2026-04-15-scalable-diffusion-models-with-transformers:Transformer 去噪主干的两个关键节点。
- sources/2026-04-16-controlnet:空间条件控制接口。
- sources/2026-04-16-on-distillation-of-guided-diffusion-models、sources/2026-04-15-distilling-ode-solvers-diffusion-models:少步训练与求解器路线的区别。
- sources/2026-04-15-accelerating-diffusion-sampling-optimized-time-steps:时间步选择的效率边界。