LLLMWIKI
ArticleResearch mapReading portalMetadata

Topic · Updated 2026-07-14

Diffusion Models

从“逐步破坏数据,再学习逆过程”理解扩散模型,以及噪声过程、预测目标、去噪主干、条件接口和求解器之间的分层关系。

Foundation

Diffusion Models

从“逐步破坏数据,再学习逆过程”理解扩散模型,以及噪声过程、预测目标、去噪主干、条件接口和求解器之间的分层关系。

10 Source notes0 Open questions

Learning path

  1. DefinitionClarify what it is
  2. MechanismFollow the information flow
  3. EvolutionLocate landmark papers
  4. ResearchContinue into active topics

Concept map

From intuition to research connections

10 Source notes
1DefinitionClarify what it is
2MechanismFollow the information flow
3EvolutionLocate landmark papers
4ResearchContinue into active topics

一句话定义

扩散模型(diffusion model)先用预先规定的过程把真实数据逐步变成噪声,再训练神经网络学习这个过程的反方向,从随机噪声逐步恢复出图像、视频或其他数据。

它不是某一个固定网络。U-Net、扩散 Transformer(Diffusion Transformer, DiT)或无注意力主干都可以承担“去噪器”;潜空间、条件控制和采样器则是另外几层设计。

一张图看懂原理

扩散模型训练和生成分别在做什么?

从数据到噪声,再从噪声回到样本

上半程的加噪规则通常固定且无需学习;模型学习的是在任意噪声级别判断怎样向更干净的数据移动。生成时必须多次调用这个模型,除非另行使用蒸馏或少步方法。

  1. 真实数据 x₀图像或潜变量来自训练分布
  2. 固定前向过程按噪声日程逐步破坏信号,并可直接采样任意时间步
  3. 学习去噪方向时间条件网络预测噪声、干净样本、速度或分数
  4. 反向生成过程从随机噪声开始,经数值更新逐步得到样本
Diagram evidenceDDPMScore SDE

真实数据经过逐步加噪成为高斯噪声;训练去噪网络后,生成过程从高斯噪声沿反向步骤逐步恢复样本。

前置概念与术语

  • 概率分布(probability distribution):描述哪些样本更可能出现。生成模型的目标不是背诵单张图,而是近似数据分布。
  • 高斯噪声(Gaussian noise):扩散过程常用的简单先验;容易采样,也便于推导带噪样本。
  • 时间步(timestep):表示当前噪声强度,不是视频时间。网络需要知道自己正在处理多脏的输入。
  • 分数函数(score function):对数概率密度相对于数据的梯度,可理解为“往更高概率区域移动的局部方向”。
  • 去噪器(denoiser):接收带噪样本、时间步和可选条件的神经网络;U-Net 或 DiT 只是实现选择。
  • 噪声日程(noise schedule):规定不同时间加入多少噪声;它会改变训练难度和采样轨迹。
  • 网络函数求值次数(number of function evaluations, NFE):一次生成调用去噪网络多少次;它比笼统的“步数”更接近计算量,但仍需结合单步成本。
  • 分类器自由引导(classifier-free guidance, CFG):组合有条件与无条件预测以增强条件一致性,通常会改变多样性并增加计算。

历史演化

哪些工作改变了扩散系统的基本组成方式?

扩散模型的五次关键分层

这条时间线只保留范式节点:可工作的离散基线、连续时间统一、潜空间压缩、可扩展主干与条件接口。后续加速工作主要改造求解器或训练目标。

  1. 2020 · DDPM噪声预测目标与 U-Net 组合成稳定高质量离散扩散基线
  2. 2021 · Score SDE用连续时间统一 DDPM、分数模型、SDE 与 ODE 采样
  3. 2022 · LDM / U-ViT一条线把生成搬入压缩潜空间,另一条线验证 Transformer 去噪器
  4. 2023 · DiT / ControlNet可扩展 Transformer 主干与可复用空间条件接口分别成形
  5. 之后 · 少步与部署蒸馏、求解器、缓存、量化和无注意力主干开始分别降低系统成本
Diagram evidenceDDPMScore SDELDMDiTControlNet

时间线从 2020 年 DDPM,经 2021 年 Score SDE、2022 年 LDM 与 U-ViT、2023 年 DiT 和 ControlNet,发展到少步与部署优化。

更早的 2015 年扩散概率建模工作提出了非平衡热力学路线;本库目前以 DDPM 作为现代图像扩散的可工作起点。这个边界很重要:DDPM 并非“最早发明扩散”,但它使高质量图像生成成为可复用基线。

核心机制

  1. 规定破坏过程:选择前向马尔可夫链或连续 SDE,使数据在足够高噪声时接近易采样先验。
  2. 随机噪声级别训练:一次训练只抽取一个时间步,把真实样本直接扰动到该级别,因此训练不必逐步跑完整条链。
  3. 学习局部逆方向:网络可以预测噪声 $\epsilon$、干净样本 $x_0$、速度参数 $v$ 或分数;不同参数化会改变损失权重与数值稳定性。
  4. 数值求解生成:推理从噪声开始,按离散反向链、反向 SDE 或概率流 ODE 更新。采样器决定怎样使用网络预测,不等于网络本身。
  5. 注入条件:文本、类别、边缘、深度、姿态或参考图可以通过交叉注意力、旁路适配器或引导项影响每一步。

Score SDE 给出最清楚的分层:噪声过程决定“怎样把数据变简单”,分数网络学习“局部往哪里走”,数值求解器决定“怎样沿这个方向走回去”。

主要方法分支

论文说“改进扩散模型”时,究竟改了哪一层?

一个扩散系统不是一个网络,而是五层组合

从底向上检查表示空间、破坏过程、预测网络、条件接口和求解部署层。不同层的增益不能互相替代;例如少步采样不会消除潜空间解码误差。

  1. 表示空间像素扩散保留细节但成本高;潜空间扩散压缩计算,也引入重建上限
  2. 噪声与预测目标离散 DDPM、VE/VP SDE、噪声预测、x₀ 预测与速度预测改变训练几何
  3. 去噪主干U-Net、U-ViT、DiT 与无注意力模型负责同一类时间条件预测
  4. 条件与控制接口交叉注意力、CFG、ControlNet 与训练时或推理时引导解决不同控制粒度
  5. 采样与部署SDE/ODE 求解器、蒸馏、缓存、量化和时间步选择共同决定真实延迟
Diagram evidenceLDMDiTControlNetGuidance Distillation

五层系统栈依次为表示空间、噪声与目标、去噪主干、条件控制、采样与部署。

  • 离散扩散与连续分数模型:前者便于建立训练目标和马尔可夫链直觉;后者便于统一 SDE、ODE 与求解器。
  • 像素空间与潜空间扩散LDM 显著降低高分辨率计算,但自动编码器会限制细粒度精度。
  • 卷积、Transformer 与无注意力去噪器U-ViTDiT 证明 Transformer 可扩展;无注意力扩散主干 提醒主干并未只剩一条路线。
  • 条件与可控扩散:文本交叉注意力解决全局语义,ControlNet 以旁路结构接入边缘、深度、姿态等空间条件;它们不是同一个控制问题。
  • 多步、少步与一步生成:求解器优化重用原模型,蒸馏则改变训练或学生模型。引导蒸馏 表明可把 CFG 行为压入更便宜的模型,但需额外训练与教师成本。

奠基论文导读

  1. DDPM:先读训练与采样算法,理解为什么训练可随机抽时间步,而生成需要顺序迭代。
  2. Score SDE:把 DDPM、分数函数、反向 SDE 和概率流 ODE 放进统一框架;重点是组件分层,不必先掌握全部随机微积分。
  3. Latent Diffusion Models:理解现代高分辨率系统为何先压缩图像,以及潜空间带来的效率—重建取舍。
  4. U-ViT:观察 Transformer 怎样被改造成时间条件去噪器,避免把 ViT 分类结构直接等同于生成主干。
  5. DiT:理解潜空间 patch 化、条件注入与缩放实验怎样推动 Transformer 成为主干平台。
  6. ControlNet:理解冻结基础模型、复制编码分支与零卷积怎样形成可复用的空间条件接口。
  7. 引导扩散蒸馏:区分“换数值求解器”和“训练少步学生”两种加速逻辑。
  8. Diffusion Models Without Attention:作为反例阅读,检验“DiT 必然是唯一可扩展主干”的强断言。

常见误区与局限

  • 误区:扩散模型就是 U-Net 或 DiT。 正确边界:扩散描述概率过程和学习目标,主干只是去噪函数的实现。
  • 误区:训练和生成都要跑完整加噪链。 正确边界:训练通常可直接采样任意时间步;生成才需要求解逆过程。
  • 误区:步数越少,系统一定越快。 正确边界:还要检查每步调用次数、模型大小、CFG 双分支、并行度、解码器和硬件。
  • 误区:潜空间扩散只带来好处。 正确边界:压缩降低计算,也可能丢失文字、纹理、几何和精确编辑所需的细节。
  • 误区:FID 更低就全面更好。 正确边界:FID 依赖特征、参照集和样本数,也不直接测文本一致性、可控性、记忆、偏差或真实延迟。
  • 局限:迭代生成成本。 多步顺序求值仍是扩散的系统瓶颈,少步方法则可能引入蒸馏成本、质量退化或任务迁移问题。
  • 局限:证据随任务变化。 在 CIFAR-10 的优势不能外推到文本到图像、视频或专业视觉任务;必须回到对应数据与协议。

与研究专题的关系

  • 图像生成 研究如何把扩散底座与文本条件、数据、可控性和统一生成—编辑接口接成完整系统。
  • 图像编辑 更关注反演、身份保持、局部控制和真实图像轨迹,而不只是从噪声生成。
  • 视频生成 在空间生成之外增加时间一致性、运动建模和更高计算成本。
  • 扩散效率工程 专门比较求解器、蒸馏、缓存、量化、主干和表示压缩的真实成本。
  • 生成模型评测 解释 FID、偏好评测、组合性与可靠性为何必须分开。

推荐阅读顺序

  1. 先读本页流程图,能口头区分前向加噪、去噪网络和反向求解。
  2. 阅读 DDPM 的算法与两项消融,建立离散直觉。
  3. 阅读 Score SDE 的图 1–2 与统一框架,建立连续时间分层。
  4. 阅读 LDM,理解现代高分辨率系统的表示空间。
  5. 在 U-ViT、DiT 和无注意力主干中做三方对照,再进入控制或效率专题。

证据基础

相关页面