LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Analyzing and Improving the Training Dynamics of Diffusion ModelsEDM2 的幅值保持训练与 Post-hoc EMA

一句话结论

EDM2 通过校正 ADM U-Net 的激活、权重、更新幅值和 EMA,把 ImageNet-512 的质量—模型/训练/采样计算前沿显著推进;但绝对训练预算约 2.147B seen images,且作者明确把 DiT/RIN 迁移列为未来工作,所以它是 U-Net 训练动力学证据,不是 DiT 证据。

论文定位

论文保留 ADM U-Net 的高层 encoder–decoder/skip/conditioning 结构,但重写内部层、归一化、残差组合和有效学习率,并提出 post-hoc EMA。它改善训练质量—计算前沿,不是采样 schedule 或 solver distillation。

问题定义

ADM residual/skip 路径会让 activation magnitude 随训练增长;weight normalization 又会使 weight norm 增长,令 effective learning rate 隐式衰减且层间失衡。固定 EMA 还会把架构、训练时长与 CFG 的差异混入最终指标。

方法概述

  • 对卷积/线性层按输出通道归一化,保持 activation magnitude。
  • 强制 weight normalization,并将梯度投影到单位球切平面。
  • 显式控制 effective learning rate 并使用 inverse-square-root decay。
  • 移除大部分 group norm,校正 SiLU、Fourier feature、残差加和与 skip concatenation 幅值。
  • 维护两组 power-function averaged weights 与周期 snapshots,训练后重构任意 EMA profile。

核心实验与结果

Config A→G(ImageNet-512,无 CFG)

配置FID参数GFLOPs/eval
EDM baseline8.00295.9M110.4
minor improvements7.24291.8M100.4
streamlining6.96277.8M100.3
MP learned layers3.75277.8M101.2
controlled effective LR3.02277.8M101.2
remove group norms2.71280.2M102.1
EDM2-S2.56280.2M102.2

Scaling

  • EDM2-S:FID 2.56/2.23(无/有 CFG),280M,102 GFLOPs/eval。
  • EDM2-XXL:FID 1.91/1.81,1523M,552 GFLOPs/eval。
  • 所有 EDM2 表中采样为 63 NFE deterministic。
  • ImageNet-64:相近复杂度下 EDM 2.22 → EDM2 1.58,scale 后 1.33。

效率口径

  • 训练预算:约 2.147B seen images;绝对成本很高。
  • NFE:63;相对许多表中 250–1000 NFE baseline 更低,但 sampling setup 也贡献了差异。
  • 单步 FLOPs:46–552 GFLOPs/eval,随模型 scale 增长。
  • 训练 compute:附录用 zettaFLOPs 估算,假设 iteration 为 evaluation 的 3×。
  • sampling compute:附录用 TFLOPs/image,latent 模型计入 VAE decoder 1260.9 GFLOPs。
  • latency:仅有约 0–7 天收敛图,缺完整硬件环境;不能换算为通用 wall-clock speedup。
  • post-hoc EMA:节省的是 EMA sweep/重复训练成本,不是单次主训练 FLOPs。

关键消融

  • 最大单步 FID 改进来自 magnitude-preserving learned layers:6.96→3.75。
  • 大模型需 dropout:XXL 无 dropout 约 537M images 后过拟合;10% dropout 初期稍慢但能继续改善,XS/S 则不应使用。
  • EMA optimum 随架构、训练时长和 CFG 变化。
  • FID 与 FDDINOv2 对最佳 EMA/CFG 严重分歧,说明单一 FID 最优不是普遍感知最优。
  • 用 XS unconditional model 引导 XXL conditional model 已足够,可将常见 CFG 额外计算近乎减半。

局限或疑问

  • 主要只有 ImageNet class-conditional 图像,没有文本 prompt、人评、编辑或视频。
  • 一次最终 run 的预算未计入整个研究中的架构/超参搜索成本。
  • “高层结构不变”不等于只改 optimizer;内部网络实现被系统重构。
  • 作者明确说 RIN、DiT 与其他应用能否受益尚未知;不应把本文写成 DiT 训练改进或 DiT 默认 backbone 证据

对当前 Wiki 判断的影响

  • 直接支持 Diffusion Efficiency Engineering 中“training dynamics 与 EMA 是独立优化层”。
  • 直接支持 Diffusion Models 中“同一高层 U-Net 的幅值和 EMA 可大幅改变质量—计算前沿”。
  • 对 DiT 默认化 claim 是压力测试/背景证据:U-Net 经系统训练改造后仍有强 compute frontier,但不构成受控 U-Net vs DiT 结论。
  • 反对把 diffusion 进步只归因于 backbone;训练动态、sampling 与 metric sweep 同样关键。

原始链接

相关页面