一句话结论
EDM2 通过校正 ADM U-Net 的激活、权重、更新幅值和 EMA,把 ImageNet-512 的质量—模型/训练/采样计算前沿显著推进;但绝对训练预算约 2.147B seen images,且作者明确把 DiT/RIN 迁移列为未来工作,所以它是 U-Net 训练动力学证据,不是 DiT 证据。
论文定位
论文保留 ADM U-Net 的高层 encoder–decoder/skip/conditioning 结构,但重写内部层、归一化、残差组合和有效学习率,并提出 post-hoc EMA。它改善训练质量—计算前沿,不是采样 schedule 或 solver distillation。
问题定义
ADM residual/skip 路径会让 activation magnitude 随训练增长;weight normalization 又会使 weight norm 增长,令 effective learning rate 隐式衰减且层间失衡。固定 EMA 还会把架构、训练时长与 CFG 的差异混入最终指标。
方法概述
- 对卷积/线性层按输出通道归一化,保持 activation magnitude。
- 强制 weight normalization,并将梯度投影到单位球切平面。
- 显式控制 effective learning rate 并使用 inverse-square-root decay。
- 移除大部分 group norm,校正 SiLU、Fourier feature、残差加和与 skip concatenation 幅值。
- 维护两组 power-function averaged weights 与周期 snapshots,训练后重构任意 EMA profile。
核心实验与结果
Config A→G(ImageNet-512,无 CFG)
| 配置 | FID | 参数 | GFLOPs/eval |
|---|---|---|---|
| EDM baseline | 8.00 | 295.9M | 110.4 |
| minor improvements | 7.24 | 291.8M | 100.4 |
| streamlining | 6.96 | 277.8M | 100.3 |
| MP learned layers | 3.75 | 277.8M | 101.2 |
| controlled effective LR | 3.02 | 277.8M | 101.2 |
| remove group norms | 2.71 | 280.2M | 102.1 |
| EDM2-S | 2.56 | 280.2M | 102.2 |
Scaling
- EDM2-S:FID 2.56/2.23(无/有 CFG),280M,102 GFLOPs/eval。
- EDM2-XXL:FID 1.91/1.81,1523M,552 GFLOPs/eval。
- 所有 EDM2 表中采样为 63 NFE deterministic。
- ImageNet-64:相近复杂度下 EDM 2.22 → EDM2 1.58,scale 后 1.33。
效率口径
- 训练预算:约 2.147B seen images;绝对成本很高。
- NFE:63;相对许多表中 250–1000 NFE baseline 更低,但 sampling setup 也贡献了差异。
- 单步 FLOPs:46–552 GFLOPs/eval,随模型 scale 增长。
- 训练 compute:附录用 zettaFLOPs 估算,假设 iteration 为 evaluation 的 3×。
- sampling compute:附录用 TFLOPs/image,latent 模型计入 VAE decoder 1260.9 GFLOPs。
- latency:仅有约 0–7 天收敛图,缺完整硬件环境;不能换算为通用 wall-clock speedup。
- post-hoc EMA:节省的是 EMA sweep/重复训练成本,不是单次主训练 FLOPs。
关键消融
- 最大单步 FID 改进来自 magnitude-preserving learned layers:6.96→3.75。
- 大模型需 dropout:XXL 无 dropout 约 537M images 后过拟合;10% dropout 初期稍慢但能继续改善,XS/S 则不应使用。
- EMA optimum 随架构、训练时长和 CFG 变化。
- FID 与 FDDINOv2 对最佳 EMA/CFG 严重分歧,说明单一 FID 最优不是普遍感知最优。
- 用 XS unconditional model 引导 XXL conditional model 已足够,可将常见 CFG 额外计算近乎减半。
局限或疑问
- 主要只有 ImageNet class-conditional 图像,没有文本 prompt、人评、编辑或视频。
- 一次最终 run 的预算未计入整个研究中的架构/超参搜索成本。
- “高层结构不变”不等于只改 optimizer;内部网络实现被系统重构。
- 作者明确说 RIN、DiT 与其他应用能否受益尚未知;不应把本文写成 DiT 训练改进或 DiT 默认 backbone 证据。
对当前 Wiki 判断的影响
- 直接支持 Diffusion Efficiency Engineering 中“training dynamics 与 EMA 是独立优化层”。
- 直接支持 Diffusion Models 中“同一高层 U-Net 的幅值和 EMA 可大幅改变质量—计算前沿”。
- 对 DiT 默认化 claim 是压力测试/背景证据:U-Net 经系统训练改造后仍有强 compute frontier,但不构成受控 U-Net vs DiT 结论。
- 反对把 diffusion 进步只归因于 backbone;训练动态、sampling 与 metric sweep 同样关键。