一句话结论
在固定预训练模型、固定 ODE solver 和固定 NFE下,优化离散时间点可显著改善 5–15 NFE 的 FID;其离线优化只需 CPU 约 1.9–14.1 秒,但论文没有测生成 latency/FLOPs,因此应称为 NFE—质量前沿改善,而不是已实测的端端加速。
论文定位
这是 training-free sampling schedule optimization:不训练或蒸馏 denoiser,不改变每次网络求值成本。方法位于 solver 之上的时间离散化层,与“训练一步模型”和“蒸馏 solver 更新”不同。
问题定义
uniform-$t$、uniform-logSNR 或 EDM schedule 在极少步时未必适合具体高阶 solver。论文从 solver 的局部多项式误差展开构造代理目标,并在时间单调约束下优化内部时间点。
方法概述
- 将 diffusion probability-flow ODE 写到 half-log-SNR 域。
- 用 solver 权重和 score-error 包络近似全局误差。
- 通过 constrained trust-region 优化时间点;结果可预计算复用。
- 像素模型使用 $p=1$,latent 模型使用 $p=2$。
- 主测试 solver 为 UniPC 与 DPM-Solver++。
核心实验与结果
| 设置 | NFE | 最相关基线 → 优化后 FID |
|---|---|---|
| CIFAR-10,UniPC | 5 | 23.22 → 12.11(补充最佳 11.91) |
| ImageNet 64²,ADM+UniPC | 5 | 12.36 → 10.47 |
| ImageNet 256²,DiT-XL/2+UniPC | 5 | 23.48 → 8.66 |
| ImageNet 512²,DiT-XL/2+UniPC | 5 | 20.28 → 11.40 |
| FFHQ 64²,EDM+UniPC | 5 | 20.02 → 13.66 |
| AFHQv2 64²,EDM+UniPC | 5 | 12.95 → 12.11 |
| COCO,PixArt-α | 5 | 16.22 → 9.90 |
收益在不同数据集并不等幅,且通常随 NFE 增加而缩小。
效率口径
- NFE:同 NFE 比质量;可等价理解为达到某质量时可能少用 NFE。
- FLOPs/latency:没有绝对报告;同 NFE 下 denoiser FLOPs 基本不变。
- 训练预算:0。
- 离线优化:5–15 NFE 对应约 1.9–14.1 秒 CPU,可复用。
- 质量:FID;无 prompt 人评、CLIP、视频或编辑指标。
关键消融
- UniPC 与 DPM-Solver++ 都受益,但 UniPC 通常仍更强。
- pixel-space 常由 uniform-$\lambda$ 初始化更好,latent-space 常由 uniform-$t$ 初始化更好,说明 schedule 不是一次求解后跨设置通用。
- 不同优化初始化在部分 NFE 上非单调,代理目标与 FID 并非严格等价。
局限或疑问
- 每个 solver、NFE、噪声范围和参数化通常需重新优化。
- 无实际生成 latency、throughput、FLOPs 或能耗。
- FID 不覆盖 prompt alignment、编辑保持性或人类偏好。
- DiT-XL/2 与 PixArt-α 只是适用 backbone;没有受控 backbone 对照,不能据此支持 DiT 更优或默认化。
对当前 Wiki 判断的影响
- 直接支持 Diffusion Efficiency Engineering 中“sampling schedule 是独立效率层”。
- 直接支持 Diffusion Models 中“少步性能高度依赖离散化”。
- 对 DiT 架构主张属于不应引用:研究变量不是 backbone。
- 与 Distilling ODE Solvers 的区别是“优化步点”对“蒸馏 solver 更新”。