LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Accelerating Diffusion Sampling with Optimized Time Steps用优化时间步改善少步扩散采样

一句话结论

固定预训练模型、固定 ODE solver 和固定 NFE下,优化离散时间点可显著改善 5–15 NFE 的 FID;其离线优化只需 CPU 约 1.9–14.1 秒,但论文没有测生成 latency/FLOPs,因此应称为 NFE—质量前沿改善,而不是已实测的端端加速。

论文定位

这是 training-free sampling schedule optimization:不训练或蒸馏 denoiser,不改变每次网络求值成本。方法位于 solver 之上的时间离散化层,与“训练一步模型”和“蒸馏 solver 更新”不同。

问题定义

uniform-$t$、uniform-logSNR 或 EDM schedule 在极少步时未必适合具体高阶 solver。论文从 solver 的局部多项式误差展开构造代理目标,并在时间单调约束下优化内部时间点。

方法概述

  • 将 diffusion probability-flow ODE 写到 half-log-SNR 域。
  • 用 solver 权重和 score-error 包络近似全局误差。
  • 通过 constrained trust-region 优化时间点;结果可预计算复用。
  • 像素模型使用 $p=1$,latent 模型使用 $p=2$。
  • 主测试 solver 为 UniPC 与 DPM-Solver++。

核心实验与结果

设置NFE最相关基线 → 优化后 FID
CIFAR-10,UniPC523.22 → 12.11(补充最佳 11.91)
ImageNet 64²,ADM+UniPC512.36 → 10.47
ImageNet 256²,DiT-XL/2+UniPC523.48 → 8.66
ImageNet 512²,DiT-XL/2+UniPC520.28 → 11.40
FFHQ 64²,EDM+UniPC520.02 → 13.66
AFHQv2 64²,EDM+UniPC512.95 → 12.11
COCO,PixArt-α516.22 → 9.90

收益在不同数据集并不等幅,且通常随 NFE 增加而缩小。

效率口径

  • NFE:同 NFE 比质量;可等价理解为达到某质量时可能少用 NFE。
  • FLOPs/latency:没有绝对报告;同 NFE 下 denoiser FLOPs 基本不变。
  • 训练预算:0。
  • 离线优化:5–15 NFE 对应约 1.9–14.1 秒 CPU,可复用。
  • 质量:FID;无 prompt 人评、CLIP、视频或编辑指标。

关键消融

  • UniPC 与 DPM-Solver++ 都受益,但 UniPC 通常仍更强。
  • pixel-space 常由 uniform-$\lambda$ 初始化更好,latent-space 常由 uniform-$t$ 初始化更好,说明 schedule 不是一次求解后跨设置通用。
  • 不同优化初始化在部分 NFE 上非单调,代理目标与 FID 并非严格等价。

局限或疑问

  • 每个 solver、NFE、噪声范围和参数化通常需重新优化。
  • 无实际生成 latency、throughput、FLOPs 或能耗。
  • FID 不覆盖 prompt alignment、编辑保持性或人类偏好。
  • DiT-XL/2 与 PixArt-α 只是适用 backbone;没有受控 backbone 对照,不能据此支持 DiT 更优或默认化

对当前 Wiki 判断的影响

原始链接

相关页面