LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Distilling ODE Solvers of Diffusion Models into Smaller Steps冻结去噪器的轻量求解器蒸馏

一句话结论

D-ODE 冻结 denoiser,只用一批 teacher/student 轨迹为每个时间步拟合一个 solver 标量,在低 NFE 下改善多种 ODE solver 的 FID;离线成本为几 CPU 分钟,但它仍是按数据集/solver 设置进行的轻量蒸馏,不是严格 training-free,且“10×”是 NFE 比而非实测 latency。

论文定位

这是介于 training-free solver 与全模型 distillation 之间的路线:在线保留原 denoiser 与 NFE,只修改 denoising-output 的组合;离线不更新网络参数,但需要 teacher sampling 和参数拟合。

问题定义

普通 ODE solver 在极低 NFE 时可能偏离真实采样轨迹;progressive/consistency distillation 又需要训练整个 student 网络。论文尝试只蒸馏数值求解器本身。

方法概述

  • 用当前和上一时刻 denoising outputs 构造
  • $O_t=d_t+\lambda_t(d_t-d_{t+1})$。

  • teacher 默认运行 student 约 10× steps。
  • 在一批样本上逐时间点最小化 teacher 目标与 student 下一状态的 MSE,求 $\lambda_t$。
  • 默认 batch 100;LSUN Bedroom 为 25。
  • 参数拟合后跨生成批次复用,denoiser 始终冻结。
  • 适配 DDIM、iPNDM、DPM-Solver3、DEIS3、EDM 与补充中的 DPM-Solver++。

核心实验与结果

  • data-prediction 设置:D-DDIM 25 NFE 可达到与 DDIM 250 NFE 相近的 FID;算法路径约缩短 10×。
  • CIFAR-10 noise-prediction:
  • - 10 NFE:DDIM 18.85 → D-DDIM 8.67 FID;

    - 25 NFE:9.79 → 8.18;

    - 50 NFE:7.17 → 6.55。

  • 约 2 NFE 时 DDIM 偶尔优于 D-DDIM;高 NFE 时差距收敛。
  • 达约 FID 3 的归一化总成本:D-EDM 2.55,consistency distillation 187.25,progressive distillation 106.16;单位是“生成 50K 个 10-step DDIM 样本的时间”,不是秒,且依赖各方法训练配置。

效率口径

  • 在线 NFE:与对应 student solver 相同;标量组合开销可忽略。
  • latency/throughput:未直接报告。
  • 离线成本:一批 teacher/student 轨迹和每步拟合,作者称数 CPU 分钟。
  • 训练预算:0 个 denoiser 更新,但有 solver distillation;不能写成零离线成本。
  • 摊销条件:大量重复生成时离线成本可摊薄;少量单次请求不一定可忽略。
  • 质量:50K FID;无 prompt、人评、编辑或视频指标。

关键消融

  • 单参数约束是关键:CIFAR-10 10 NFE 的 D-DDIM 为 8.67,但 D-DDIM-Sep 79.21、D-DDIM-All 179.67、D-DDIM-2 18.75,更多自由参数反而不稳定。
  • teacher scale 5→30 时 10-NFE FID 9.68→8.41;50 NFE 基本饱和。
  • batch 5→100 时 10-NFE FID 9.33±0.66→8.22±0.10,说明参数具有数据集/批次依赖。
  • 充分 grid search 的 Fixed-D-DDIM 可在 25/50 NFE 超过蒸馏参数,D-ODE 的优势是低搜索成本而非绝对最优。

局限或疑问

  • 每个数据集、模型、solver/NFE 通常需要重新拟合。
  • 约 2 NFE 时容量不足;大 NFE 时收益收窄。
  • 作者明确指出高分辨率时单标量可能不足。
  • 主实验是传统 DDPM/ADM/EDM U-Net 图像模型,没有 DiT、latent 文生图、视频或编辑;不应关联到 DiT claim

对当前 Wiki 判断的影响

  • 直接支持 Diffusion Efficiency Engineering 中“solver distillation 是独立效率层”。
  • 对“轻量蒸馏等于 training-free”构成压力测试:denoiser 虽冻结,但 teacher 轨迹与按设置拟合是真实离线成本。
  • 对 DiT/backbone claim 为当前不应引用
  • Optimized Time Steps 的区别是修改 solver output,而非选择时间点。

原始链接

相关页面