LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Come-Closer-Diffuse-Faster用好初始化缩短条件扩散逆问题路径

一句话结论

CCDF 证明在超分、inpainting、MRI 等有观测的逆问题里,不必从纯高斯噪声走完整反向链:用观测或 feed-forward 网络 warm-start,只加噪到较小 $t_0$ 再反推,可把 1000 steps 缩至 20–200;但“50×”是网络评估次数而非实测 latency,$t_0$ 还需按任务 trial-and-error,因此不能外推为通用文生图 few-step 方法。

论文定位

这是 conditional inverse diffusion 的 path shortening / warm-start。它不改 score backbone、不蒸馏、不量化,也不涉及 DiT。与 DDIM 等 solver 可以叠加,但收益来源是逆问题已有观测带来的好初始化。

问题定义

标准条件扩散仍从 $T=1$ 纯噪声开始,浪费了退化观测或现有 inverse network 已提供的信息。论文问:若初值已靠近真实图像,能否只走短反向路径,并用 data consistency 保持收敛?

方法概述

  1. 从退化观测做 vanilla 初始化,或用 ESRGAN / inpainting network / MRI U-Net 得到更好估计;
  2. 通过 closed-form forward diffusion 加噪到 $t_0<1$,几乎不调用 denoiser;
  3. 交替执行短程 reverse diffusion 与非扩张 data-consistency 映射;
  4. 用随机收缩理论证明终点误差由稳态噪声项和 $\lambda^{2N'}$ 倍初始误差组成:初始化越好,所需 steps 越少。

核心实验与结果

协议

  • SR:FFHQ/AFHQ 256²,×4/×8/×16,FID;
  • inpainting:FFHQ,96/128/160 中心框,FID;
  • MRI:fastMRI knee,随机 10 validation volumes,×2/×4/×6,PSNR;
  • backbone 为 IDDPM/VP-SDE/VE-SDE 的 U-Net 或 ncsnpp;无 GPU、FLOPs、runtime 报告。

超分

20-step CCDF 在 FFHQ ×4/×8 的 FID 为 60.90/75.76,优于 20-step ILVR 的 63.14/81.85;AFHQ ×4/×8 为 15.53/32.30,优于 18.70/34.85。AFHQ ×16 为 48.77,略差于 ILVR 47.28,说明高退化时并非全胜。

Inpainting

200-step CCDF 在 box 96/128/160 的 FID 为 45.99/49.77/57.99;1000-step score-SDE 为 50.85/64.51/78.29。它用五分之一 NFE 得到更低 FID。

MRI

$t_0=0.02$、20-step CCDF 的 ×2/×4/×6 PSNR 为 33.41/32.51/31.30;1000-step score-POCS 为 32.85/31.45/31.15。步数减少 50×,但 ×6 只提升 0.15 dB,且测试集很小。

关键消融

  • random→vanilla→NN initialization 的误差逐步减小,可用 $t_0$ 也逐步缩短。
  • $t_0$ sweep 显示退化越强通常需要更大起点;FFHQ SR ×4/×8/×16 约取 0.1/0.2/0.3。
  • CCDF 可叠加 DDIM,但论文没有系统 wall-clock 对比。
  • 理论依赖 score 足够表达和 data-consistency operator 非扩张等假设。

局限或疑问

  • 作者明确承认不知道初始误差 $\epsilon_0$,没有通用 $t_0$ 选择规则,只能 trial-and-error。
  • 仅适用于有观测/好初始化的 inverse tasks,不适用于从随机噪声的开放式 T2I。
  • “50×”仅为 1000→20 NFE;初始化网络和 data-consistency 也有成本。
  • SR3 为非官方复现;MRI 只测 10 volumes。
  • 高退化使 $t_0$ 增大、收益缩小;AFHQ ×16 已出现不优于 ILVR 的结果。

对当前 Wiki 判断的影响

  • Diffusion 效率工程:应归为 inverse-problem warm-start,而不是泛化的 few-step T2I。
  • 扩散模型:直接支持“条件逆问题不必从纯噪声开始”。
  • 图像生成:是早期路径工程案例,不能与 SANA-Sprint 的 one-step 蒸馏混为一类。
  • 对 DiT 无直接证据。

证据评级

B+:理论、三类任务和 $t_0$ 消融扎实;但无真实 latency/FLOPs/硬件、超参数不可自动选,部分测试协议较小。

原始链接

相关页面