LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

CoDi条件扩散蒸馏实现 1–4 步图像条件生成

一句话结论

CoDi 把新图像条件适配与 consistency distillation 合成单阶段训练,使 super-resolution、inpainting、depth-to-image 和 instruction editing 可在 1–4 步运行;它证明“共享 T2I U-Net prior + 每任务 adapter”可以压缩路径长度,但 8 天/64 TPU-v4 的实验背景、364M adapter 与主要定性的编辑证据限制了“低成本统一模型”外推。

论文定位

CoDi 不是 solver plugin,也不是一个 checkpoint 同时统一所有任务。它从内部 T2I LDM 出发,为每个条件任务训练独立 conditional model;PE-CoDi 共享 base U-Net,只更新类似 ControlNet 的 encoder adapter。

它也不是微软同名的 CoDi: Any-to-Any Generation via Composable Diffusion(arXiv:2305.11846)。后者组合文本、图像、音频等 modality-specific diffusion;本文是 Conditional Diffusion Distillation,只研究额外图像条件到图像输出,没有 any-to-any 多模态接口。

问题定义

先 fine-tune 后 distill 容易丢失预训练 prior,先 distill 后 fine-tune 又难沿用标准 diffusion loss。CoDi 试图用一个 loss 同时约束条件 signal prediction 与跨时间 noise consistency。

方法概述

  • 零初始化复制 U-Net encoder,引入图像条件。
  • 用适配后的 PF-ODE 产生相邻 state,而不是冻结的原始 teacher ODE。
  • noise-space consistency 保持 few-step trajectory,signal-space conditional loss 学习新任务。
  • EMA target 稳定训练;latent $L_2$ 优于 pixel $L_2$/LPIPS。
  • PE-CoDi 冻结 backbone,只训练 364M conditional parameters。

核心实验与结果

任务对照CoDi/PE-CoDi
DF2K SR250-step LDM 19.200/0.2639;4-step GD-II 23.675/0.27964-step full CoDi FID/LPIPS 19.637/0.2656
ImageNet inpainting50-step ControlNet 14.895/0.22604-step PE-CoDi 14.700/0.2231
WebLI depth-to-image250-step ControlNet 20.884/0.29104-step PE-CoDi 23.047/0.2874
依据:PDF pp.6–7,Table 2。inpainting 的 Palette 分辨率口径不同,作者明确称其数字只能参考。

Instruction editing 只给 IP2P 200-step 与 CoDi 1/4-step 的视觉对照,没有大规模 benchmark 或人评,因此“1-step comparable”只能记为定性主张。

效率与训练成本

  • TPUv5:CoDi 4-step $107\pm3$ ms;plain LDM 4-step $103\pm2$ ms;LDM 50-step $977\pm1$ ms。
  • full CoDi 1.22B;PE-CoDi 训练/保存 364M adapter,但 base model 仍需驻留。
  • 论文写各比较方法含预训练独立运行 8 days on 64 TPU-v4 pods;没有分离 CoDi 的边际 TPU-hours。

关键消融

Super-resolution 4-step:full CoDi 19.637/0.2656;去 adapted PF-ODE 为 20.307/0.2733;去 noise consistency 为 25.728/0.3252;plain ControlNet architecture 为 28.951/0.3049(PDF p.8,Table 3)。收益主要来自联合 consistency objective,而非只是加参数。

局限或疑问

  • 作者明确承认 adapter 增加计算,未来需更轻架构。
  • 内部 LDM 与 TPU 训练设施降低复现性。
  • 每任务需要独立数据与 adapter,不是统一单模型。
  • editing 缺强定量证据;跨任务协议也不完全统一。
  • 模型是 LDM U-Net/ControlNet,不提供 DiT adoption 证据。

对当前 Wiki 判断的影响

  • 直接支持 扩散效率工程 中“conditional consistency distillation 是训练新 few-step model”的分支。
  • foundation prior 可以共享,但任务数据、364M adapter 与额外计算继续存在;这支持模块化的任务专用蒸馏,不支持 unified image generation/editing。
  • 旧 source 将 CoDi 列为统一生成—编辑实体;全文显示其为 task-specific conditional models,本批已移除该 entity 与 unified-model question 关联。

原始链接

相关页面