一句话结论
DiffusionCLIP 用 DDIM inversion 保留真实图像细节,再按目标文本以 directional CLIP loss 微调整个 DDPM U-Net;它建立了早期 diffusion 编辑优势,但不是 training-free,也不是 Stable Diffusion/DiT 方法。
问题定义
GAN inversion 对 novel pose、手部、背景和高方差数据重建不稳,导致编辑时身份/结构漂移。论文尝试把 diffusion 的近似可逆性与 CLIP 的开放文本方向结合,让一个目标属性模型复用于同一预训练域内多张图像。
方法概述
- 原 U-Net 做 deterministic forward DDIM inversion 到 return step $t_0$。
- 复制 U-Net,最小化 directional CLIP loss + L1/face identity loss。
- 每个目标编辑方向得到一份微调模型;推理时原模型 inversion、微调模型 reverse DDIM。
- 多属性可混合多个微调模型的噪声预测,在一次 sampling 中完成组合编辑。
Backbone、数据与优化
| 维度 | 全文核验 |
|---|---|
| 256² backbone | Wide-ResNet 风格 DDPM/improved-DDPM U-Net |
| 512² backbone | ImageNet improved-DDPM U-Net;8/16/32 分辨率加 self-attention |
| 外部模型 | CLIP 用于 loss;face/segmentation 网络用于 identity 与评测 |
| 预训练域 | CelebA-HQ、AFHQ-Dog、LSUN-Bedroom、LSUN-Church、ImageNet |
| 训练设置 | 50 张 latent;Adam,$4\times10^{-6}$;1–10 epochs/目标属性 |
| diffusion 配置 | $T=1000$;$t_0=300$–600;训练 $(S_{for},S_{gen})=(40,6)$;测试 $(200,40)$ |
核心结果
CelebA-HQ 1,500 张重建:$t_0=300$ 时 MAE 0.020、LPIPS 0.073、SSIM 0.914,优于 HFGI+e4e 的 0.062/0.127/0.877;$t_0$ 增至 600 后为 0.024/0.087/0.893,显示大编辑空间与重建的权衡。
1,000 张/域编辑评测:
| 方法 | CelebA $S_{dir}$↑ | SC↑ | ID↑ | Church $S_{dir}$↑ | SC↑ |
|---|---|---|---|---|---|
| StyleCLIP | 0.13 | 86.8% | 0.35 | 0.13 | 67.9% |
| StyleGAN-NADA | 0.16 | 89.4% | 0.42 | 0.15 | 73.2% |
| DiffusionCLIP | 0.17 | 93.7% | 0.70 | 0.20 | 78.1% |
50 人 6,000 票中,out-of-domain 相对 StyleCLIP 偏好为一般样本 88.90%、hard cases 94.60%。这些比较主要针对同期 GAN 编辑器,不能替代对后续 diffusion editing 的比较。
真实成本
- 50 张 latent 预计算:82.2 s,一次性,约 6 GB。
- 标准微调:41.3 s/epoch;1–10 epochs 即 41.3 s–7 min/目标属性;需 23 GB VRAM。
- GPU-efficient 微调:12 GB,但约 2× 时间。
- 单图编辑:快配 $(40,6)$ 为 1.958 s;高保真 $(200,40)$ 为 10.132 s(Quadro RTX 6000,256²)。
- 512² 相对 256²:约 4× 时间、2× 显存。
- 每个目标方向需要独立 checkpoint;多属性单次 sampling 仍需先训练/存储多个模型。
消融与边界
- 增加 inversion/generation steps 提高重建;$S_{for}<S_{gen}$ 易出 artifacts。
- identity loss 保身份但妨碍大形状/风格变化;$t_0$ 必须按目标调节。
- 预计算图像数从 5 增到 100 时属性变化更充分。
- CLIP 不理解或表示不足的目标(人脸→电脑/椅子、近期概念)会失败。
- 迁移仅验证 DDPM U-Net 及给定预训练域;不是 LDM/DiT 证据。
相关页面
- 图像编辑
- 扩散模型
- Blended Diffusion — 同期 diffusion 文本编辑的区域引导支线。
- Plug-and-Play Diffusion Features — 后续以 feature injection 换掉每目标微调,但增加 inversion/双分支采样成本。
备注
实体边界:CLIP 是监督器,self-attention 是 U-Net 内部模块;生成主干仍是卷积 U-Net。