LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

DiffusionCLIPCLIP 引导的 diffusion U-Net 文本图像操控

一句话结论

DiffusionCLIP 用 DDIM inversion 保留真实图像细节,再按目标文本以 directional CLIP loss 微调整个 DDPM U-Net;它建立了早期 diffusion 编辑优势,但不是 training-free,也不是 Stable Diffusion/DiT 方法。

问题定义

GAN inversion 对 novel pose、手部、背景和高方差数据重建不稳,导致编辑时身份/结构漂移。论文尝试把 diffusion 的近似可逆性与 CLIP 的开放文本方向结合,让一个目标属性模型复用于同一预训练域内多张图像。

方法概述

  1. 原 U-Net 做 deterministic forward DDIM inversion 到 return step $t_0$。
  2. 复制 U-Net,最小化 directional CLIP loss + L1/face identity loss。
  3. 每个目标编辑方向得到一份微调模型;推理时原模型 inversion、微调模型 reverse DDIM。
  4. 多属性可混合多个微调模型的噪声预测,在一次 sampling 中完成组合编辑。

Backbone、数据与优化

维度全文核验
256² backboneWide-ResNet 风格 DDPM/improved-DDPM U-Net
512² backboneImageNet improved-DDPM U-Net;8/16/32 分辨率加 self-attention
外部模型CLIP 用于 loss;face/segmentation 网络用于 identity 与评测
预训练域CelebA-HQ、AFHQ-Dog、LSUN-Bedroom、LSUN-Church、ImageNet
训练设置50 张 latent;Adam,$4\times10^{-6}$;1–10 epochs/目标属性
diffusion 配置$T=1000$;$t_0=300$–600;训练 $(S_{for},S_{gen})=(40,6)$;测试 $(200,40)$

核心结果

CelebA-HQ 1,500 张重建:$t_0=300$ 时 MAE 0.020、LPIPS 0.073、SSIM 0.914,优于 HFGI+e4e 的 0.062/0.127/0.877;$t_0$ 增至 600 后为 0.024/0.087/0.893,显示大编辑空间与重建的权衡。

1,000 张/域编辑评测:

方法CelebA $S_{dir}$↑SC↑ID↑Church $S_{dir}$↑SC↑
StyleCLIP0.1386.8%0.350.1367.9%
StyleGAN-NADA0.1689.4%0.420.1573.2%
DiffusionCLIP0.1793.7%0.700.2078.1%

50 人 6,000 票中,out-of-domain 相对 StyleCLIP 偏好为一般样本 88.90%、hard cases 94.60%。这些比较主要针对同期 GAN 编辑器,不能替代对后续 diffusion editing 的比较。

真实成本

  • 50 张 latent 预计算:82.2 s,一次性,约 6 GB。
  • 标准微调:41.3 s/epoch;1–10 epochs 即 41.3 s–7 min/目标属性;需 23 GB VRAM。
  • GPU-efficient 微调:12 GB,但约 2× 时间。
  • 单图编辑:快配 $(40,6)$ 为 1.958 s;高保真 $(200,40)$ 为 10.132 s(Quadro RTX 6000,256²)。
  • 512² 相对 256²:约 4× 时间、2× 显存。
  • 每个目标方向需要独立 checkpoint;多属性单次 sampling 仍需先训练/存储多个模型。

消融与边界

  • 增加 inversion/generation steps 提高重建;$S_{for}<S_{gen}$ 易出 artifacts。
  • identity loss 保身份但妨碍大形状/风格变化;$t_0$ 必须按目标调节。
  • 预计算图像数从 5 增到 100 时属性变化更充分。
  • CLIP 不理解或表示不足的目标(人脸→电脑/椅子、近期概念)会失败。
  • 迁移仅验证 DDPM U-Net 及给定预训练域;不是 LDM/DiT 证据。

相关页面

备注

实体边界:CLIP 是监督器,self-attention 是 U-Net 内部模块;生成主干仍是卷积 U-Net。