一句话结论
EDICT 把冻结的 Stable Diffusion 1.4 DDIM sampler 改写成两条 latent 交替更新的可逆耦合过程,以约 2× DDIM 计算换取达到 VAE reconstruction floor 的 inversion;“exact”只保证其 latent 变换互逆,不代表像素零误差或编辑后身份严格保持。
问题定义
普通 DDIM inversion 用 $\epsilon(x_{t-1},t)$ 近似未知的 $\epsilon(x_t,t)$,依赖局部线性化;classifier-free guidance 的 pseudo-gradient 在高噪声步跨 timestep 不一致,误差累积后破坏真实图像重建与强编辑。
方法概述
- 真实主干:Stable Diffusion 1.4 latent diffusion 的 cross-attention U-Net;VAE 负责像素—latent 编解码。EDICT 是 sampler,不是 backbone。
- 双轨耦合:维护 $x_t,y_t$,每条轨迹的噪声预测只读取另一条已知状态:
$$
x_{t-1}=a_tx_t+b_t\epsilon(y_t,t),\qquad
y_{t-1}=a_ty_t+b_t\epsilon(x_{t-1},t).
$$
给定输出可按逆序精确恢复输入。每步再加入可逆 mixing,默认 50 步 $p=0.93$,有效区间约 $0.9$–$0.97$。
- 数值稳定:无 mixing 时双轨漂移;$p$ 太小会在逆向 dilation 中放大浮点误差,太大又难以约束生成轨迹。实现使用 double precision affine 运算并交替更新次序。
- 编辑:VAE 编码输入,以 base prompt noising 到 $sS$ 步,再以 target prompt denoise;常用 $s=0.8$、$S=50$、CFG 3。
- 零优化:无需模型训练、prompt tuning、额外数据或 per-image optimization。
核心结果
COCO 2017 validation 5,000 张,首个 caption、全强度 guidance:
| 设置 | LDM AE 下限 | EDICT UC | EDICT C | DDIM UC | DDIM C |
|---|---|---|---|---|---|
| 50 步 | 0.015260 | 0.015260 | 0.015260 | 0.030083 | 0.418175 |
| 200 步 | 0.015260 | 0.015260 | 0.015260 | 0.023406 | 0.496944 |
| 1000 步 | 0.015260 | 0.015260 | 0.015260 | 0.018960 | 0.509345 |
EDICT 达到的是 VAE reconstruction floor,并非像素 MSE 为零。五个 ImageNet mammal 类、四组编辑设置中,总体约 CLIP 0.56 / LPIPS 0.27,在维持语义对齐时改善输入保真;但论文没有完整逐方法数值表或人评。
消融与成本
- 无 mixing 的双轨会发散;$p$ 消融显示理论可逆不等于数值稳定。
- baseline 增至 100/250 步未明显改善编辑,EDICT 高步数下个别例子仍会丢细节。
- 新增训练为 0;每步两次 denoiser 调用,计算时间约 baseline DDIM 的 2×。一次编辑还包含 noising 与 denoising 两段;论文未报告 wall-clock、显存或吞吐。
- 作者未与 Imagic/DreamBooth/Textual Inversion 直接竞争,因为这些适配方法可与 EDICT 组合;不能据此宣称全面优于它们。
编辑保持边界
- 展示对象添加、全局场景替换、形变/视角、风格和犬种编辑,并较好保留文字、背景、云纹与反射。
- deterministic:每对输入/提示只给一个结果;缺少多样性。
- 无显式 mask 或 identity loss;精确重建不保证编辑后未请求区域逐像素不变。
- 对输入、prompt、$p$、步数和 CFG 敏感;强编辑仍受 SD 1.4/VAE 能力限制。
- 主实验仅覆盖 SD 1.4 U-Net,不能直接外推到 DiT、flow、SDXL、视频或高分辨率。
相关页面
- 图像编辑
- 扩散模型
- Null-text Inversion:通过条件优化补偿 DDIM inversion,成本结构不同。
- Imagic:分钟级每图优化/微调,非 exact inversion。
- Diffusion Autoencoders:训练专用 semantic encoder 与 conditional DDIM,而非冻结 sampler 重写。
证据评估
A-:代数构造、COCO 重建和稳定性消融扎实;编辑量化较窄、缺少人评和实测延迟,且 exact 的适用层级必须限定在 EDICT latent path。