LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

EDICT用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑

一句话结论

EDICT 把冻结的 Stable Diffusion 1.4 DDIM sampler 改写成两条 latent 交替更新的可逆耦合过程,以约 2× DDIM 计算换取达到 VAE reconstruction floor 的 inversion;“exact”只保证其 latent 变换互逆,不代表像素零误差或编辑后身份严格保持。

问题定义

普通 DDIM inversion 用 $\epsilon(x_{t-1},t)$ 近似未知的 $\epsilon(x_t,t)$,依赖局部线性化;classifier-free guidance 的 pseudo-gradient 在高噪声步跨 timestep 不一致,误差累积后破坏真实图像重建与强编辑。

方法概述

  • 真实主干:Stable Diffusion 1.4 latent diffusion 的 cross-attention U-Net;VAE 负责像素—latent 编解码。EDICT 是 sampler,不是 backbone。
  • 双轨耦合:维护 $x_t,y_t$,每条轨迹的噪声预测只读取另一条已知状态:

$$

x_{t-1}=a_tx_t+b_t\epsilon(y_t,t),\qquad

y_{t-1}=a_ty_t+b_t\epsilon(x_{t-1},t).

$$

给定输出可按逆序精确恢复输入。每步再加入可逆 mixing,默认 50 步 $p=0.93$,有效区间约 $0.9$–$0.97$。

  • 数值稳定:无 mixing 时双轨漂移;$p$ 太小会在逆向 dilation 中放大浮点误差,太大又难以约束生成轨迹。实现使用 double precision affine 运算并交替更新次序。
  • 编辑:VAE 编码输入,以 base prompt noising 到 $sS$ 步,再以 target prompt denoise;常用 $s=0.8$、$S=50$、CFG 3。
  • 零优化:无需模型训练、prompt tuning、额外数据或 per-image optimization。

核心结果

COCO 2017 validation 5,000 张,首个 caption、全强度 guidance:

设置LDM AE 下限EDICT UCEDICT CDDIM UCDDIM C
50 步0.0152600.0152600.0152600.0300830.418175
200 步0.0152600.0152600.0152600.0234060.496944
1000 步0.0152600.0152600.0152600.0189600.509345

EDICT 达到的是 VAE reconstruction floor,并非像素 MSE 为零。五个 ImageNet mammal 类、四组编辑设置中,总体约 CLIP 0.56 / LPIPS 0.27,在维持语义对齐时改善输入保真;但论文没有完整逐方法数值表或人评。

消融与成本

  • 无 mixing 的双轨会发散;$p$ 消融显示理论可逆不等于数值稳定。
  • baseline 增至 100/250 步未明显改善编辑,EDICT 高步数下个别例子仍会丢细节。
  • 新增训练为 0;每步两次 denoiser 调用,计算时间约 baseline DDIM 的 。一次编辑还包含 noising 与 denoising 两段;论文未报告 wall-clock、显存或吞吐。
  • 作者未与 Imagic/DreamBooth/Textual Inversion 直接竞争,因为这些适配方法可与 EDICT 组合;不能据此宣称全面优于它们。

编辑保持边界

  • 展示对象添加、全局场景替换、形变/视角、风格和犬种编辑,并较好保留文字、背景、云纹与反射。
  • deterministic:每对输入/提示只给一个结果;缺少多样性。
  • 无显式 mask 或 identity loss;精确重建不保证编辑后未请求区域逐像素不变。
  • 对输入、prompt、$p$、步数和 CFG 敏感;强编辑仍受 SD 1.4/VAE 能力限制。
  • 主实验仅覆盖 SD 1.4 U-Net,不能直接外推到 DiT、flow、SDXL、视频或高分辨率。

相关页面

证据评估

A-:代数构造、COCO 重建和稳定性消融扎实;编辑量化较窄、缺少人评和实测延迟,且 exact 的适用层级必须限定在 EDICT latent path。