LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

AIDI以加速定点迭代改进真实图像扩散反演

一句话结论

AIDI 将每个 DDIM inversion step 改写为隐式 backward-Euler 定点问题,以 Anderson 或固定两步混合加速求解,再用 attention-derived soft mask 混合高/低 CFG 做 PTP 编辑;它在 SD v1.4 的 10/20-step regime 显著改善重建和 AFHQ dog→cat trade-off,但不是 exact inversion、不是 personalization,也没有区域或身份保持保证。

问题定义

真实图像要进入 deterministic diffusion editing,必须得到能沿同一 sampler path 重建的 $z_T$。普通 DDIM inversion 的显式 Euler 近似在低步数和高 CFG 时积累误差;NTI 需要每 timestep 反向优化 null embedding,EDICT 双轨每步调用两次 denoiser。本文试图以数值求解器改造取得更好的精度—成本折中。

方法概述

  • 真实主干:Stable Diffusion v1.4 latent diffusion,cross-attention 卷积 U-Net;VAE/CLIP/U-Net 全冻结,无 DiT。
  • AIDI-A:令 $z_t=f(z_t)$,对残差 $g(z)=f(z)-z$ 做 Anderson acceleration。
  • AIDI-E:固定最近两次估计权重为 $(0.5,0.5)$,免去系数优化;主编辑实验使用该版本。
  • 计算口径:10/20/50 个 diffusion steps 分别在每个 inversion step 内做 11/6/5 次 fixed-point updates,所以“10 步”不等于 10 次 U-Net 调用。
  • Blended guidance:source path 以低 CFG 重建;从 anchor token cross-attention 得到软 mask,编辑区域 CFG 最高约 7、其他区域接近 1。
  • 随机补救:可在软 mask 内以小噪声重复采样并按 FID/LPIPS 选 best-of-$n$。

成本、数据与指标

  • COCO 5,000 图重建;AFHQ dog→cat 编辑;单 A100。
  • 无训练或 per-image parameter optimization,但 inversion 有多次 denoiser forward;AIDI-A 另有小型最小二乘。
  • 论文图报告相对 latency,未给可复核秒数:编辑与 PTP/NTI 同量级,inversion 比普通 PTP 慢。
  • 重建用 SSIM/LPIPS;20-step LPIPS 从 baseline 0.148 降至 0.063
  • AFHQ 用输入 LPIPS 与相对 cat training set 的 FID;论文称 20-step AIDI 优于 50-step EDICT,10-step 仍稳,但完整逐方法数值仅在图中,正文无方差/CI。
  • 无人评,也没有 mask 外误差、身份指标或编辑成功率。

消融与关键发现

  • AIDI-A reconstruction 最强;AIDI-E 少量细节略差但成本较低,作为默认。
  • CFG 增大仍会降低 inversion accuracy,说明 fixed-point solver 没有消除 guidance mismatch。
  • PTP 改成无 guidance inversion 后已明显改善,AIDI 的收益应在这一强 baseline 上判断。
  • 低步数下 PTP/NTI/EDICT 更容易出现结构伪影,AIDI 对 10/20 steps 更鲁棒。
  • 随机编辑单次会加大 LPIPS;best-of-$n$ 选择才改善 FID/LPIPS,成本随 $n$ 增长。

编辑保持边界

  • 支持对象/背景替换、姿态/表情变化、风格迁移;一次 inversion 后可尝试多个 target prompts。
  • 不要求用户 mask,但必须给 source/target prompt,并选择正/负 anchor token。
  • soft attention mask 不是硬区域约束:绿色可渗入城堡,局部会出现口部线条伪影。
  • near-exact 只限低 CFG 下 sampler reconstruction,并受 VAE 下限影响;编辑后没有像素、身份或背景严格保持。
  • 定量编辑主要是 AFHQ dog→cat,不能外推到开放域复杂编辑。

相关页面

归属边界

本文只支持 Stable Diffusion U-Net 上的 fixed-point inversion + attention-guided CFG editing。它没有研究统一生成—编辑架构、data-vs-architecture、subject personalization 或 DiT,因此已移除旧的 unified-model entity/question 误关联。

证据评估

B+:5,000 图重建、数值机制和低步数实验较扎实;编辑数值/延迟主要在图中,缺方差、人评和严格保持评价,且只验证 SD v1.4 与窄 AFHQ 任务。