LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Attend-and-Excite用 attention guidance 修复主体遗漏

一句话结论

Attend-and-Excite 在 Stable Diffusion 推理时提升最被忽略主体 token 的最大 cross-attention,显著减少二主体 prompt 的 catastrophic neglect;276 prompts×64 seeds 与 65 人用户研究提供直接证据,但复杂关系、显式位置、DiT 和模型“理解”均未被证明。

论文定位

论文提出 Generative Semantic Nursing:冻结 Stable Diffusion v1.4,只在前半段去噪中按 attention-derived loss 更新 latent。它不训练新模型,也不是编辑/闭环 controller。

问题定义

cross-attention 在每个空间 patch 上对 token 归一化,却不保证每个主体 token 至少被某个 patch 充分关注。主体没被任何 patch 激活,就可能完全缺失;属性绑定错误与此相关,但不是方法显式优化目标。

方法概述

  1. 聚合 16×16 cross-attention,去掉 <sot> 并重新 Softmax。
  2. 用 3×3 Gaussian 平滑避免单 patch 对抗性尖峰。
  3. 对每主体 $L_s=1-\max(A_t^s)$,总损失取最弱主体 $L=\max_s L_s$。
  4. 执行 $z_t'=z_t-\alpha_t\nabla_{z_t}L$;50 步采样只改前 25 步。
  5. step 0/10/20 的目标阈值为 0.05/0.5/0.8,最多 20 次 refinement。

核心实验与结果

三类二主体模板共 276 prompts,每 prompt 64 seeds:

方法Animal–AnimalAnimal–ObjectObject–Object
Stable Diffusion(BLIP text-text)0.7670.7930.765
Composable Diffusion0.6920.7690.759
StructureDiffusion0.7610.7810.762
Attend-and-Excite0.8060.8300.811

A&E 至少领先各子集最强基线 4.7%;minimum-object CLIP 相对基线至少提高 7%。65 人用户研究偏好率为 90.70% / 77.64% / 77.16%

关键消融与成本

  • 去掉 Gaussian smoothing 会产生局部轮廓或漏主体,主要为定性证据。
  • 持续修改全部 50 步没有明显语义收益,反而增加伪影;前 25 步 early stop 更稳。
  • A100 上 SD 约 5.6 秒/图;A&E 约 9.7 秒,无 refinement;触发 refinement 约 15.4 秒。training-free 不是低时延。
  • 复杂 prompt 补充评估只有 40 prompts×64 seeds:相对 SD/StructureDiffusion full-prompt CLIP +3.8%/+4.4%。

局限或疑问

  1. OOD 主体组合会把 latent 推出分布,结果失真。
  2. 不自然共现组合往往不写实。
  3. riding on、in front of、beneath 等复杂关系仍未解决。
  4. 最大单 patch attention 不保证主体完整、数量正确或属性绑定正确。
  5. 多 token 实体需找 dominant token;否定只被作者列为未来可能方向。
  6. maximum-object similarity 与 SD 约持平但略低,修补最弱主体可能损害最强主体/整体质量。

对当前 Wiki 判断的影响

判断证据分类边界
attention guidance 有效强直接支持SD v1.4、显著额外时延
semantic completeness强直接支持二主体与颜色;复杂关系有限
spatial guidance当前不应引用只要求“某处”高激活,无目标框
closed-loop correction当前不应引用是单次采样内部 refinement
支持 DiT当前不应引用没有 DiT 实验
支持“理解”反对过度外推改善执行,不证明关系/计数推理

原始链接

相关页面