一句话结论
Attend-and-Excite 在 Stable Diffusion 推理时提升最被忽略主体 token 的最大 cross-attention,显著减少二主体 prompt 的 catastrophic neglect;276 prompts×64 seeds 与 65 人用户研究提供直接证据,但复杂关系、显式位置、DiT 和模型“理解”均未被证明。
论文定位
论文提出 Generative Semantic Nursing:冻结 Stable Diffusion v1.4,只在前半段去噪中按 attention-derived loss 更新 latent。它不训练新模型,也不是编辑/闭环 controller。
问题定义
cross-attention 在每个空间 patch 上对 token 归一化,却不保证每个主体 token 至少被某个 patch 充分关注。主体没被任何 patch 激活,就可能完全缺失;属性绑定错误与此相关,但不是方法显式优化目标。
方法概述
- 聚合 16×16 cross-attention,去掉
<sot>并重新 Softmax。 - 用 3×3 Gaussian 平滑避免单 patch 对抗性尖峰。
- 对每主体 $L_s=1-\max(A_t^s)$,总损失取最弱主体 $L=\max_s L_s$。
- 执行 $z_t'=z_t-\alpha_t\nabla_{z_t}L$;50 步采样只改前 25 步。
- step 0/10/20 的目标阈值为 0.05/0.5/0.8,最多 20 次 refinement。
核心实验与结果
三类二主体模板共 276 prompts,每 prompt 64 seeds:
| 方法 | Animal–Animal | Animal–Object | Object–Object |
|---|---|---|---|
| Stable Diffusion(BLIP text-text) | 0.767 | 0.793 | 0.765 |
| Composable Diffusion | 0.692 | 0.769 | 0.759 |
| StructureDiffusion | 0.761 | 0.781 | 0.762 |
| Attend-and-Excite | 0.806 | 0.830 | 0.811 |
A&E 至少领先各子集最强基线 4.7%;minimum-object CLIP 相对基线至少提高 7%。65 人用户研究偏好率为 90.70% / 77.64% / 77.16%。
关键消融与成本
- 去掉 Gaussian smoothing 会产生局部轮廓或漏主体,主要为定性证据。
- 持续修改全部 50 步没有明显语义收益,反而增加伪影;前 25 步 early stop 更稳。
- A100 上 SD 约 5.6 秒/图;A&E 约 9.7 秒,无 refinement;触发 refinement 约 15.4 秒。training-free 不是低时延。
- 复杂 prompt 补充评估只有 40 prompts×64 seeds:相对 SD/StructureDiffusion full-prompt CLIP +3.8%/+4.4%。
局限或疑问
- OOD 主体组合会把 latent 推出分布,结果失真。
- 不自然共现组合往往不写实。
- riding on、in front of、beneath 等复杂关系仍未解决。
- 最大单 patch attention 不保证主体完整、数量正确或属性绑定正确。
- 多 token 实体需找 dominant token;否定只被作者列为未来可能方向。
- maximum-object similarity 与 SD 约持平但略低,修补最弱主体可能损害最强主体/整体质量。
对当前 Wiki 判断的影响
| 判断 | 证据分类 | 边界 |
|---|---|---|
| attention guidance 有效 | 强直接支持 | SD v1.4、显著额外时延 |
| semantic completeness | 强直接支持 | 二主体与颜色;复杂关系有限 |
| spatial guidance | 当前不应引用 | 只要求“某处”高激活,无目标框 |
| closed-loop correction | 当前不应引用 | 是单次采样内部 refinement |
| 支持 DiT | 当前不应引用 | 没有 DiT 实验 |
| 支持“理解” | 反对过度外推 | 改善执行,不证明关系/计数推理 |