一句话结论
SimM 只接收文本,在 Stable Diffusion 早期去噪中检查对象 cross-attention 是否落入启发式目标区,并通过 activation 搬移、图内增强/抑制和图间去冲突校准布局;它把 SimMBench accuracy 从 vanilla SD 的 4.25% 提至 65.16%,但只验证卷积 U-Net SD,成本与判定协议仍缺完整量化。
问题定义
预训练 T2I 模型常忽略 left/right/top/bottom 等空间要求;已有布局方法又往往要求用户给精确 box 或额外训练。本文希望仅凭 prompt、在推理期自动判断并纠正错位。
方法概述
- 真实 backbone:Stable Diffusion 的 VAE、CLIP text encoder 与卷积 U-Net;DDIM 20 steps、CFG 5,无 DiT。
- Check:解析对象与空间词,产生近似目标框;多层 attention 平均后检查目标区 activation。
- Locate:默认第一步去噪就用滑窗寻找对象 attention 的 source box。
- Rectify:把 source activation 复制至 target,原区填最小值;目标内乘 $\alpha$、外部除 $\alpha$,并用其他 token mask 减少对象冲突。
- 全程冻结模型,无训练或 loss-based latent optimization。
数据、指标与结果
- DrawBench 20 prompts;SimMBench 203 prompts,每条 1–4 对象。
- 每 prompt 4 张;generation accuracy 要求全部对象、属性和位置正确,另报 CLIP。
| 方法 | DrawBench Acc ↑ | SimMBench Acc ↑ |
|---|---|---|
| SD | 12.50 | 4.25 |
| Attention-Refocusing | 43.50 | 50.71 |
| SimM | 53.00 | 65.16 |
SimMBench 上 SimM CLIP 0.3001,并未优于所有 baseline;收益集中在空间正确性。
消融、成本与证据边界
- 去 intra-map 会漏对象/错位;去 inter-map 会碎裂或冲突。
- 越早定位越好;$\alpha=10$ 最平衡,50 会伤质量。
- 作者称开销可忽略,但未给 GPU、绝对延迟、显存或吞吐。
- 无正式人评、方差和显著性;accuracy 判定流程透明度有限。
- 依赖 base SD 已形成对象 activation;开放关系、遮挡、尺度与复杂重叠没有保证。
相关页面
- 图像生成
- 扩散模型
- BoxDiff:同属训练免费空间控制。
- LayoutDiffusion:训练式布局建模对照。
归属边界
这是 training-free layout calibration,不是图像编辑、主体定制、DiT 或统一生成—编辑模型。已移除旧 unified-image-generation-editing entity 与 unified-model question 误关联。
证据评估
B+:方法、主表与组件消融清楚;自建 benchmark 较小、判定/成本未充分披露,且只在 SD U-Net 上验证。