LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Check, Locate, Rectify训练免费文本到图像布局校准

一句话结论

SimM 只接收文本,在 Stable Diffusion 早期去噪中检查对象 cross-attention 是否落入启发式目标区,并通过 activation 搬移、图内增强/抑制和图间去冲突校准布局;它把 SimMBench accuracy 从 vanilla SD 的 4.25% 提至 65.16%,但只验证卷积 U-Net SD,成本与判定协议仍缺完整量化。

问题定义

预训练 T2I 模型常忽略 left/right/top/bottom 等空间要求;已有布局方法又往往要求用户给精确 box 或额外训练。本文希望仅凭 prompt、在推理期自动判断并纠正错位。

方法概述

  • 真实 backbone:Stable Diffusion 的 VAE、CLIP text encoder 与卷积 U-Net;DDIM 20 steps、CFG 5,无 DiT。
  • Check:解析对象与空间词,产生近似目标框;多层 attention 平均后检查目标区 activation。
  • Locate:默认第一步去噪就用滑窗寻找对象 attention 的 source box。
  • Rectify:把 source activation 复制至 target,原区填最小值;目标内乘 $\alpha$、外部除 $\alpha$,并用其他 token mask 减少对象冲突。
  • 全程冻结模型,无训练或 loss-based latent optimization。

数据、指标与结果

  • DrawBench 20 prompts;SimMBench 203 prompts,每条 1–4 对象。
  • 每 prompt 4 张;generation accuracy 要求全部对象、属性和位置正确,另报 CLIP。
方法DrawBench Acc ↑SimMBench Acc ↑
SD12.504.25
Attention-Refocusing43.5050.71
SimM53.0065.16

SimMBench 上 SimM CLIP 0.3001,并未优于所有 baseline;收益集中在空间正确性。

消融、成本与证据边界

  • 去 intra-map 会漏对象/错位;去 inter-map 会碎裂或冲突。
  • 越早定位越好;$\alpha=10$ 最平衡,50 会伤质量。
  • 作者称开销可忽略,但未给 GPU、绝对延迟、显存或吞吐。
  • 无正式人评、方差和显著性;accuracy 判定流程透明度有限。
  • 依赖 base SD 已形成对象 activation;开放关系、遮挡、尺度与复杂重叠没有保证。

相关页面

归属边界

这是 training-free layout calibration,不是图像编辑、主体定制、DiT 或统一生成—编辑模型。已移除旧 unified-image-generation-editing entity 与 unified-model question 误关联。

证据评估

B+:方法、主表与组件消融清楚;自建 benchmark 较小、判定/成本未充分披露,且只在 SD U-Net 上验证。