一句话结论
CONFORM 把同一对象—属性的 cross-attention map 作为 InfoNCE 正对、跨对象/属性作为负对,并在采样时反传更新 latent;它跨 SD v1.5 与 Imagen 提升对象存在、属性绑定和计数忠实度,但每图约 20 秒/L4、并非 optimization-free,“high fidelity”也不等于主体身份或感知画质保证。
问题定义
T2I 常漏对象、错绑颜色、混淆同类对象或数错数量。此前方法通常为每种失败设计不同 loss;本文希望以统一 contrastive attention objective 同时处理。
方法概述
- SD v1.5:卷积 U-Net + CLIP;Imagen:pixel diffusion U-Net + T5-XL;无 DiT。
- prompt 中正确对象—属性为正对,其他组合为负对;还加入 $t$ 与 $t+1$ attention,抑制跨步 scattering。
- 每步按 $z_t'=z_t-\alpha_t\nabla_{z_t}L$ 更新 latent,不改模型权重。
- 50 steps,$\alpha=20$、$\tau=0.5$;前 25 步内选定位置做 optimization。
数据、指标与结果
自组 animal–animal、animal–object、object–object 与 multi-instance prompts;每 prompt 64 seeds。指标含 CLIP-full/min、BLIP text-text similarity、TIFA。
TIFA(SD)从 0.68/0.80/0.65/0.59 提至 0.95/0.94/0.88/0.74;Imagen 上为 0.84/0.94/0.91/0.76,除 animal-animal 持平外均有改善。
BLIP text-text similarity:CONFORM 在三组为 0.82/0.85/0.82,高于 A&E 的 0.80/0.83/0.81 与 D&B 的 0.81/0.83/0.81。
人评与成本
25 名参与者,随机 10 prompts,SD 与 Imagen 分开比较。CONFORM 在 SD 各组获 72%–94% 票,在 Imagen 获 96%–98%。未给完整盲法、置信区间和响应归一化细节。
SD v1.5、50 steps 在 NVIDIA L4 约 20 秒/图;没有同机 vanilla latency、显存或 Imagen 时间,无法量化纯 overhead。
消融与边界
- 超参/优化位置消融主要在补充材料;主文缺各对比组件的完整数值拆解。
- 初始 attention 几乎没有对象时仍可能补不回;Imagen 有时把对象过度分离。
- 复杂 parser/token pairing、长 prompt 与严格 counting 均无保证。
- 无参考图、identity、区域保持或编辑证据。
相关页面
归属边界
CONFORM 是 training-free 但 optimization-based 的 compositional T2I guidance,不是训练目标、personalization、编辑、DiT 或统一模型;已移除旧 unified entity/question。
证据评估
B+:跨两类 backbone、多指标与人评;自组 prompts、成本对照和主文消融不充分,且指标依赖 CLIP/BLIP/VQA。