一句话结论
S-CFG 从 U-Net attention 自举语义区域,并按区域 score norm 动态调整 CFG scale;它在 SD1.5/2.1 与 DeepFloyd IF 上以约 1.6%–2.9% latency 增量换来多数 FID–CLIP 设置的小幅改善和小规模人评的明显偏好,因此属于 guidance quality governance,不是 sampling acceleration。
论文定位
这是 training-free、inference-time CFG 重加权。方法不训练 denoiser、不减少 CFG 的 conditional/unconditional 双 forward,也不提供外部布局;空间 mask 来自 base U-Net 的 cross/self-attention。
本批身份核验发现旧 source authors 错配,已按 PDF 首页修为 Dazhong Shen、Guanglu Song、Zeyue Xue、Fu-Yun Wang、Yu Liu。
问题定义
全局 CFG scale 会让不同对象/背景区域的 conditional score norm 差异被统一放大。作者希望在最终图像不可见时,从当前 latent 的 attention 中估计语义区域,并让各区域 guidance amplitude 更均衡。
方法概述
- 融合并空间归一化 U-Net cross-attention,将 patch 分配给 prompt token。
- 用 self-attention 传播补全区域;实验取 4 轮。
- 用 START token 区域近似背景,foreground 作为 guidance norm benchmark。
- 对每个 region 计算自适应 $\gamma_{t,i}$,再形成空间 CFG scale map。
- 核心推导近似假设不同 semantic units 条件独立;补充材料承认该假设并不严格。
核心实验与结果
FID–CLIP
- SD1.5 + DPM-Solver++、$\gamma=3$:FID 7.760→7.717,CLIP 0.3091→0.3099。
- SD2.1 + DPM-Solver++、$\gamma=7.5$:11.324→10.944,0.3339→0.3342。
- IF + DPM-Solver++、$\gamma=3$:FID 7.799→7.227,但 CLIP 0.3147→0.3140。
依据:补充 PDF pp.12–13,Tables 5–7。结果多为 trade-off 前沿的小幅移动,不应写成大幅能力跃升。
人评
80 COCO prompts、5 participants 的成对偏好:S-CFG 在 SD1.5 的 image quality/text alignment 为 73.22%/76.80%,SD2.1 为 71.84%/68.15%,IF 为 67.61%/70.83%(PDF p.7,Table 1)。论文未报置信区间或 inter-rater agreement。
下游与成本
- ControlNet Canny:FID 8.670→8.382,CLIP 0.3006→0.3019。
- ControlNet Segmentation:9.595→9.549,0.3004→0.3017。
- 单 A100、50-step DPM-Solver++:SD1.5 2.773→2.848s,SD2.1 7.054→7.167s,IF 8.595→8.847s。
关键消融
- spatially customized scales 的所有 variant 普遍优于 vanilla CFG。
- foreground benchmark 比全图 mean 更稳定。
- self-attention completion 的量化增益较小;视觉上 mask 更完整,但 FID/CLIP 未充分反映。
- IF 两阶段都用 S-CFG 的 trade-off 最好。
局限或疑问
- semantic-region independence 假设较强;属性、关系、遮挡、重复对象不独立。
- attention mask 在早期 step 边界模糊,并受 tokenization/START token 机制限制。
- 人评只有 80 prompts 与 5 raters。
- 只在 U-Net attention 生态验证;对 MM-DiT/FLUX、视频和编辑保持性未知。
- 方法不减少 NFE 或 U-Net forward,只增加轻量空间计算。
对当前 Wiki 判断的影响
- 扩散效率工程 中应从“CFG 空间稳定性”收窄为“以小幅 latency 换质量的 guidance governance”。
- 图像生成 中将其视为 U-Net inference-time interface,而非 base model 原生空间理解。
- 对 DiT 主干趋势 不应引用;CLIP ViT 只是评测器,生成 backbone 是 SD/IF U-Net。