一句话结论
GLIGEN 证明冻结大规模 T2I 主干、插入 gated self-attention 并补充 grounding 数据,就能在保持生成质量的同时获得 box 等开放集合控制;它支持统一基础模型的平台价值,也说明精确空间控制仍需要专用条件模块与数据。
论文定位
GLIGEN 是开放集合 grounded text-to-image generation 框架,主实验使用 caption + (text entity, box);也展示参考图、keypoint、depth/edge/normal/semantic map,inpainting 是补充应用。它不是统一生成—编辑单模型。
问题定义
纯文本难以表达精确对象位置、大小与姿态,传统 layout2img 又多在封闭类别数据上从头训练。GLIGEN 试图保留基础模型从海量图文预训练中得到的开放语义,只学习一个新的 grounding 接口。
方法概述
- caption 与 grounded entity 共用 pretrained text encoder;box 经 Fourier embedding,与 entity feature 由 MLP 合成 grounding token。
- 冻结 LDM/Stable Diffusion 原权重,在每个 Transformer block 插入 gated self-attention;视觉与 grounding tokens 联合注意,gate 标量 $\gamma$ 从 0 初始化。
- scheduled sampling 在扩散前期启用 grounding、后期关闭新增层回到原模型,平衡位置与细节。
- 数据包括 COCO detection/caption/GLIP pseudo grounding,并扩展到 Object365、GoldG、SBU、CC3M(PDF pp.4–8;supp. p.14)。
核心实验与结果
COCO2014
PDF p.6,Table 1:
| 模型 | FID↓ | YOLO AP/AP50/AP75↑ |
|---|---|---|
| fine-tuned LDM* | 5.91 | 0.6/2.0/0.3 |
| GLIGEN-CD | 5.82 | 21.7/39.0/21.7 |
| GLIGEN-D | 5.61 | 24.0/42.2/24.1 |
| GLIGEN-G | 6.38 | 11.2/21.2/10.7 |
新增 grounding 基本保持 FID,同时大幅提高位置对应;普通 T2I 基线不能输入 box,因此该表不是完全同接口排名。
COCO2017 与 LVIS
- GLIGEN-LDM 在 COCO2017 得到 FID 21.04、YOLO AP 22.4,优于 LAMA 的 31.12/13.40 与 LostGAN-V2 的 42.55/9.1(PDF p.7,Table 2)。
- COCO2014CD 模型在 LVIS zero-shot AP 6.4,高于使用 LVIS 监督训练的 LAMA 2.0;扩展到 GoldG+O365+SBU+CC3M 后 AP 11.1、rare AP 9.0(PDF p.7,Table 3)。
关键消融
- gated self-attention vs cross-attention:FID 均约 5.8,但 YOLO AP 21.7 vs 16.6。
- detection-only 用自然语言类别串替代 null caption,FID 从 5.61 恶化到 7.40。
- Fourier box embedding 换成 MLP:FID 5.82/5.80 近似,YOLO AP 从 21.7 降至 3.2(supp. p.14)。
这些结果把“生成质量”与“grounding 接口质量”清楚分开:看似相同的 FID 可对应完全不同的空间可控性。
局限或疑问
- grounding 全程开启可能降低原 Stable Diffusion 的细节/审美质量,需要 scheduled sampling 做折中。
- “open-set”主要是共享文本空间上的类别迁移,不代表任意关系和组合都可靠。
- keypoint 从人泛化到 humanoid 尚可,但对 cat/lamp 失败;细控制比 box 更不通用(supp. p.17)。
- 非 box 模态多为定性展示;不能把 box benchmark 结果外推到所有条件。
- YOLO/GLIP 指标受检测器偏差影响;扩展数据也混合真实标注与伪标签。
对当前 Wiki 判断的影响
统一还是专用/模块化
GLIGEN 是“统一底座 + 专用 adapter”的强证据。统一 backbone 提供开放语义和画质,模块化 gated layers 提供精确控制;它不支持纯文本单一接口自然覆盖所有控制,也不证明统一模型失败。更可能的长期形态是统一基础模型与任务适配模块共存。
数据还是架构
Fourier embedding 与 self-attention 消融证明架构接口对 AP 关键;LVIS AP 随 GoldG/O365/SBU/CC3M 扩展又证明数据覆盖继续提升 rare/open-set 能力。它支持“数据打开概念覆盖、架构把空间监督兑现出来”,但主任务是生成,不能直接替代图像编辑受控实验。