LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

GLIGEN以冻结基础模型和门控适配器实现开放集合 grounded 生成

一句话结论

GLIGEN 证明冻结大规模 T2I 主干、插入 gated self-attention 并补充 grounding 数据,就能在保持生成质量的同时获得 box 等开放集合控制;它支持统一基础模型的平台价值,也说明精确空间控制仍需要专用条件模块与数据。

论文定位

GLIGEN 是开放集合 grounded text-to-image generation 框架,主实验使用 caption + (text entity, box);也展示参考图、keypoint、depth/edge/normal/semantic map,inpainting 是补充应用。它不是统一生成—编辑单模型。

问题定义

纯文本难以表达精确对象位置、大小与姿态,传统 layout2img 又多在封闭类别数据上从头训练。GLIGEN 试图保留基础模型从海量图文预训练中得到的开放语义,只学习一个新的 grounding 接口。

方法概述

  • caption 与 grounded entity 共用 pretrained text encoder;box 经 Fourier embedding,与 entity feature 由 MLP 合成 grounding token。
  • 冻结 LDM/Stable Diffusion 原权重,在每个 Transformer block 插入 gated self-attention;视觉与 grounding tokens 联合注意,gate 标量 $\gamma$ 从 0 初始化。
  • scheduled sampling 在扩散前期启用 grounding、后期关闭新增层回到原模型,平衡位置与细节。
  • 数据包括 COCO detection/caption/GLIP pseudo grounding,并扩展到 Object365、GoldG、SBU、CC3M(PDF pp.4–8;supp. p.14)。

核心实验与结果

COCO2014

PDF p.6,Table 1:

模型FID↓YOLO AP/AP50/AP75↑
fine-tuned LDM*5.910.6/2.0/0.3
GLIGEN-CD5.8221.7/39.0/21.7
GLIGEN-D5.6124.0/42.2/24.1
GLIGEN-G6.3811.2/21.2/10.7

新增 grounding 基本保持 FID,同时大幅提高位置对应;普通 T2I 基线不能输入 box,因此该表不是完全同接口排名。

COCO2017 与 LVIS

  • GLIGEN-LDM 在 COCO2017 得到 FID 21.04、YOLO AP 22.4,优于 LAMA 的 31.12/13.40 与 LostGAN-V2 的 42.55/9.1(PDF p.7,Table 2)。
  • COCO2014CD 模型在 LVIS zero-shot AP 6.4,高于使用 LVIS 监督训练的 LAMA 2.0;扩展到 GoldG+O365+SBU+CC3M 后 AP 11.1、rare AP 9.0(PDF p.7,Table 3)。

关键消融

  • gated self-attention vs cross-attention:FID 均约 5.8,但 YOLO AP 21.7 vs 16.6
  • detection-only 用自然语言类别串替代 null caption,FID 从 5.61 恶化到 7.40
  • Fourier box embedding 换成 MLP:FID 5.82/5.80 近似,YOLO AP 从 21.7 降至 3.2(supp. p.14)。

这些结果把“生成质量”与“grounding 接口质量”清楚分开:看似相同的 FID 可对应完全不同的空间可控性。

局限或疑问

  • grounding 全程开启可能降低原 Stable Diffusion 的细节/审美质量,需要 scheduled sampling 做折中。
  • “open-set”主要是共享文本空间上的类别迁移,不代表任意关系和组合都可靠。
  • keypoint 从人泛化到 humanoid 尚可,但对 cat/lamp 失败;细控制比 box 更不通用(supp. p.17)。
  • 非 box 模态多为定性展示;不能把 box benchmark 结果外推到所有条件。
  • YOLO/GLIP 指标受检测器偏差影响;扩展数据也混合真实标注与伪标签。

对当前 Wiki 判断的影响

统一还是专用/模块化

GLIGEN 是“统一底座 + 专用 adapter”的强证据。统一 backbone 提供开放语义和画质,模块化 gated layers 提供精确控制;它不支持纯文本单一接口自然覆盖所有控制,也不证明统一模型失败。更可能的长期形态是统一基础模型与任务适配模块共存。

数据还是架构

Fourier embedding 与 self-attention 消融证明架构接口对 AP 关键;LVIS AP 随 GoldG/O365/SBU/CC3M 扩展又证明数据覆盖继续提升 rare/open-set 能力。它支持“数据打开概念覆盖、架构把空间监督兑现出来”,但主任务是生成,不能直接替代图像编辑受控实验。

原始链接

相关页面