LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

SLDLLM 驱动的闭环扩散生成纠错

一句话结论

SLD 用 LLM、开放词汇检测器、SAM 和扩散潜空间操作组成检测—规划—修正闭环,在 LMD benchmark 上让 DALL-E 3 平均准确率从 52.0% 升至 78.5%、LMD+ 从 79.3% 升至 88.3%;提升来自外部模块化系统,不是 diffusion backbone 获得原生理解。

论文定位

SLD 是 controller-level orchestration,而非新 diffusion 架构。initial generator 可来自 DALL-E 3 API,但实际纠错执行依赖 Stable Diffusion/LMD+ 的可操作 latent、SAM 与局部扩散编辑。“生成/编辑统一”表示复用同一 pipeline 和不同 LLM instruction,不是单一统一模型。

问题定义

复杂 prompt 的计数、属性、空间关系和否定即使经过 LLM 预规划仍会被下游生成器画错。SLD 在看见输出后解析 prompt、检测对象、比较当前/目标框,再自动添加、删除、移动、缩放或改属性。

方法概述

  1. GPT-4 parser 提取对象、数量、属性和否定。
  2. OWL-ViT v2 检测当前对象框 $B_{curr}$。
  3. GPT-4 controller 生成目标框 $B_{next}$;程序差分得到操作集。
  4. SAM 定位对象,借助反向/正向 diffusion 合成、删除、移动或修改 latent。
  5. 若无操作则停止,否则进入下一轮;轮数有上限。

核心实验与结果

LMD benchmark 四类任务各 100 prompts,使用 OWL-ViT v2 评估:

方法NegationNumeracyAttributeSpatialAverage
DALL-E 325%38%74%71%52.0%
+ 1-round SLD90%61%80%83%78.5%
LMD+100%82%49%86%79.3%
+ 1-round SLD100%98%63%92%88.3%

Stable Diffusion 从 28.5% 升到一轮 54.5%、两轮 60.0%,第二轮仍有 +5.5pp,但收益递减。

关键消融

  • 一轮 vs 两轮:直接证明额外反馈轮有收益,是本批最强 closed-loop 证据。
  • OWL-ViT v1 vs v2:DALL-E 3 + SLD average 从 63.5% 到 78.5%;LMD+ + SLD 从 83.3% 到 88.3%,说明 detector 是关键瓶颈。
  • 图像编辑仅定性展示,没有保真、局部性、质量或时延主表。

局限或疑问

  1. “正确性”上限由 detector 和 LLM controller 决定;漏检可能导致错误停止。
  2. SAM 对复杂形状会误分割:删除头发时连面部一起移除。
  3. training-free 不代表低成本,多轮需要 LLM、检测、SAM 与多次 diffusion。
  4. 主指标偏对象检测,难衡量光照、背景、遮挡与自然度损失。
  5. 每类 100 个程序 prompt,不能外推到开放域复杂指令。

对当前 Wiki 判断的影响

判断证据分类边界
closed-loop correction 有效强直接支持表 2 一/两轮结果;依赖 detector/controller
semantic completeness直接支持operational accuracy,不等于底层理解
spatial guidance直接支持框级系统控制;受检测与分割限制
attention control背景证据SLD 核心不是 attention loss
支持 DiT仅间接支持外部 controller 可架构无关,但执行未验证 DiT
diffusion 原生“理解”反对过度外推推理主要由 GPT-4 与 detector 承担

原始链接

相关页面