一句话结论
SLD 用 LLM、开放词汇检测器、SAM 和扩散潜空间操作组成检测—规划—修正闭环,在 LMD benchmark 上让 DALL-E 3 平均准确率从 52.0% 升至 78.5%、LMD+ 从 79.3% 升至 88.3%;提升来自外部模块化系统,不是 diffusion backbone 获得原生理解。
论文定位
SLD 是 controller-level orchestration,而非新 diffusion 架构。initial generator 可来自 DALL-E 3 API,但实际纠错执行依赖 Stable Diffusion/LMD+ 的可操作 latent、SAM 与局部扩散编辑。“生成/编辑统一”表示复用同一 pipeline 和不同 LLM instruction,不是单一统一模型。
问题定义
复杂 prompt 的计数、属性、空间关系和否定即使经过 LLM 预规划仍会被下游生成器画错。SLD 在看见输出后解析 prompt、检测对象、比较当前/目标框,再自动添加、删除、移动、缩放或改属性。
方法概述
- GPT-4 parser 提取对象、数量、属性和否定。
- OWL-ViT v2 检测当前对象框 $B_{curr}$。
- GPT-4 controller 生成目标框 $B_{next}$;程序差分得到操作集。
- SAM 定位对象,借助反向/正向 diffusion 合成、删除、移动或修改 latent。
- 若无操作则停止,否则进入下一轮;轮数有上限。
核心实验与结果
LMD benchmark 四类任务各 100 prompts,使用 OWL-ViT v2 评估:
| 方法 | Negation | Numeracy | Attribute | Spatial | Average |
|---|---|---|---|---|---|
| DALL-E 3 | 25% | 38% | 74% | 71% | 52.0% |
| + 1-round SLD | 90% | 61% | 80% | 83% | 78.5% |
| LMD+ | 100% | 82% | 49% | 86% | 79.3% |
| + 1-round SLD | 100% | 98% | 63% | 92% | 88.3% |
Stable Diffusion 从 28.5% 升到一轮 54.5%、两轮 60.0%,第二轮仍有 +5.5pp,但收益递减。
关键消融
- 一轮 vs 两轮:直接证明额外反馈轮有收益,是本批最强 closed-loop 证据。
- OWL-ViT v1 vs v2:DALL-E 3 + SLD average 从 63.5% 到 78.5%;LMD+ + SLD 从 83.3% 到 88.3%,说明 detector 是关键瓶颈。
- 图像编辑仅定性展示,没有保真、局部性、质量或时延主表。
局限或疑问
- “正确性”上限由 detector 和 LLM controller 决定;漏检可能导致错误停止。
- SAM 对复杂形状会误分割:删除头发时连面部一起移除。
- training-free 不代表低成本,多轮需要 LLM、检测、SAM 与多次 diffusion。
- 主指标偏对象检测,难衡量光照、背景、遮挡与自然度损失。
- 每类 100 个程序 prompt,不能外推到开放域复杂指令。
对当前 Wiki 判断的影响
| 判断 | 证据分类 | 边界 |
|---|---|---|
| closed-loop correction 有效 | 强直接支持 | 表 2 一/两轮结果;依赖 detector/controller |
| semantic completeness | 直接支持 | operational accuracy,不等于底层理解 |
| spatial guidance | 直接支持 | 框级系统控制;受检测与分割限制 |
| attention control | 背景证据 | SLD 核心不是 attention loss |
| 支持 DiT | 仅间接支持 | 外部 controller 可架构无关,但执行未验证 DiT |
| diffusion 原生“理解” | 反对过度外推 | 推理主要由 GPT-4 与 detector 承担 |