一句话结论
论文把文本 + 粗笔触合成写成 latent constrained optimization,并以 GradOP+ 将 20–60 步梯度优化嵌入一次 U-Net reverse trajectory;无需训练条件模型,但每图测试时优化约 8.86 s,绝非“免费 guidance”。
问题定义
SDEdit 把 stroke painting 加噪再反演,会出现低 $t_0$ 忠实但卡通、高 $t_0$ 写实但偏离输入的冲突。作者希望在无成对 segmentation 标注、无条件重训的前提下同时保留笔触布局/色彩与文本目标域写实度。
方法概述
- 约束目标:最小化输出经 painting function 后与用户笔触的距离,同时要求输出落在文本条件生成子空间。
- GradOP:对最终 latent 做梯度下降,再 forward diffusion + reverse diffusion 恢复 realism。
- GradOP+:在 reverse diffusion 中间态直接做局部 latent 优化与重新加噪,只需一次 reverse pass。
- 通过用户区域 mask 与文本 token cross-attention 对齐控制不同笔触区域的语义。
Backbone、数据与设置
| 维度 | 全文核验 |
|---|---|
| 生成 backbone | Stable-Diffusion-era text-conditioned LDM U-Net;非 DiT |
| 输入/任务 | 粗 stroke painting + 文本,从头 guided synthesis;非一般真实图编辑 |
| 评测数据 | 100 对真人笔触/文本,经 8 类目标域模板扩成 800 pairs;4 samples/pair,共 3,200 |
| 推理 | 512²,DDIM 50 steps,CFG 7.5,RTX 3090 |
| 优化 | Adam,$N_{grad}=20$–60;无模型参数训练 |
| 基线 | SDEdit、4-pass Loopback、latent ILVR |
核心结果
| 方法 | stroke 忠实距离↓ | 目标域 realism FID↓ |
|---|---|---|
| SDEdit | 88.93 | 223.8 |
| Loopback | 104.6 | 132.9 |
| ILVR | 108.2 | 161.7 |
| GradOP+ | 94.40 | 134.2 |
GradOP+ 不是任何单项第一,而是双目标折中。相对人评综合偏好:对 SDEdit 91.98%、Loopback 85.32%、ILVR 93.47%。realism FID 是相对同文本纯文本生成分布,并用了 crop/flip 增广,不能与标准真实图像 FID 横比。
真实推理成本
RTX 3090、512²、DDIM 50 steps:
| 方法 | FP32 | mixed precision |
|---|---|---|
| SDEdit | 6.32 s | 4.45 s |
| Loopback | 27.2 s | 20.46 s |
| ILVR | 8.24 s | 6.17 s |
| GradOP | 20.1 s | 15.8 s |
| GradOP+ | 12.3 s | 8.86 s |
GradOP+ mixed precision 约为 SDEdit 的 1.99×。更精确的 median+color-quantization painting function 将 GradOP+ 推到 40.7 s;median filter 14.1 s;Gaussian blur 8.86 s。
消融与边界
- $N_{grad}=0$ 退化为纯文本采样;增加到 20–60 逐步强化 stroke fidelity。
- 仅提高 CFG 或 domain-token attention 仍有模糊、色斑或 image-in-image artifacts。
- 多语义区域控制随标签数量增加而变差;没有 stroke guidance 时只对少数区域较稳。
- OOD 同时有成功(六腿猫)与失败(老鼠追狮子),仍受 LDM 先验限制。
- 换 depth/pose/segmentation 等条件必须重新定义可微 $f$ 与 loss;未验证视频或 DiT。
相关页面
- 图像生成
- 扩散模型
- Plug-and-Play Diffusion Features — 同样不训练模型,但用 feature injection 而非每图 latent gradient descent。
备注
本库将其定位为 test-time latent optimization / U-Net cross-attention control,不再挂到 diffusion efficiency topic,也不把标题中的 guided 误读成 ADM classifier guidance 实体。