一句话结论
Blended Diffusion 用冻结的 ImageNet 像素 DDPM 与 CLIP 梯度,在每个反向扩散步把文本引导前景和原图同噪声级背景按 mask 混合;它以高推理成本换来 mask 外像素严格保持,是早期局部 diffusion editing 的清晰基线,而不是 inversion、latent diffusion 或 DiT 方法。
问题定义
输入真实图像、目标文本和二值 ROI mask,要求 mask 内发生语义编辑,mask 外保持原图,并让边界自然。单纯给局部 CLIP loss 加 soft background loss 会产生不可消除的编辑—保持 trade-off:背景权重低会全图漂移,权重高又压制前景改变。
方法概述
- 真实主干:Dhariwal–Nichol ImageNet 256×256 class-conditional improved DDPM 的卷积 U-Net;CLIP 只负责梯度 guidance 与候选排名。
- 逐步混合:每一步先得到文本引导前景 $x_{t-1,fg}$,再从原图采样同噪声级背景 $x_{t-1,bg}$:
$$
x_{t-1}=x_{t-1,fg}\odot m+x_{t-1,bg}\odot(1-m).
$$
- 保持机制:下一步 denoising 修复混合边界;最终一步直接复制原图 mask 外像素,因此该区域的保持是构造保证。
- 抗 CLIP 捷径:对中间干净图预测做多次 projective augmentations,平均各视图的 CLIP 梯度,降低对抗纹理。
- 不是 inversion:输入仅经已知正向核加噪到编辑起点;不求可逆初始噪声,不优化模型或文本 embedding,但每步需要 CLIP 反向梯度。
关键发现
用户研究按 1–5 分评价 Figure 5 的结果:
| 方法 | 现实感 ↑ | 背景保持 ↑ | 文本匹配 ↑ |
|---|---|---|---|
| PaintByWord | 3.31±1.38 | 3.25±1.33 | 3.14±1.31 |
| Local CLIP GD | 3.50±1.19 | 3.11±1.24 | 3.86±1.32 |
| PaintByWord++ | 1.94±1.36 | 3.37±1.30 | 3.01±1.38 |
| Blended Diffusion | 3.93±1.08 | 4.73±0.61 | 4.63±0.77 |
这张表支持其在该小规模协议下优于三条早期基线,但主文未披露参与者数、判断总数与显著性,不能外推为通用性能幅度。更可靠的结论是:hard blending 从机制上解决了 soft background loss 的冲突。
消融与成本
- $\lambda$ 消融显示 soft background preservation 不能同时得到强编辑和干净背景。
- 相同 seed 下,加入 extending augmentations 的结果更自然;但论文没有 augmentation 数量或 CLIP 变体的定量曲线。
- 新增训练为 0,但单候选约 30 秒/张;每步需 U-Net 前向以及多视图 CLIP 前向/反向,且通常生成多个候选再排名,总延迟随候选数增加。
编辑保持边界
- 已展示对象添加/替换/删除、背景替换、scribble 引导和图像外推。
- 严格保持只覆盖 mask 外;mask 内主体身份、几何、纹理和边界连续性没有保证。
- 必须提供 mask;不是 mask-free instruction editing。
- 局部 CLIP ranking 会偏好残缺对象或文字捷径,并可能生成不自然阴影。
- 证据只覆盖 256×256 像素 U-Net DDPM,不能直接外推到 Stable Diffusion、DiT、高分辨率或多轮编辑。
相关页面
- 图像编辑
- 扩散模型
- EDICT:无 mask 的精确 sampler inversion,保持保证与成本结构不同。
- Imagic:无 mask、每图优化与微调,能做更大非刚性改变但没有像素级保持保证。
证据评估
B+:方法边界清楚、背景保持有结构保证、比较和消融支持核心设计;主要缺口是评测规模、自动指标、推理成本明细与跨 backbone 验证。