LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Blended Diffusion在像素扩散过程中逐步混合文本编辑前景与原图背景

一句话结论

Blended Diffusion 用冻结的 ImageNet 像素 DDPM 与 CLIP 梯度,在每个反向扩散步把文本引导前景和原图同噪声级背景按 mask 混合;它以高推理成本换来 mask 外像素严格保持,是早期局部 diffusion editing 的清晰基线,而不是 inversion、latent diffusion 或 DiT 方法。

问题定义

输入真实图像、目标文本和二值 ROI mask,要求 mask 内发生语义编辑,mask 外保持原图,并让边界自然。单纯给局部 CLIP loss 加 soft background loss 会产生不可消除的编辑—保持 trade-off:背景权重低会全图漂移,权重高又压制前景改变。

方法概述

  • 真实主干:Dhariwal–Nichol ImageNet 256×256 class-conditional improved DDPM 的卷积 U-Net;CLIP 只负责梯度 guidance 与候选排名。
  • 逐步混合:每一步先得到文本引导前景 $x_{t-1,fg}$,再从原图采样同噪声级背景 $x_{t-1,bg}$:

$$

x_{t-1}=x_{t-1,fg}\odot m+x_{t-1,bg}\odot(1-m).

$$

  • 保持机制:下一步 denoising 修复混合边界;最终一步直接复制原图 mask 外像素,因此该区域的保持是构造保证。
  • 抗 CLIP 捷径:对中间干净图预测做多次 projective augmentations,平均各视图的 CLIP 梯度,降低对抗纹理。
  • 不是 inversion:输入仅经已知正向核加噪到编辑起点;不求可逆初始噪声,不优化模型或文本 embedding,但每步需要 CLIP 反向梯度。

关键发现

用户研究按 1–5 分评价 Figure 5 的结果:

方法现实感 ↑背景保持 ↑文本匹配 ↑
PaintByWord3.31±1.383.25±1.333.14±1.31
Local CLIP GD3.50±1.193.11±1.243.86±1.32
PaintByWord++1.94±1.363.37±1.303.01±1.38
Blended Diffusion3.93±1.084.73±0.614.63±0.77

这张表支持其在该小规模协议下优于三条早期基线,但主文未披露参与者数、判断总数与显著性,不能外推为通用性能幅度。更可靠的结论是:hard blending 从机制上解决了 soft background loss 的冲突。

消融与成本

  • $\lambda$ 消融显示 soft background preservation 不能同时得到强编辑和干净背景。
  • 相同 seed 下,加入 extending augmentations 的结果更自然;但论文没有 augmentation 数量或 CLIP 变体的定量曲线。
  • 新增训练为 0,但单候选约 30 秒/张;每步需 U-Net 前向以及多视图 CLIP 前向/反向,且通常生成多个候选再排名,总延迟随候选数增加。

编辑保持边界

  • 已展示对象添加/替换/删除、背景替换、scribble 引导和图像外推。
  • 严格保持只覆盖 mask 外;mask 内主体身份、几何、纹理和边界连续性没有保证。
  • 必须提供 mask;不是 mask-free instruction editing。
  • 局部 CLIP ranking 会偏好残缺对象或文字捷径,并可能生成不自然阴影。
  • 证据只覆盖 256×256 像素 U-Net DDPM,不能直接外推到 Stable Diffusion、DiT、高分辨率或多轮编辑。

相关页面

  • 图像编辑
  • 扩散模型
  • EDICT:无 mask 的精确 sampler inversion,保持保证与成本结构不同。
  • Imagic:无 mask、每图优化与微调,能做更大非刚性改变但没有像素级保持保证。

证据评估

B+:方法边界清楚、背景保持有结构保证、比较和消融支持核心设计;主要缺口是评测规模、自动指标、推理成本明细与跨 backbone 验证。