一句话结论
Paint by Example 把 source image、mask 和单张 exemplar 输入 SD v1.4 inpainting U-Net,用 global CLIP image token、强增强和生成先验避免 self-supervised copy-paste shortcut;它无需 per-reference optimization,COCOEE 上自然度与参考相似度都强,但不是 subject personalization,无法严格保证参考身份或 mask 外像素不变。
问题定义
文本难以描述对象的细粒度外观;直接粘贴 reference 又无法适应 source 的姿态、尺度、视角、光照和边界。目标是在用户指定 mask 内“重绘”一个与 exemplar 相似且与场景协调的对象,而非低层 harmonization。
方法概述
- 接口:source image + 连通矩形/自由形状 mask + 单张 reference image。
- 主干:Stable Diffusion v1.4 latent U-Net,首层增加 masked-image latent 4 通道和 mask 1 通道;无 DiT。
- reference condition:CLIP ViT-L 只取 1024-D class token,经 15 层 FC/MLP 注入 cross-attention。丢弃 patch tokens 是刻意的信息瓶颈。
- 自监督训练:从同一 OpenImages 图中裁对象作为 reference,原图为 ground truth;若无约束,网络会学会原样复制。
- 防 shortcut:SD image prior、reference flip/rotation/blur/elastic augmentation、随机不规则 mask、global-token bottleneck。
- CFG:20% condition dropout,默认 guidance scale 5,控制 reference similarity。
数据与成本
- OpenImages:约 190 万图、600 类、1,600 万 bounding boxes;512×512、40 epochs。
- 64×V100 训练约 7 天(连续运行粗算约 10,752 GPU-hours)。
- AdamW,恒定学习率 $10^{-5}$,EMA。
- 推理无需 image-specific token/model optimization;论文所谓“single forward”指一次预训练编辑采样流程,不代表 U-Net 单次调用。未报告采样步数、秒级延迟、显存或吞吐。
COCOEE 结果与人评
COCOEE 含 3,500 个手工构建的 COCO source/reference/mask 配对。自动指标:
| 方法 | FID ↓ | QS ↑ | CLIP image score ↑ |
|---|---|---|---|
| Blended Diffusion-image | 4.60 | 67.14 | 80.65 |
| Blended Diffusion-text | 7.52 | 55.89 | 72.62 |
| DCCF | 3.78 | 71.49 | 82.18 |
| SD inpainting | 3.66 | 73.20 | 75.33 |
| 本文 | 3.18 | 77.80 | 84.97 |
50 名参与者对 30 组结果按 1–5 排名:本文 image quality 1.79(最佳)、reference consistency 2.07(第二);DCCF consistency 1.66 最佳,但它倾向直接复制且 quality 3.09。论文未给一致性、CI 或显著性检验。
消融
- naive baseline 的高 CLIP 部分来自 copy-paste,不等于更好的语义编辑。
- image prior 降 FID;augmentation 与 bottleneck 降低直接 reference cosine,却消除边界伪影并迫使语义重绘。
- 加 CFG 后最终 FID/QS/CLIP 为 3.18/77.80/84.97;$s$ 增大时更像 reference,默认 5。
- 详细文本仍无法复现 exemplar 的毛发、表情、项圈;image condition 的细粒度控制更强。
reference 与保持边界
- 可迁移类别、主色、纹理和部分身份线索,并自动适应 source context;同一输入可随机生成多个结果。
- 不是 subject personalization:没有专属 token/LoRA/model tuning,global CLIP token 有意丢掉高频/空间信息,文字、logo、精确形状与身份不保证。
- mask 外仅“尽量”保留;未报告 mask 外 L1/PSNR,也没有硬复制机制。
- 自然照片训练占主导,油画等人工图像和 dinosaur 等长尾类别失败。
- COCOEE 配对人工检索语义相近 exemplar,同任务成熟 baseline 缺失,评价对不同接口并不完全对称。
相关页面
- 图像编辑
- 扩散模型
- Blended Diffusion:零训练、mask + CLIP sampling guidance。
- Imagic:目标文本驱动的 per-image embedding + U-Net adaptation,不使用 exemplar。
- Prompt Tuning Inversion:target prompt 接口和 embedding trajectory optimization。
归属边界
本文是专用的 reference-conditioned masked latent diffusion editor,不是统一生成—编辑模型,也没有 DiT、inversion 或可跨 prompt 的 subject personalization 证据;已移除旧 unified-model entity/question 误关联。
证据评估
A-:数据、消融、自动指标与人评完整;主要限制是训练昂贵、benchmark/配对由作者构建、baseline 接口不对称、推理成本缺失,以及无身份与区域严格保持保证。