LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

BBDM以 Brownian Bridge 端点过程建模成对图像翻译

一句话结论

BBDM 不再从高斯噪声出发并逐步注入源图条件,而是在 VQGAN latent 中把目标图与源图设为 Brownian Bridge 两端,推理直接以源 latent 起步;它在四个成对翻译任务上改善 LDM 的 FID,但仍是 237M+ 可训练参数、默认 200 步的 U-Net/LDM 路线,不是自由文本编辑、未配对翻译或 DiT。

问题定义

标准条件 diffusion 把源图编码后在每个反向步注入 U-Net。论文认为这种设计没有把源/目标域显式写进前向随机过程,跨域差距大时可能弱化条件约束。BBDM 将 image-to-image translation 改写为两域之间的随机桥。

方法概述

对成对 latent $(x_0,y)$,前向过程为:

$$

q_{BB}(x_t\mid x_0,y)=\mathcal N\left((1-m_t)x_0+m_ty,\delta_tI\right),\quad m_t=t/T.

$$

训练端从目标 $x_0$ 走到源 $x_T=y$;推理端从源 latent 反向走到目标。源图只作为端点/初值,不再作为每步额外条件输入。方差采用 $\delta_t=2s(m_t-m_t^2)$,默认 $s=1$;增大 $s$ 提升像素级多样性但降低 FID/fidelity。

image-to-image 条件接口

维度论文证据
输入单张源域图像
训练监督成对 source-target images
条件位置Brownian Bridge 终点与反向采样初值
输出固定目标域图像
用户可控项域映射、随机 seed、方差尺度 $s$
不支持文本指令、任意 mask/box、未配对训练、零样本新域

训练数据、主干与成本

  • 主要任务:CelebAMask-HQ semantic-to-face、edges2shoes、edges2handbags、faces2comics。
  • 定性扩展:Visual Genome inpainting/colorization、CelebAMask-HQ face-to-label。
  • backbone:预训练 VQGAN + LDM-style latent U-Net;不是 Transformer/DiT。
  • BBDM-f4/f8/f16:总参数 292.42M/304.81M/327.71M,可训练 237.09M/237.10M/258.11M。
  • 单张 RTX 3090;f4/f8 batch 8,f16 batch 16;最大 lr $10^{-4}$,EMA 0.995。
  • 训练过程 1,000 diffusion steps;默认采样 200 steps。
  • 未披露训练总 steps、wall-clock、GPU-hours、单图延迟和能耗。

“单卡可训练”不等于轻量:绝大多数网络参数仍需训练,推理也不是少步。

核心结果

任务LDM FID / LPIPS / DiversityBBDM FID / LPIPS / Diversity
CelebAMask-HQ22.816 / 0.371 / 20.30421.350 / 0.370 / 29.859
edges2shoes13.020 / 0.173 / 10.99910.924 / 0.183 / 12.226
edges2handbags24.251 / 0.307 / 22.70517.257 / 0.286 / 15.656
faces2comics24.280 / 0.205 / 9.03223.203 / 0.192 / 10.046

BBDM 在四项 FID 都优于 LDM,但并非每项 LPIPS/diversity 最佳。diversity 是同一输入 5 个样本的像素标准差,不应解释为语义多样性或人类偏好。

关键消融

  • latent 压缩率:LDM f4→f16 FID 22.816→56.404;BBDM 21.350→22.061,支持所测范围内更稳健的跨 latent 层级映射。
  • 采样步数:20/50/100/200/1000 步 FID 33.409/25.188/23.503/21.350/21.348;200 后近乎饱和。
  • 方差尺度:$s=0.5/1/2/4$ 时 diversity 27.791/29.859/37.063/39.573,FID 22.627/21.350/23.278/24.490,明确呈现质量—多样性 trade-off。

Backbone 证据边界

论文直接实现的是 VQGAN latent 上的 LDM-style U-Net,attention 只是 U-Net 内部模块。它没有 Transformer denoiser、ViT backbone、DiT scaling 或跨 backbone 实验。因此本篇只能证明 U-Net 时代可通过改写 diffusion path 改善成对翻译,不应关联为 DiT adoption/scaling 的直接证据。

局限或疑问

  • 成对数据与固定域映射限制了开放式编辑能力。
  • 每个域对需训练一个 237M+ 参数模型;成本披露不完整。
  • 默认 200 步,实时部署价值有限。
  • 额外任务只做定性展示,主要定量范围窄。
  • 像素标准差 diversity 可能奖励纹理噪声,缺少用户研究。
  • 作者把 text-to-image/multimodal 列为未来工作,当前未验证。

对当前 Wiki 判断的影响

  • 直接支持:image-to-image 条件可写入 diffusion 端点,而非每步注入。
  • 有限支持:四个固定域对的 FID 改善和 latent 压缩稳健性。
  • 不支持:通用指令编辑、低成本、少步生成、DiT/Transformer 主干趋势。

原始链接

相关页面

证据评级

A-:成对潜空间 image-to-image translation 的强主证据;开放条件、成本、少步与跨 backbone 证据不足。