一句话结论
U-ViT 证明扩散去噪器不必绑定 CNN U-Net:时间、条件与图像 patch 可以统一为 token,真正不可轻易丢掉的结构更像是浅层—深层长跳连;它是 Transformer 扩散主干的奠基性证据,但不足以证明 DiT 已成为“默认”主干。
论文定位
这篇论文处于 Diffusion Transformer 谱系的前史:重点是“ViT backbone 可行且有竞争力”,而不是后续 DiT 论文那种系统的 Gflops—FID scaling law。它与 DiT 的分工应明确:U-ViT 建立可行性,DiT 建立规模扩展证据。
问题定义
传统扩散模型默认采用含下/上采样和长跳连的 CNN U-Net。论文追问:高质量去噪究竟依赖 CNN 多尺度结构,还是只需保留低层细节通道,ViT 也能完成噪声预测?(PDF p.2)
方法概述
- 将带噪图像切为 patch,并把时间步、条件和图像 patch 都视为 token,统一送入 Transformer(PDF p.2)。
- 在对称浅层和深层 block 间加入长跳连;默认用
Linear(Concat(h_m,h_s))融合(PDF p.3,Figure 2a)。 - 可选输出前 3×3 卷积以减少视觉伪影(PDF p.3)。
- 高分辨率实验在 Stable Diffusion autoencoder 的 latent 空间进行;文本由 CLIP encoder 编码(PDF p.5)。
核心实验与结果
| 设置 | U-ViT 结果 | 关键对照 | 定位 |
|---|---|---|---|
| ImageNet 256×256 | FID 2.29 | LDM 3.60 | latent + CFG;PDF p.6,Table 1 |
| ImageNet 512×512 | FID 4.05 | ADM-G 7.72;ADM-G+U 3.85 | 不是全表绝对最优;PDF p.6,Table 1 |
| CIFAR-10 | FID 3.11 | DDPM 3.17;EDM 1.97 | 证明竞争力,不是普遍支配;PDF p.6,Table 1 |
| CelebA 64×64 | FID 2.87 | DDIM 3.26;Soft Truncation 1.90 | 同上;PDF p.6,Table 1 |
| MS-COCO 256×256 | FID 5.48 | 限定为无大规模外部生成数据方法 | PDF p.7,Table 4 |
DPM-Solver 20 steps 下,500K U-ViT-H/2 的 ImageNet 256 FID 为 2.53;5 steps 为 4.64,均优于表中同 sampler 的 LDM(PDF p.7,Table 3)。
关键消融
- 长跳连:CIFAR-10 与 ImageNet 256×256 均显示移除后显著恶化,是论文最强结构结论(PDF pp.3, 7,Figure 2a / Figure 5)。
- 融合方式:直接相加无明显收益;对 skip 分支线性变换有效,拼接后线性投影最好(PDF p.3)。
- 时间注入:time token 优于 AdaLN(PDF p.3,Figure 2b)。这与 DiT 的 adaLN-Zero 最优并不一致,说明条件接口不存在脱离架构的固定答案。
- 输出卷积、patch embedding、位置编码消融主要在 CIFAR-10、10K 样本 FID 上完成,外推强度有限(PDF p.3)。
局限或疑问
- 证据集中于图像生成,不覆盖视频、复杂控制、编辑或部署。
- 强结果同时依赖 VAE、CFG、训练预算,不能全部归因于 backbone。
- 低分辨率任务并非全面领先 U-Net,说明 ViT 的优势有尺度/数据条件。
- 论文展示模型变大有收益,但没有完整模型 × patch 网格与统一 Gflops 横轴,不能称为严格 scaling law。
对当前 Wiki 判断的影响
对 DiT / Transformer 主干 claim 的分类是:奠基性边界证据 / 部分支持。
它直接支持“ViT 可成为强扩散主干”,但不支持“已成为默认”、跨任务普遍最优或采用率趋势。最稳妥的综合表述是:U-ViT 为 Transformer 扩散路线建立可行性,后续 DiT 才提供系统 scaling 证据。