LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

All Are Worth Words把 ViT 直接变成扩散模型主干

一句话结论

U-ViT 证明扩散去噪器不必绑定 CNN U-Net:时间、条件与图像 patch 可以统一为 token,真正不可轻易丢掉的结构更像是浅层—深层长跳连;它是 Transformer 扩散主干的奠基性证据,但不足以证明 DiT 已成为“默认”主干。

论文定位

这篇论文处于 Diffusion Transformer 谱系的前史:重点是“ViT backbone 可行且有竞争力”,而不是后续 DiT 论文那种系统的 Gflops—FID scaling law。它与 DiT 的分工应明确:U-ViT 建立可行性,DiT 建立规模扩展证据。

问题定义

传统扩散模型默认采用含下/上采样和长跳连的 CNN U-Net。论文追问:高质量去噪究竟依赖 CNN 多尺度结构,还是只需保留低层细节通道,ViT 也能完成噪声预测?(PDF p.2)

方法概述

  • 将带噪图像切为 patch,并把时间步、条件和图像 patch 都视为 token,统一送入 Transformer(PDF p.2)。
  • 在对称浅层和深层 block 间加入长跳连;默认用 Linear(Concat(h_m,h_s)) 融合(PDF p.3,Figure 2a)。
  • 可选输出前 3×3 卷积以减少视觉伪影(PDF p.3)。
  • 高分辨率实验在 Stable Diffusion autoencoder 的 latent 空间进行;文本由 CLIP encoder 编码(PDF p.5)。

核心实验与结果

设置U-ViT 结果关键对照定位
ImageNet 256×256FID 2.29LDM 3.60latent + CFG;PDF p.6,Table 1
ImageNet 512×512FID 4.05ADM-G 7.72;ADM-G+U 3.85不是全表绝对最优;PDF p.6,Table 1
CIFAR-10FID 3.11DDPM 3.17;EDM 1.97证明竞争力,不是普遍支配;PDF p.6,Table 1
CelebA 64×64FID 2.87DDIM 3.26;Soft Truncation 1.90同上;PDF p.6,Table 1
MS-COCO 256×256FID 5.48限定为无大规模外部生成数据方法PDF p.7,Table 4

DPM-Solver 20 steps 下,500K U-ViT-H/2 的 ImageNet 256 FID 为 2.53;5 steps 为 4.64,均优于表中同 sampler 的 LDM(PDF p.7,Table 3)。

关键消融

  • 长跳连:CIFAR-10 与 ImageNet 256×256 均显示移除后显著恶化,是论文最强结构结论(PDF pp.3, 7,Figure 2a / Figure 5)。
  • 融合方式:直接相加无明显收益;对 skip 分支线性变换有效,拼接后线性投影最好(PDF p.3)。
  • 时间注入:time token 优于 AdaLN(PDF p.3,Figure 2b)。这与 DiT 的 adaLN-Zero 最优并不一致,说明条件接口不存在脱离架构的固定答案。
  • 输出卷积、patch embedding、位置编码消融主要在 CIFAR-10、10K 样本 FID 上完成,外推强度有限(PDF p.3)。

局限或疑问

  • 证据集中于图像生成,不覆盖视频、复杂控制、编辑或部署。
  • 强结果同时依赖 VAE、CFG、训练预算,不能全部归因于 backbone。
  • 低分辨率任务并非全面领先 U-Net,说明 ViT 的优势有尺度/数据条件。
  • 论文展示模型变大有收益,但没有完整模型 × patch 网格与统一 Gflops 横轴,不能称为严格 scaling law。

对当前 Wiki 判断的影响

DiT / Transformer 主干 claim 的分类是:奠基性边界证据 / 部分支持

它直接支持“ViT 可成为强扩散主干”,但不支持“已成为默认”、跨任务普遍最优或采用率趋势。最稳妥的综合表述是:U-ViT 为 Transformer 扩散路线建立可行性,后续 DiT 才提供系统 scaling 证据。

原始链接

相关页面