LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Scalable Diffusion Models with TransformersDiT 把 Transformer 真正坐实为可扩展扩散主干

一句话结论

DiT 的核心贡献不是单个 FID 2.27,而是在统一 ImageNet latent diffusion 设置下,用 12 个模型规模 × patch size 配置证明前向 Gflops 与 FID 强相关(相关系数 -0.93);它直接支持 Transformer 去噪器的 scaling 子命题,但不单独证明 DiT 已是跨任务“默认”主干。

论文定位

这是 Diffusion Transformer 的 canonical scaling paper。相较 U-ViT 主要证明 ViT 去噪器可行,DiT 把模型深度/宽度、token 数、训练计算与生成质量放进统一实验网格,形成可复核的 scaling 叙事。

问题定义

当 U-Net 被标准 Transformer 替代后,扩散模型能否继承 Transformer 随模型/计算扩张而稳定改善的性质?论文选择前向 Gflops 而非参数量作为复杂度主轴,因为 patch size 会显著改变 token 与计算,却几乎不改变参数数(PDF pp.3–4)。

方法概述

  • 图像经冻结 Stable Diffusion VAE 压缩为 latent;256×256 对应 32×32×4(PDF pp.4, 6)。
  • latent patchify 为 token;patch size $p=8/4/2$,减半使 token 数约四倍(PDF p.4,Figure 4)。
  • S/B/L/XL 联合扩展层数、宽度与 heads,并与三种 patch size 组成 12 个配置(PDF p.5,Table 1)。
  • 条件接口比较 in-context、cross-attention、adaLN、adaLN-Zero;最终采用零初始化残差门控的 adaLN-Zero(PDF pp.4–6)。

实验设置

ImageNet 类条件 256×256 / 512×512;AdamW、固定学习率 $10^{-4}$、batch 256、无 weight decay,只做水平翻转;所有模型复用相同超参数。FID-50K 使用 250 DDPM steps,scaling 结果除特别标注外不使用 CFG(PDF pp.5–6)。

核心 scaling 证据

  • 12 个配置在 400K steps 下,Gflops 与 FID-50K 相关系数 -0.93(PDF p.8,Figure 8)。
  • 固定 patch 时,增大深度/宽度在训练全过程改善 FID;固定参数规模时,减小 patch、增加 token 同样改善(PDF pp.6–8,Figures 6–8)。
  • 相近 Gflops 的不同配置得到相近 FID,说明参数量不是唯一解释变量(PDF p.8)。
  • 大模型在总训练计算上更高效,小模型训练更久也会落后(PDF p.8,Figure 9)。
  • 更多 sampling steps 不能补偿小模型:L/2 用 1000 steps、80.7 Tflops/图,仍不及 XL/2 用 128 steps、15.2 Tflops/图(FID-10K 25.9 vs 23.7;PDF p.9,Figure 10)。

主实验结果

设置DiT-XL/2关键对照定位
ImageNet 256,无 CFGFID 9.62LDM-4 10.56PDF p.9,Table 2
ImageNet 256,CFG 1.5FID 2.27LDM-4 CFG 1.5:3.60sFID 4.60、IS 278.24;PDF p.9
ImageNet 512,CFG 1.5FID 3.04ADM-G+U 3.85PDF p.9,Table 3
512 前向计算524.6 GflopsADM 1983;ADM-U 2813PDF p.9 正文

无 CFG 与有 CFG 的差距说明最终 SOTA 数字不是 backbone 单变量结果;最强 backbone 结论仍来自完整 scaling 网格。

关键消融

  • adaLN-Zero 在训练各阶段优于 in-context、cross-attention 和普通 adaLN;400K steps 时 FID 约为 in-context 的一半(PDF pp.5–6,Figure 5)。
  • 模型规模 × patch size 网格同时隔离“更多参数”和“更多 token”两条扩展路径(PDF pp.6–8)。
  • 附录 VAE decoder 消融表明 decoder 会改变绝对 FID,但不改变整体 scaling 排序(PDF p.13,Table 4)。

局限或疑问

  • 只覆盖类条件 ImageNet 图像生成;文本到图像在 Conclusion 中仍是未来方向(PDF p.9)。
  • Gflops 不等于跨硬件真实 latency、显存或能耗;论文也承认复杂度指标依应用而变(PDF p.3)。
  • 系统依赖卷积 VAE,因此不是全 Transformer pipeline。
  • 强结果使用 CFG,并伴随 precision/recall 权衡。
  • 没有与后来的 SSM/Mamba/线性 attention 竞争路线比较。

对当前 Wiki 判断的影响

DiT / Transformer 主干 claim 的分类是:直接支持,但严格限定于 scaling 子命题

论文证明 DiT 是可扩展主干,不证明跨任务采用率已达到“默认”,也不证明 attention 是唯一可扩展方案。因此 claim 维持“主要可扩展主干之一”最符合证据范围。

原始链接

相关页面