一句话结论
DiT 的核心贡献不是单个 FID 2.27,而是在统一 ImageNet latent diffusion 设置下,用 12 个模型规模 × patch size 配置证明前向 Gflops 与 FID 强相关(相关系数 -0.93);它直接支持 Transformer 去噪器的 scaling 子命题,但不单独证明 DiT 已是跨任务“默认”主干。
论文定位
这是 Diffusion Transformer 的 canonical scaling paper。相较 U-ViT 主要证明 ViT 去噪器可行,DiT 把模型深度/宽度、token 数、训练计算与生成质量放进统一实验网格,形成可复核的 scaling 叙事。
问题定义
当 U-Net 被标准 Transformer 替代后,扩散模型能否继承 Transformer 随模型/计算扩张而稳定改善的性质?论文选择前向 Gflops 而非参数量作为复杂度主轴,因为 patch size 会显著改变 token 与计算,却几乎不改变参数数(PDF pp.3–4)。
方法概述
- 图像经冻结 Stable Diffusion VAE 压缩为 latent;256×256 对应 32×32×4(PDF pp.4, 6)。
- latent patchify 为 token;patch size $p=8/4/2$,减半使 token 数约四倍(PDF p.4,Figure 4)。
- S/B/L/XL 联合扩展层数、宽度与 heads,并与三种 patch size 组成 12 个配置(PDF p.5,Table 1)。
- 条件接口比较 in-context、cross-attention、adaLN、adaLN-Zero;最终采用零初始化残差门控的 adaLN-Zero(PDF pp.4–6)。
实验设置
ImageNet 类条件 256×256 / 512×512;AdamW、固定学习率 $10^{-4}$、batch 256、无 weight decay,只做水平翻转;所有模型复用相同超参数。FID-50K 使用 250 DDPM steps,scaling 结果除特别标注外不使用 CFG(PDF pp.5–6)。
核心 scaling 证据
- 12 个配置在 400K steps 下,Gflops 与 FID-50K 相关系数 -0.93(PDF p.8,Figure 8)。
- 固定 patch 时,增大深度/宽度在训练全过程改善 FID;固定参数规模时,减小 patch、增加 token 同样改善(PDF pp.6–8,Figures 6–8)。
- 相近 Gflops 的不同配置得到相近 FID,说明参数量不是唯一解释变量(PDF p.8)。
- 大模型在总训练计算上更高效,小模型训练更久也会落后(PDF p.8,Figure 9)。
- 更多 sampling steps 不能补偿小模型:L/2 用 1000 steps、80.7 Tflops/图,仍不及 XL/2 用 128 steps、15.2 Tflops/图(FID-10K 25.9 vs 23.7;PDF p.9,Figure 10)。
主实验结果
| 设置 | DiT-XL/2 | 关键对照 | 定位 |
|---|---|---|---|
| ImageNet 256,无 CFG | FID 9.62 | LDM-4 10.56 | PDF p.9,Table 2 |
| ImageNet 256,CFG 1.5 | FID 2.27 | LDM-4 CFG 1.5:3.60 | sFID 4.60、IS 278.24;PDF p.9 |
| ImageNet 512,CFG 1.5 | FID 3.04 | ADM-G+U 3.85 | PDF p.9,Table 3 |
| 512 前向计算 | 524.6 Gflops | ADM 1983;ADM-U 2813 | PDF p.9 正文 |
无 CFG 与有 CFG 的差距说明最终 SOTA 数字不是 backbone 单变量结果;最强 backbone 结论仍来自完整 scaling 网格。
关键消融
- adaLN-Zero 在训练各阶段优于 in-context、cross-attention 和普通 adaLN;400K steps 时 FID 约为 in-context 的一半(PDF pp.5–6,Figure 5)。
- 模型规模 × patch size 网格同时隔离“更多参数”和“更多 token”两条扩展路径(PDF pp.6–8)。
- 附录 VAE decoder 消融表明 decoder 会改变绝对 FID,但不改变整体 scaling 排序(PDF p.13,Table 4)。
局限或疑问
- 只覆盖类条件 ImageNet 图像生成;文本到图像在 Conclusion 中仍是未来方向(PDF p.9)。
- Gflops 不等于跨硬件真实 latency、显存或能耗;论文也承认复杂度指标依应用而变(PDF p.3)。
- 系统依赖卷积 VAE,因此不是全 Transformer pipeline。
- 强结果使用 CFG,并伴随 precision/recall 权衡。
- 没有与后来的 SSM/Mamba/线性 attention 竞争路线比较。
对当前 Wiki 判断的影响
对 DiT / Transformer 主干 claim 的分类是:直接支持,但严格限定于 scaling 子命题。
论文证明 DiT 是可扩展主干,不证明跨任务采用率已达到“默认”,也不证明 attention 是唯一可扩展方案。因此 claim 维持“主要可扩展主干之一”最符合证据范围。