概述
这一页对应 DiT(Diffusion Transformer)及其相近的 Transformer 风格扩散主干。当前证据把它定位为横跨图像与视频生成的主要可扩展架构之一:U-ViT 与 DiT 提供可行性和 scaling 依据,D²iT 与 Tora 展示直接改造,LinGen 和 DiffuSSM 则揭示 attention 复杂度与替代主干的边界。
这个实体为什么重要
- 它同时出现在图像生成与视频生成两侧,是少数真正横跨多个 topic 的技术主干。
- 它经常不是“被替换掉”的对象,而是“被继续扩展”的对象,说明社区把它当作可持续演进的平台。
- 如果后续继续 ingest 新论文,很多方法都可以直接放到 DiT 这一条技术谱系里理解,而不必每次从头分类。
当前观察到的演化方向
从 ViT 可行到 DiT scaling 成立
- sources/2026-04-15-all-are-worth-words 代表把 ViT 直接变成扩散模型主干的早期基础节点。
- sources/2026-04-15-scalable-diffusion-models-with-transformers 代表 DiT 作为 canonical 架构被正式提出,并把 scaling 证据直接摆上台面。
图像侧:内部表示与算力分配优化
- sources/2026-04-12-d2it 代表在图像侧通过动态区域压缩改造 DiT 内部表示与算力分配。
视频侧:控制与长时程扩展
- sources/2026-04-12-tora 代表把轨迹条件和动作控制更深地注入 DiT 风格的视频生成框架。
- sources/2026-04-12-lingen 代表为长视频建模重构注意力机制,使 DiT 路线能覆盖更长时序。
工程生态的证据边界
Guidance 蒸馏、PTQ、plug-and-play guidance 与 self-guidance 说明 diffusion 范式拥有成熟工程生态。对应论文使用 U-Net、ADM、Stable Diffusion 或 GLIDE;它们适合作为 diffusion 工程背景,DiT 专属生态仍需在 DiT / MM-DiT / ST-DiT 主干上直接验证。
替代路线
- sources/2026-04-15-diffusion-models-without-attention 用 state-space backbone 替代 attention,并直接比较 DiT 的计算扩展性,构成重要架构边界。
全文核验后的量化锚点
- U-ViT 可行性:ImageNet 256×256 FID 2.29,CIFAR-10 FID 3.11;长跳连是最关键结构,证明 ViT 去噪器可竞争,尚未形成严格 scaling law。
- DiT scaling:12 个模型规模 × patch 配置中,前向 Gflops 与 FID-50K 的相关系数为 -0.93;ImageNet 256 CFG FID 2.27。证据严格限定于类条件 latent image generation。
- DiffuSSM 反证:ImageNet 256 无 CFG FID 9.07,优于同表 DiT-XL/2 的 9.62;有 CFG 时为 2.28 vs 2.27。它以更低训练计算获得接近表现,512×512 仍落后 DiT。
- LinGen 混合边界:512p 68s 下相对 DiT-4B 为 15× FLOPs、11.5× latency 加速;系统保留 DiT/flow-matching/text cross-attention 框架,并以 Mamba2 + 局部 attention 替换 global self-attention。
- Tora 控制扩展:在 128 帧测试中 FVD 494、TrajError 11.72,优于同 OpenSora 底座的 DragNUWA 565/21.75;证明 ST-DiT 可承接轨迹控制,作者 benchmark 只有 185 clips。
这组证据支持“DiT 是重要平台与参照主干”,同时把三个概念分开:ViT/DiT backbone 可行性、计算 scaling、实际采用率。当前只前两项有直接论文证据,采用率仍需跨年份和任务统计。
这条实体现在意味着什么
现有证据说明 DiT 已经从单篇方法发展为可持续改造的主要架构谱系。平台性目前由三类材料共同支撑:
- U-ViT 与 DiT 提供可行性和 scaling 依据;
- D²iT 与 Tora 展示图像、视频侧的直接改造;
- LinGen 与 DiffuSSM 标出纯 attention DiT 的效率边界和替代路线。
“整个生成领域的默认主干”仍需要采用率统计与 DiT 专属工程证据。
当前关系网络
- topics/diffusion-models 负责把它放进更大的扩散方法史里。
- topics/image-generation 与 topics/video-generation 分别展示它在图像与视频两侧的适配。
- claims/claim-dit-is-becoming-the-default-scalable-generation-backbone 负责持续跟踪 DiT 作为“主要可扩展主干之一”的证据强度与采用率边界。
证据
- sources/2026-04-15-all-are-worth-words
- sources/2026-04-15-scalable-diffusion-models-with-transformers
- sources/2026-04-12-d2it
- sources/2026-04-12-lingen
- sources/2026-04-12-tora
- sources/2026-04-15-diffusion-models-without-attention
当前判断
当前最稳妥的定位是:DiT / Transformer 风格去噪器已经成为前沿图像与视频生成中的主要可扩展主干之一,并持续作为新架构的参照平台。