LLLMWIKI
ArticleResearch mapReading portalMetadata

Entity · Updated 2026-07-12

扩散 Transformer

概述

这一页对应 DiT(Diffusion Transformer)及其相近的 Transformer 风格扩散主干。当前证据把它定位为横跨图像与视频生成的主要可扩展架构之一:U-ViT 与 DiT 提供可行性和 scaling 依据,D²iT 与 Tora 展示直接改造,LinGen 和 DiffuSSM 则揭示 attention 复杂度与替代主干的边界。

这个实体为什么重要

  • 它同时出现在图像生成与视频生成两侧,是少数真正横跨多个 topic 的技术主干。
  • 它经常不是“被替换掉”的对象,而是“被继续扩展”的对象,说明社区把它当作可持续演进的平台。
  • 如果后续继续 ingest 新论文,很多方法都可以直接放到 DiT 这一条技术谱系里理解,而不必每次从头分类。

当前观察到的演化方向

从 ViT 可行到 DiT scaling 成立

图像侧:内部表示与算力分配优化

视频侧:控制与长时程扩展

工程生态的证据边界

Guidance 蒸馏、PTQ、plug-and-play guidance 与 self-guidance 说明 diffusion 范式拥有成熟工程生态。对应论文使用 U-Net、ADM、Stable Diffusion 或 GLIDE;它们适合作为 diffusion 工程背景,DiT 专属生态仍需在 DiT / MM-DiT / ST-DiT 主干上直接验证。

替代路线

全文核验后的量化锚点

  • U-ViT 可行性:ImageNet 256×256 FID 2.29,CIFAR-10 FID 3.11;长跳连是最关键结构,证明 ViT 去噪器可竞争,尚未形成严格 scaling law。
  • DiT scaling:12 个模型规模 × patch 配置中,前向 Gflops 与 FID-50K 的相关系数为 -0.93;ImageNet 256 CFG FID 2.27。证据严格限定于类条件 latent image generation。
  • DiffuSSM 反证:ImageNet 256 无 CFG FID 9.07,优于同表 DiT-XL/2 的 9.62;有 CFG 时为 2.28 vs 2.27。它以更低训练计算获得接近表现,512×512 仍落后 DiT。
  • LinGen 混合边界:512p 68s 下相对 DiT-4B 为 15× FLOPs、11.5× latency 加速;系统保留 DiT/flow-matching/text cross-attention 框架,并以 Mamba2 + 局部 attention 替换 global self-attention。
  • Tora 控制扩展:在 128 帧测试中 FVD 494、TrajError 11.72,优于同 OpenSora 底座的 DragNUWA 565/21.75;证明 ST-DiT 可承接轨迹控制,作者 benchmark 只有 185 clips。

这组证据支持“DiT 是重要平台与参照主干”,同时把三个概念分开:ViT/DiT backbone 可行性、计算 scaling、实际采用率。当前只前两项有直接论文证据,采用率仍需跨年份和任务统计。

这条实体现在意味着什么

现有证据说明 DiT 已经从单篇方法发展为可持续改造的主要架构谱系。平台性目前由三类材料共同支撑:

  • U-ViT 与 DiT 提供可行性和 scaling 依据;
  • D²iT 与 Tora 展示图像、视频侧的直接改造;
  • LinGen 与 DiffuSSM 标出纯 attention DiT 的效率边界和替代路线。

“整个生成领域的默认主干”仍需要采用率统计与 DiT 专属工程证据。

当前关系网络

证据

当前判断

当前最稳妥的定位是:DiT / Transformer 风格去噪器已经成为前沿图像与视频生成中的主要可扩展主干之一,并持续作为新架构的参照平台。

相关页面