LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

SANA-Sprint连续时间一致性与对抗蒸馏的一步线性 DiT

一句话结论

SANA-Sprint 把 SANA linear DiT 蒸馏为统一的 1–4 step student:A100、1024²、BF16、batch=1 下 one-step 端到端 latency 0.21s,H100 报约 0.1s、RTX 4090 报 0.31s;但它需要 32×A100 的两阶段训练,且 transformer-only 0.03s、端到端 0.21s 与不同 checkpoint 的 FID/GenEval 不能混为同一口径。

论文定位

它结合 trajectory-based sCM 与 distribution-based LADD:前者对齐 teacher 连续时间轨迹,后者用 teacher latent features 做对抗监督提升一步 fidelity。与每个步数单独训练的蒸馏不同,一个 SANA-Sprint checkpoint 支持 1/2/4 steps。

问题定义

one-step diffusion 的张力是:一致性模型在 <4 steps 时质量与语义易退化,而 GAN/VSD 路线训练不稳、显存高。论文要在 SANA backbone 上同时保持一步质量、训练稳定性和多步灵活性。

方法概述

  • 将预训练 flow-matching SANA 解析变换到 TrigFlow 参数化;该变换无需训练,但整个模型仍需蒸馏。
  • 用 dense timestep embedding 与 self/cross attention QK-Norm 抑制 >$10^3$ gradient norm 和 collapse。
  • 联合 sCM consistency loss 与 LADD latent adversarial loss,默认权重约 1:0.5。
  • 以 50% 概率在最大时间 $t=\pi/2$ 做对抗训练,强化 one/few-step。
  • backbone 是 SANA-1.5 路线的 0.6B/1.6B linear-attention DiT + deep autoencoder,不是普通 full-attention DiT。

核心实验与结果

训练/评测协议

  • 32×A100、4 DGX;teacher fine-tune 5K iterations(global batch 1024,lr 2e-5);distillation 20K(batch 512,lr 2e-6)。
  • MJHQ-30K:FID/CLIP;GenEval:553 prompts;1024×1024。
  • A100 Table 2:BF16;throughput batch=10,latency batch=1。

A100 端到端结果

  • SANA 0.6B teacher / 20 steps:0.9s,FID 5.81,GenEval 0.64。
  • Sprint 0.6B / 4 steps:0.32s,5.34 samples/s,FID 6.48,GenEval 0.76。
  • Sprint 0.6B / 2 steps:0.25s,6.46 samples/s,FID 6.54,GenEval 0.76。
  • Sprint 0.6B / 1 step:0.21s,7.22 samples/s,FID 7.04,GenEval 0.72
  • Sprint 1.6B / 1 step:0.21s,FID 7.69,GenEval 0.76。
  • FLUX-schnell 12B / 4 steps:2.10s,FID 7.94,GenEval 0.71。

多硬件口径

摘要/正文另报 H100 T2I 约 0.10s、ControlNet 0.20–0.25s、RTX 4090 T2I 0.31s。Figure 1 的 A100 0.03s 是 transformer-only one-step,另有约 0.12s VAE;不可把 0.03s 写成端到端生成时间。

关键消融

  • flow→TrigFlow 50-step FID 5.81→5.73、CLIP 28.810→28.806,支持变换近似无损。
  • 移除 schedule transform 后训练发散;dense time/QK-Norm 显著压低 gradient norm。
  • sCM-only:FID/CLIP 8.93/27.51;LADD-only 12.20/27.00;联合 8.11/28.02
  • CFG embedding:FID 9.23→8.72,CLIP 27.15→28.09。
  • max-time weighting 0%→50%:FID 9.44→8.32、CLIP 27.65→27.94。
  • 1/2/4 step 都做 inference timestep search,性能依赖部署前调优。

局限或疑问

  • “training-free”只指参数化变换;完整方案需要 32×A100、25K iterations,未报 GPU-hours/能耗。
  • 主要只在 SANA 验证;对 FLUX/SD3 的泛化是主张而非实验。
  • 1-step 相比 teacher/4-step 有 FID 退化;FID 与 GenEval 也有取舍。
  • 摘要 7.59/0.74 与 Table 2 的 one-step 7.04/0.72(0.6B)/7.69/0.76(1.6B)口径不同,应分别引用。
  • ControlNet 主要给可视化和 latency,缺结构保真量化。
  • 无人工偏好、文字渲染、安全与生产稳定性评测。

对当前 Wiki 判断的影响

  • Diffusion 效率工程:直接支持 one/few-step 蒸馏已达到亚秒 1024²,同时要求记录训练预算。
  • 图像生成:是强 speed-quality case,但收益混合 linear attention、深 VAE、小模型与蒸馏。
  • Diffusion Transformer:间接支持专门效率生态成熟,不证明标准 DiT 普遍最优。
  • 与 CCDF 不同:CCDF 是逆问题 warm-start,SANA-Sprint 是开放式 T2I 的重训练蒸馏。

证据评级

A-:真实多硬件 latency、训练协议、主表与组件消融较完整;边界是数字口径不完全一致、无正式 Limitations、跨 backbone 未验证及训练总成本未量化。

原始链接

相关页面