一句话结论
DiffuSSM 用 gated bidirectional SSM 在全分辨率序列上建模长程依赖,只把高成本 MLP 放入 hourglass;它以更低训练 Gflops 在 ImageNet 256 上匹敌 DiT,是“attention/DiT 是唯一可扩展扩散主干”的有效反证。
论文定位
这篇论文不是一般提速技巧,而是 扩散模型 主干竞争的结构性对照。它证明 scaling 改善可以来自 state-space backbone,而非 Transformer attention 独占。
问题定义
高分辨率 self-attention 对序列长度呈平方复杂度。U-Net 通过低分辨率 attention,Transformer 通过 patchification 降 token,但都可能损失细节。论文目标是在不压缩全局序列表示的前提下处理长程依赖(PDF pp.1–2, 4)。
方法概述
- 图像/latent 展平为序列,使用 S4D 类双向 SSM,长卷积/FFT 复杂度约 $O(L\log L)$(PDF p.4)。
- 全长序列上运行 gated bidirectional SSM;仅在 position-wise MLP 分支用 $M=2$ hourglass 降长度(PDF p.4,Figure 2)。
- 估算默认层主导成本约 $7.5LD^2$;全长 attention 还会增加 $2DL^2$(PDF p.5)。
- 类标签、时间步和输出 decoder 尽量沿用 DiT recipe,以便主干比较(PDF p.5)。
实验设置
ImageNet 256/512 latent 序列长度分别为 1024/4096;DiffuSSM-XL 约 673M 参数、29 层、hidden 1152。FID-50K 使用 250 DDPM steps,另报 sFID、IS、Precision/Recall。训练使用 8×A100 80GB、global batch 256(PDF pp.5–6)。
核心实验与结果
| 设置 | DiffuSSM | DiT-XL/2 | 解释 |
|---|---|---|---|
| ImageNet 256,无 CFG | FID 9.07 / sFID 5.52 | 9.62 / 6.85 | PDF p.7,Table 1 |
| 训练总 Gflops | 1.85×10^11 | 2.13×10^11 | DiffuSSM 看 660M images,DiT 1792M |
| ImageNet 256,有 CFG | FID 2.28 / sFID 4.49 | 2.27 / 4.60 | FID 仅差 0.01;PDF p.7 |
| ImageNet 512,有 CFG | FID 3.41 / sFID 5.84 | 3.04 / 5.02 | DiffuSSM 仍落后,但训练更少;PDF p.7 |
512 设置下 DiffuSSM 看 302M images、总 Gflops 3.22×10^11;DiT 为 768M 与 4.03×10^11(PDF p.7,Table 1)。因此结论应是“更低预算下竞争”,不是“全面超过 DiT”。
LSUN Church/Bedroom FID 为 3.94/3.02,接近 LDM 4.02/2.95;论文明确不宣称击败最强 GAN(PDF p.8,Table 2)。
关键消融
- S/L/XL 规模增加在前 400K steps 持续改善 FID,说明 scaling 不是 attention 专属(PDF p.8,Figure 6 left)。
- P=2 patching 比默认无 patch 的 hourglass 方案更差,且差距随训练扩大;支持“全局表示压缩损失细节”的解释(PDF p.8,Figure 6 right)。
- 相同初始噪声的定性比较中,无 patching 的空间重建更稳(PDF p.8,Figure 5)。
局限或疑问
作者在 Conclusion 明示(PDF p.9):
- 只做(无)类条件图像生成,没有完整文本到图像。
- 未结合 masked image training 等可能增益。
- 视频、音频、3D 只是未来方向。
进一步边界:FLOPs 不等于真实硬件 latency;512×512 仍落后 DiT;强结果依赖 latent VAE 与 CFG;若完整 T2I 引入 cross-attention,“without attention”边界会改变。
对当前 Wiki 判断的影响
对 DiT / Transformer 主干 claim 的分类是:有效反证(针对排他性/默认唯一版本),也是修订后温和 claim 的边界证据。
它不否认 DiT 是主要路线之一,但要求 wiki 把结论写成“DiT 与 SSM/混合主干竞争”,而非“可扩展主干只剩 DiT”。