一句话结论
PTQ4DM 用 timestep-aware 的 NDTC 校准,把 DDPM/DDIM 的 U-Net-like CNN 从 FP32 量化到 INT8;A6000 单次网络推理约 1.6–2.3× 加速,但多个设置仍有 FID 损失,不能概括成普遍“无损量化”,也不是 DiT 证据。
问题定义
扩散延迟有两个正交来源:采样步数多,以及每步噪声网络重。传统 fast sampler 只处理前者;普通 PTQ 又假设单一输入分布,而扩散网络激活随 timestep 大幅漂移,直接套用会校准失败。
方法概述
- 量化 convolution / fully connected 及网络输出相关操作,SiLU、softmax 保留全精度。
- NDTC 从偏向图像端但覆盖多个 timestep 的正态分布采样
t_i,沿全精度 reverse process 生成x_{t_i}校准样本。 - 用 MSE 选择 uniform quantization 的 scale 与 zero point;无需反向训练,实验用 1,024 个 calibration samples。
实验设置
- ImageNet 64×64、CIFAR-10 32×32。
- DDPM 4,000 steps;DDIM 100/250 steps。
- FP32→INT8;生成 10,000 张图,测 IS/FID/sFID。
- NVIDIA RTX A6000 上测噪声网络单次 inference latency,batch 1/16。
核心结果
| 设置 | FP32 | INT8 PTQ4DM | 结论 |
|---|---|---|---|
| ImageNet64 DDIM250, IS/FID/sFID | 14.88/21.63/17.66 | 15.88/23.96/17.67 | IS 升,但 FID 恶化 2.33 |
| ImageNet64 DDPM4000 | 15.93/20.82/17.42 | 15.28/23.64/17.29 | 混合结果 |
| CIFAR DDPM4000 | 9.28/7.14/17.09 | 9.55/7.10/17.02 | 最接近“全面持平/提升” |
| CIFAR DDIM100, FID | 10.05 | 14.18 | 明显损失 |
| CIFAR DDIM250, FID | 8.91 | 11.66 | 明显损失 |
A6000 latency:ImageNet64 batch1 9.80→4.99 ms、batch16 64.42→28.16 ms;CIFAR batch1 5.92→2.98 ms、batch16 23.15→14.13 ms。这是单步网络 latency,不是完整生成固定 2×。
关键消融
- 校准来源:noise FID 33.15、raw images 128.63、training-mimic 34.55;真实 reverse path 更匹配部署输入。
- timestep 覆盖:uniform multi-timestep FID 26.19;NDTC 24.26,优于单 timestep。
- metric:MSE FID 30.46,优于 cosine 34.81、KL 47.27、L1 100.52。
- timestep 分布:Poisson/Exponential 明显更差;正态分布的均值/方差很敏感,最佳列出 FID 23.96。
- 输出
mu/sigma/x_{t-1}的 INT8 敏感度较低,可扩大低比特覆盖。
局限或疑问
- 只验证 INT8;不能外推到 INT4/W4A8。
- 数据集低分辨率,未验证 Stable Diffusion、文生图、视频或大规模服务。
- “保持甚至提升”只适用于部分指标/设置;多个 FID 明显下降。
- calibration 仍需全精度反向过程生成 1,024 个样本;training-free 不等于零成本。
- 没有完整生成 wall-clock、显存、能耗或 NPU 实测。
架构与 DiT 证据边界
- 实际量化对象:U-Net-like CNN。 正文与图 2 都以 U-Net encoder/decoder、卷积层为噪声估计器。
- ViT 只出现在通用 PTQ 背景,不是本文 diffusion backbone。
- 因而该论文支持“扩散部署需要 timestep-aware calibration”和“单步压缩与采样步数压缩正交”,但不能支持 DiT 的采用率、scaling 或默认地位。DiT 的 attention/MLP 激活必须另做受控量化验证。
原始链接
- arXiv 论文页
- 官方代码
- 本地全文:
raw/ingest/2026-04-16-post-training-quantization-on-diffusion-models/paper-text.md - 本地深分析:
raw/ingest/2026-04-16-post-training-quantization-on-diffusion-models/analysis.md