一句话结论
DeepCache 直接证明,U-Net diffusion 的相邻去噪步存在可利用的高层特征冗余:在单张 RTX 2080 上,Stable Diffusion v1.5 可在 CLIP 仅下降 0.05–0.07 时获得约 2.1–2.15×真实吞吐提升;但 7–10×高倍点伴随明显 FID 与细节退化,且方法依赖 U-Net skip-branch 结构,不能直接外推到 DiT。
论文定位
这是逐步结构效率而非 few-step sampler:它不减少 DDIM/PLMS 步数、不改模型权重、不重训,而是在每个 timestep 少执行一部分 U-Net。因而它可叠加 fast sampler,也与剪枝/蒸馏形成“运行时复用 vs 训练后压缩”的对照。
问题定义
扩散推理慢既来自采样链长,也来自每步完整执行重型 denoiser。DeepCache 问的是:相邻步高层 feature 变化很小时,能否复用旧 feature,只更新对细节更敏感的浅层路径?
方法概述
- 缓存某个 up block 的高层 feature;
- 下一步跳过中间深层 down/up blocks,只计算浅层 $D_m$;
- 将新低层 feature 与缓存高层 feature 拼接;
- 每隔 $N$ 步做一次 full inference,其余做 partial inference;
- 大 $N$ 时用 non-uniform schedule,在低相似区更频繁刷新缓存。
适用 backbone 是 DDPM、LDM-4-G 与 Stable Diffusion v1.5 的 U-Net;论文不是 DiT cache 工作。
核心实验与结果
协议
- DDPM:CIFAR-10 / LSUN,100-step DDIM;
- LDM-4-G:ImageNet 256²,250-step DDIM,50K samples;
- SD v1.5:PartiPrompts / COCO2017,512²,50-step PLMS;
- throughput:单张 RTX 2080;同时报告 average MACs/step。
量化发现
- SD v1.5 / PartiPrompts:0.230→0.494 samples/s(2.15×),CLIP 29.51→29.46;COCO 为 0.237→0.500(2.11×),CLIP 30.30→30.23。
- LDM-4-G / ImageNet:N=5 时 0.178→0.733 samples/s(4.12×),FID 3.37→3.59;N=10 为 6.96×但 FID 4.41,N=20 为 10.54×但 FID 8.23。
- CIFAR-10:N=2 为 1.40×、FID 4.16→4.35;N=5 为 1.85×、FID 5.73。
- LSUN 的真实加速只有约 1.29–1.48×,说明 skip-branch 算力占比决定上限。
关键消融
- 用零矩阵替代缓存时,CIFAR/LDM FID 恶化到 192.98/312.12,证明收益来自有效 feature 复用,不是盲目跳层。
- 在相同 full-model steps 下,浅层每步更新相对 DDIM 改善 FID 0.32–2.98。
- non-uniform schedule 在大 N 时优于均匀刷新,但仍不能消除质量损失。
- 不同 backbone 选择不同 skip branch(DDPM/LDM/SD 为 3/1/2),配置并不通用。
局限或疑问
- 作者明确承认最浅分支若已占约 50% 计算,则加速上限很低;大缓存间隔会显著掉质。
- “for free”只表示无需重训,不表示无缓存显存、集成、调参和质量成本。
- 硬件是 RTX 2080;现代 GPU、编译器、batch>1 与服务端端到端比例未验证。
- 仅覆盖 U-Net image diffusion,不覆盖 DiT/MMDiT、视频或复杂控制注入。
- 应优先引用高质量点的 2.1–4.1×,而不是脱离 FID 代价引用 7–10×最大值。
对当前 Wiki 判断的影响
- 对 Diffusion 效率工程:直接支持 cache/reuse 是独立于 few-step sampler 的路线。
- 对 扩散模型:直接支持 U-Net 逐步推理存在高层 temporal redundancy。
- 对 图像生成:提供可部署的训练免费优化案例。
- 对 DiT:仅作历史对照,不支持“DiT cache 成熟”或“DiT backbone 优胜”的结论。
证据评级
A-:多模型、多数据集、真实单卡吞吐、MACs 与消融齐全;边界是旧硬件、仅 U-Net,以及高倍点质量退化明显。