LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

DeepCache用高层特征缓存免费加速 U-Net 扩散模型

一句话结论

DeepCache 直接证明,U-Net diffusion 的相邻去噪步存在可利用的高层特征冗余:在单张 RTX 2080 上,Stable Diffusion v1.5 可在 CLIP 仅下降 0.05–0.07 时获得约 2.1–2.15×真实吞吐提升;但 7–10×高倍点伴随明显 FID 与细节退化,且方法依赖 U-Net skip-branch 结构,不能直接外推到 DiT。

论文定位

这是逐步结构效率而非 few-step sampler:它不减少 DDIM/PLMS 步数、不改模型权重、不重训,而是在每个 timestep 少执行一部分 U-Net。因而它可叠加 fast sampler,也与剪枝/蒸馏形成“运行时复用 vs 训练后压缩”的对照。

问题定义

扩散推理慢既来自采样链长,也来自每步完整执行重型 denoiser。DeepCache 问的是:相邻步高层 feature 变化很小时,能否复用旧 feature,只更新对细节更敏感的浅层路径?

方法概述

  • 缓存某个 up block 的高层 feature;
  • 下一步跳过中间深层 down/up blocks,只计算浅层 $D_m$;
  • 将新低层 feature 与缓存高层 feature 拼接;
  • 每隔 $N$ 步做一次 full inference,其余做 partial inference;
  • 大 $N$ 时用 non-uniform schedule,在低相似区更频繁刷新缓存。

适用 backbone 是 DDPM、LDM-4-G 与 Stable Diffusion v1.5 的 U-Net;论文不是 DiT cache 工作。

核心实验与结果

协议

  • DDPM:CIFAR-10 / LSUN,100-step DDIM;
  • LDM-4-G:ImageNet 256²,250-step DDIM,50K samples;
  • SD v1.5:PartiPrompts / COCO2017,512²,50-step PLMS;
  • throughput:单张 RTX 2080;同时报告 average MACs/step。

量化发现

  • SD v1.5 / PartiPrompts:0.230→0.494 samples/s(2.15×),CLIP 29.51→29.46;COCO 为 0.237→0.500(2.11×),CLIP 30.30→30.23。
  • LDM-4-G / ImageNet:N=5 时 0.178→0.733 samples/s(4.12×),FID 3.37→3.59;N=10 为 6.96×但 FID 4.41,N=20 为 10.54×但 FID 8.23。
  • CIFAR-10:N=2 为 1.40×、FID 4.16→4.35;N=5 为 1.85×、FID 5.73。
  • LSUN 的真实加速只有约 1.29–1.48×,说明 skip-branch 算力占比决定上限。

关键消融

  • 用零矩阵替代缓存时,CIFAR/LDM FID 恶化到 192.98/312.12,证明收益来自有效 feature 复用,不是盲目跳层。
  • 在相同 full-model steps 下,浅层每步更新相对 DDIM 改善 FID 0.32–2.98。
  • non-uniform schedule 在大 N 时优于均匀刷新,但仍不能消除质量损失。
  • 不同 backbone 选择不同 skip branch(DDPM/LDM/SD 为 3/1/2),配置并不通用。

局限或疑问

  • 作者明确承认最浅分支若已占约 50% 计算,则加速上限很低;大缓存间隔会显著掉质。
  • “for free”只表示无需重训,不表示无缓存显存、集成、调参和质量成本。
  • 硬件是 RTX 2080;现代 GPU、编译器、batch>1 与服务端端到端比例未验证。
  • 仅覆盖 U-Net image diffusion,不覆盖 DiT/MMDiT、视频或复杂控制注入。
  • 应优先引用高质量点的 2.1–4.1×,而不是脱离 FID 代价引用 7–10×最大值。

对当前 Wiki 判断的影响

  • Diffusion 效率工程:直接支持 cache/reuse 是独立于 few-step sampler 的路线。
  • 扩散模型:直接支持 U-Net 逐步推理存在高层 temporal redundancy。
  • 图像生成:提供可部署的训练免费优化案例。
  • 对 DiT:仅作历史对照,不支持“DiT cache 成熟”或“DiT backbone 优胜”的结论。

证据评级

A-:多模型、多数据集、真实单卡吞吐、MACs 与消融齐全;边界是旧硬件、仅 U-Net,以及高倍点质量退化明显。

原始链接

相关页面