一句话结论
GOC 的核心贡献不是再制造一份 2× 加速,而是在 FORA/L2C 已跳 block 的相同 FLOPs 下,用跨 timestep feature 差分和统计选择器把缓存质量拉回:50% FORA 的 FID 6.857→3.907,A40 latency 仅增加约 2%;但仍差于 No Cache 的 3.484,且 2× 来自 FORA 缓存比例本身。
论文定位
这是 DiT cache error correction。FORA/Δ-DiT/L2C 决定缓存或跳过哪些 attention/MLP block;GOC 利用最近两次真实 feature 的数值差分预测下一步,并避开方向反转位置。它是缓存器上的插件,不是新 backbone,也不是独立 sampler。
问题定义
DiT 各层 token 形状不变,便于跨 timestep 复用,但简单直接复用会累计 feature drift。缓存超过 50% blocks 时,几何结构、纹理和 FID 明显恶化。论文要用几乎零额外 FLOPs 修复这一误差。
方法概述
- Gradient Cache:保存最近两次完整计算的 $g_{t-1}^l,g_t^l$,外推 $\hat g_{t+1}^l=g_t^l+\eta(g_t^l-g_{t-1}^l)$;这里的 gradient 是时间有限差分,不是反向传播。
- Model statistics:在校准 prompts 上统计每层每步 feature,计算方向反转 block 数 $N(t)$。
- GOD selector:将 $N(t)$ 与 step 位置组合为 $B(t)$,只在阈值允许时使用外推,避免后期错误与反向差分。
核心实验与结果
协议
- DiT + DDIM 20 steps:ImageNet 256²,50K samples;
- PixArt-α + DPM-Solver 20 steps:MS-COCO,30K prompts;
- 单张 NVIDIA A40;指标为 IS/FID/sFID/Precision/Recall;
- 每份 cache 最多复用一次;FORA 25%/50%,L2C 22%。
ImageNet / DiT
- No Cache:11.868T FLOPs,FID 3.484,IS 223.490。
- FORA 50%:5.934T、2.0000×,FID 6.857;+GOC:相同 5.934T/1.9999×,FID 3.907、IS 216.280。
- FORA 25%:FID 3.870;+GOC 3.524。
- L2C 22%:FID 3.539;+GOC 3.192,但 Recall 0.563→0.559,不能说所有指标都提升。
真实 A40 latency
- FORA 50%:1.789±0.046s;+GOC 1.824±0.029s(约 +2.0%)。
- FORA 25%:2.271±0.032s;+GOC 2.305±0.016s(约 +1.5%)。
- L2C 22%:1.992±0.011s;+GOC 2.016±0.004s(约 +1.2%)。
Table 5 没有 No-Cache latency,所以 wall-clock 2×并未在同表闭环验证。
PixArt / COCO
25% FORA 的 FID 21.984,+GOC 21.971,No Cache 21.964。可移植性成立,但增益仅 0.013,远弱于 ImageNet。
关键消融
- GC 累积到 step 17 后出现 artifacts 和 IS/Precision 暴跌,证明不能无选择外推。
- FORA+GC 50% 的 FID 3.964;GOD 选择后 3.907,但 Recall 从 0.593 降到 0.574,仍是指标折中。
- η 随策略变化:50% FORA/25% FORA/L2C 22% 最佳约 1.2/1.9/1.0。
- 同时适用于 rule-based FORA 与 training-based L2C,是插件性主要证据。
局限或疑问
- 作者承认固定参数和 bounded steps 限制通用性。
- 每 cache 只复用一次,未覆盖长间隔、递归缓存或视频。
- 统计选择器和 η 依模型/策略 calibration,不是无调参方案。
- 摘要“IS +26.3%、FID -43% compared to baseline DiT”与 Table 1 内部不一致:FID 6.857→3.907 相对 50% FORA 约降 43%,但 IS 190.056→216.280 只升约 13.8%;相对 No Cache DiT(223.490/3.484)两项都未改善,故不能直接引用摘要百分比。
- 只有 256²、20 steps、A40;无高分辨率、显存/能耗或服务端 batch 协议。
对当前 Wiki 判断的影响
- 对 Diffusion 效率工程:直接支持 DiT cache 已进入误差建模与修正阶段。
- 对 Diffusion Transformer:间接支持 DiT 已形成专门工程生态,不直接证明 backbone 优势。
- 对 图像生成:是 ImageNet 强、PixArt/COCO 弱的限定案例。
- 不应再写成“梯度缓存进一步压缩推理成本”;准确说法是“在相同缓存成本下恢复质量”。
证据评级
B+:FLOPs、A40 latency、多个 cache ratio 和基础缓存器齐全;但 PixArt 增益极小、缺 No-Cache latency、每次只复用一次,且摘要比较对象容易误导。