LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

ACT-Diffusion面向一步扩散模型的高效对抗一致性训练

一句话结论

ACT 在 consistency training 中加入时间条件判别器,以更小 batch、较小 DDPM U-Net 和更少训练 steps 获得更好的 1-NFE FID;这是训练新的一步模型,不是 training-free 采样器,且论文未报告总 wall-clock/GPU-hours,仍存在对抗训练 mode collapse。

论文定位

这是 one-step diffusion 的训练侧效率路线。它不通过 schedule 或 solver 减少现有模型的 NFE,而是训练新的 consistency generator,并在训练期额外引入 discriminator。

问题定义

作者将 CT loss 解释为生成分布与目标分布 Wasserstein 距离的上界;随时间点增加,该上界累积先前 consistency losses,导致小 batch/小模型更难压低误差。ACT 希望在每个时间点直接做 adversarial distribution matching。

方法概述

  • 保留 online consistency network 与 EMA target network。
  • 加入 $D(x,t)$ 与 JS-divergence 对抗代理。
  • 动态平衡 consistency loss 与 adversarial loss。
  • 用 gradient penalty 监控稳定性;ACT-Aug 据此自适应调整数据增强概率。
  • $\lambda_N=0$ 退化为 CT,过大则接近 GAN 并可能崩溃。

核心实验与结果

数据集CTACT推理
CIFAR-10BS 512,800K,73.9M,FID 8.7BS 80,300K,27.5M+14.1M,FID 6.01 NFE
ImageNet 64²BS 2048,800K,282M,FID 13.0BS 320,400K,107M+54M,FID 10.61 NFE
LSUN Cat 256²BS 2048,1000K,458M,FID 20.7BS 320,165K,113M+57M,FID 13.01 NFE

ImageNet 上 ACT 虽胜 CT,但仍明显落后 250-NFE ADM(FID 2.07)和 79-NFE EDM(2.44);CIFAR-10 也未超过强 GAN。论文证明的是 CT 内部的资源—质量改进,不是 one-step 已普遍胜出。

效率口径

  • NFE:ACT 与 CT 都是 1 NFE,主要增益不在继续缩短推理路径。
  • 训练 steps/batch:均显著降低。
  • 训练参数:需计入 discriminator;CIFAR/ImageNet/LSUN 分别约 41.6M/161M/170M。
  • 硬件:ACT 用 1×3090、4×A100、8×A100;论文引用 CT 为 8/64/64×A100。
  • 缺失:没有总 wall-clock、GPU-hours、训练 FLOPs、推理 latency/throughput。设备数不能直接当作精确加速倍数。

关键消融

  • ImageNet 在过大 $\lambda_N=0.3$ 时约 150K 开始不稳、170K 左右 collapse。
  • gradient penalty 上升与 CT loss/FID 恶化同步;ACT-Aug 只在 CIFAR-10 验证。
  • 判别器需要时间嵌入;DDPM+SiLU 在 Table 5 最好,ProjectedGAN/StyleGAN2 判别器并非更优。
  • 高 adversarial weight 可导致 mode collapse,新增了相对纯 CT 的训练风险。

局限或疑问

  • 对照同时改变 batch、模型规模、steps、判别器与增强,无法把全部收益归于单一项。
  • 大规模文本到图像、高分辨率、视频和编辑未测试。
  • ACT-Aug 在 ImageNet 等大数据集上尚未验证。
  • backbone 是 DDPM U-Net,与 DiT claim 无关,不应作为 DiT 默认化证据

对当前 Wiki 判断的影响

  • 直接支持 Diffusion Efficiency Engineering 中“one-step training 是独立效率层”。
  • 直接支持但范围有限:“相对原始 CT,可降低 batch/model/steps 并改善 FID”。
  • 对“一步扩散普遍优于多步 diffusion/GAN”不构成支持。
  • 对 DiT/backbone claim 为当前不应引用
  • DeepCache 的区别:ACT 付出训练预算;DeepCache 改既有模型推理。

原始链接

相关页面