一句话结论
CAN 根据 class/text 与 timestep 动态生成卷积/线性层增量权重,在 DiT、UViT 与 EfficientViT/CaT 上显著提升 FID—计算权衡;CaT-L0 在 ImageNet 512 达 FID 2.78、10G MAC/step,但开放 T2I 仅验证 COCO 256 从头训练,不能外推为编辑或统一图像模型。
问题定义
传统 adaptive normalization 或 attention 只在 feature space 注入条件,conv/linear 权重对所有条件固定,可能造成不同类别与 timestep 间负迁移。CAN 让部分层直接随条件改变权重。
方法概述
$$
y=(W+W_c(c))x.
$$
- 条件包含 class/text embedding 与 diffusion timestep。
- 只让 FFN depthwise conv、patch embedding 与 attention output projection condition-aware;后者共享条件权重生成器。
- batch-specific kernel 通过 batch-to-channel + grouped convolution 实现。
- 主 backbone 是 DiT/UViT diffusion transformer;CaT 将 CAN 与 EfficientViT 组合。
数据、指标与主结果
ImageNet 256/512 报 FID-50K、CLIP、MAC、参数;COCO 2014 从头训练,30K validation prompts 算 FID。
| ImageNet 512 模型 | FID ↓ | MAC/step ↓ | steps |
|---|---|---|---|
| DiT-XL/2 | 3.04 | 525G | 250 |
| CAN UViT-S-Deep/4 | 4.04 | 16G | 50 |
| CaT-L0 | 2.78 | 10G | 20 |
| CaT-L1 | 2.48 | 12G | 20 |
Orin fp16/TensorRT:DiT-XL/2 45.9s vs CaT-L0 0.2s;229× 差异同时混入 backbone、采样步数与 UniPC,不能全归因于 CAN。COCO 上 CaT-S0 FID 5.49/3G,近似 UViT-S-Deep 的 5.48/19G。
消融与成本
- UViT-S/2 baseline 28.32 FID;DW conv 11.18;+patch 10.23;+output projection 8.82。
- head/QKV/full MLP 动态化反而较差。
- class-only 强于 timestep-only,二者合用最好。
- CAN 可单独替代 DiT adaptive norm/UViT condition-token attention;组合效果依 backbone 而异。
- A6000/PyTorch 实测训练 overhead 30%–40%,并非真正 negligible;总 GPU-hours 未报。
证据边界
- 无人评、编辑、identity 或复杂 prompt 评测。
- 主要证据来自 ImageNet class conditioning;大规模 T2I 被作者列为未来工作。
- 参数量不总更小;效率优势主要是 MAC/step 与更短 sampler。
- 动态权重对量化/部署的通用性仅有 Orin 单设备个案。
相关页面
归属边界
本文确有实质 DiT/UViT 证据,但主题是 conditional weight generation 与效率,不是 personalization、image editing 或 unified generation-editing。已移除旧 unified entity/question。
证据评估
A-(ImageNet)/B(开放 T2I):架构、消融与设备指标充分;文本生成规模有限,效率比较又混合多个变量。