LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Condition-Aware Neural Network以动态权重控制扩散 Transformer

一句话结论

CAN 根据 class/text 与 timestep 动态生成卷积/线性层增量权重,在 DiT、UViT 与 EfficientViT/CaT 上显著提升 FID—计算权衡;CaT-L0 在 ImageNet 512 达 FID 2.78、10G MAC/step,但开放 T2I 仅验证 COCO 256 从头训练,不能外推为编辑或统一图像模型。

问题定义

传统 adaptive normalization 或 attention 只在 feature space 注入条件,conv/linear 权重对所有条件固定,可能造成不同类别与 timestep 间负迁移。CAN 让部分层直接随条件改变权重。

方法概述

$$

y=(W+W_c(c))x.

$$

  • 条件包含 class/text embedding 与 diffusion timestep。
  • 只让 FFN depthwise conv、patch embedding 与 attention output projection condition-aware;后者共享条件权重生成器。
  • batch-specific kernel 通过 batch-to-channel + grouped convolution 实现。
  • 主 backbone 是 DiT/UViT diffusion transformer;CaT 将 CAN 与 EfficientViT 组合。

数据、指标与主结果

ImageNet 256/512 报 FID-50K、CLIP、MAC、参数;COCO 2014 从头训练,30K validation prompts 算 FID。

ImageNet 512 模型FID ↓MAC/step ↓steps
DiT-XL/23.04525G250
CAN UViT-S-Deep/44.0416G50
CaT-L02.7810G20
CaT-L12.4812G20

Orin fp16/TensorRT:DiT-XL/2 45.9s vs CaT-L0 0.2s;229× 差异同时混入 backbone、采样步数与 UniPC,不能全归因于 CAN。COCO 上 CaT-S0 FID 5.49/3G,近似 UViT-S-Deep 的 5.48/19G。

消融与成本

  • UViT-S/2 baseline 28.32 FID;DW conv 11.18;+patch 10.23;+output projection 8.82。
  • head/QKV/full MLP 动态化反而较差。
  • class-only 强于 timestep-only,二者合用最好。
  • CAN 可单独替代 DiT adaptive norm/UViT condition-token attention;组合效果依 backbone 而异。
  • A6000/PyTorch 实测训练 overhead 30%–40%,并非真正 negligible;总 GPU-hours 未报。

证据边界

  • 无人评、编辑、identity 或复杂 prompt 评测。
  • 主要证据来自 ImageNet class conditioning;大规模 T2I 被作者列为未来工作。
  • 参数量不总更小;效率优势主要是 MAC/step 与更短 sampler。
  • 动态权重对量化/部署的通用性仅有 Orin 单设备个案。

相关页面

归属边界

本文确有实质 DiT/UViT 证据,但主题是 conditional weight generation 与效率,不是 personalization、image editing 或 unified generation-editing。已移除旧 unified entity/question。

证据评估

A-(ImageNet)/B(开放 T2I):架构、消融与设备指标充分;文本生成规模有限,效率比较又混合多个变量。