LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Self-Guided Diffusion Models用自监督伪标注替代人工 guidance

一句话结论

论文用 DINO 聚类、LOST 框与 STEGO mask 为 U-Net/LDM 自动产生全图、框级、像素级条件;在多个数据集显著优于无 guidance,self-label 甚至优于 class label,但精细空间控制仍落后真值 box/mask,且这不是 DiT 主干证据。

问题定义

guided diffusion 往往依赖 class、box、mask 等人工 image-annotation pairs。论文要验证:冻结的自监督表征与无监督定位/分割器是否能自动构造有用条件,从而在不使用目标数据人工标签时训练 conditional diffusion。

方法概述

  • Self-labeled:DINO/MSN 等特征上做 k-means,cluster ID 作为全图条件。
  • Self-boxed:LOST 产生 class-agnostic box,并结合 cluster ID 注入空间条件。
  • Self-segmented:STEGO 产生 mask;mask 与 noisy input 拼接,并在低分辨率层使用条件 token/cross-attention。
  • 采样仍用 classifier-free guidance;conditional/unconditional 通过 batch 拼接减少实际前向次数。

实验设置

  • ImageNet32/64、CIFAR-100:DDIM 250 steps;FID/IS,附 precision/recall;ImageNet 完整训练 100 epochs,4×A5000,约 6 天。
  • ImageNet-100、LSUN-Churches 256:后者使用缩小版 latent diffusion(294M→108M)。
  • Pascal VOC、COCO20K:LOST box,64×64,800 epochs。
  • Pascal VOC、COCO-Stuff:STEGO mask,64×64,800/400 epochs。

核心结果

设置Ground truth guidanceNo guidanceSelf-guidance
ImageNet32 FID/IS9.2/19.014.3/10.87.3/20.3
ImageNet64 FID/IS16.8/18.636.1/10.412.1/23.1
ImageNet-100 256 FID/IS21.2/64.142.1/41.116.1/78.3
Pascal VOC box FIDGT box 13.258.6self-box 18.4
COCO20K box FIDGT box 9.642.5self-box 16.0
COCO-Stuff val mask FIDGT mask 11.234.1self-seg 17.7

Self-label 在这些设置中超过 class labels;但 self-box/self-seg 虽显著改善无 guidance,仍未达到真值空间标注。

关键消融

  • feature extractor:DINO ViT-B/16 在 ImageNet32 的 FID 19.35,优于 MAE 32.58 与 supervised ResNet/ViT 约 22;选择 DINO。
  • cluster 数:增加到 5,000 持续改善,FID 16.4、IS 10.35,优于 GT label 17.9/9.94;10,000 开始语义碎片化。
  • CIFAR-100 随机打乱 cluster assignments 后 FID 单调恶化,说明收益来自 pseudo-label 结构。
  • Pascal VOC self-box 的 k=21/50/100 FID 为 22.5/18.6/18.5,约 100 饱和。
  • balanced/unbalanced ImageNet32 上,相对 GT guidance 的最佳 FID 改善约 17.8%/18.7%。

局限或疑问

  • “annotation-free”只是不使用目标生成数据的人工标签;仍依赖预训练 DINO/LOST/STEGO 及其上游偏差。
  • cluster 不一定可自然语言描述,作者仍建议人工查看少量样本命名。
  • LOST 只验证 single-object;box/mask pseudo-label 质量形成明确上限。
  • 多数空间控制仅 64×64,常用 train FID;条件遵循主要靠质化图,跨分布泛化不足。
  • 训练与 250-step sampling 都很重,论文不是低延迟证据。

架构与 DiT 证据边界

  • 扩散去噪器:traditional U-Net。 高分辨率 Churches 使用的 latent diffusion 同样是 U-Net 系列。
  • DINO/ViT、LOST、STEGO 是 feature extractor / self-annotator,不是 diffusion backbone。
  • 因此它支持“自监督条件可降低 diffusion 控制的数据标注成本”,只能作为 topics/diffusion-models 的通用 controllability 背景;不能将 ViT 条件器误计为 DiT 采用证据。

原始链接

  • arXiv 论文页
  • PDF
  • 本地全文:raw/ingest/2026-04-16-self-guided-diffusion-models/paper-text.md
  • 本地深分析:raw/ingest/2026-04-16-self-guided-diffusion-models/analysis.md

相关页面