LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

CommonCanvasCreative Commons 数据上的开放 T2I 扩散训练

一句话结论

CommonCanvas 证明约 67M 个明确允许衍生的 CC 图像配合 BLIP-2 synthetic captions,可以从头训练出在人类 PartiPrompts 偏好上接近 SD2 的 SD-style latent diffusion U-Net;贡献是数据 provenance、caption transfer 与训练系统,不是 DiT 或新 generation interface。

数据与许可

split图像数许可构成使用边界
CommonCatalog-C26,232,417CC-BY、CC-BY-SA可商业,但需 attribution;SA 有 share-alike
CommonCatalog-NC67,015,331C + CC-BY-NC、CC-BY-NC-SA包含 NC 内容,不能概括为可商用
ND evaluation约 30.6MCC-BY-ND、CC-BY-NC-ND不用于训练,只发布 BLIP-2 captions 供评测

作者按 YFCC100M Flickr IDs 重新抓取高分辨率原图,排除 ND。BLIP-2 OPT-2.7B 为全量图像生成 caption,耗约 1,120 A100-hours;captioning 用 512 crop,diffusion 训练用高分辨率图。

“只用 CC images”准确,但“所有组件只依赖 CC 数据”不准确:BLIP-2 和 OpenCLIP 都在 LAION 上预训练。论文的法律分析是论证,不是许可无风险结论。

Backbone 与接口

  • Small:与 SD2 同结构/参数命名的约 866M U-Net,SD2 VAE/tokenizer/OpenCLIP。
  • Large:约 2.567B SDXL U-Net,cross-attention 改配 SD2 text hidden size,并用 SDXL VAE。
  • 输入文本、输出图像;没有 editing、layout control、参考图条件或 any-to-any。
  • 全部是 latent diffusion U-Net,不是 DiT;Large 也只是更大的 U-Net。

训练成本

FlashAttention、latent precompute、fp16 norm、FSDP 与仅最后 50K steps 做 EMA,累计带来 2.71× speed-up。SD2 U-Net 单 run 成本表约为:

A100天数成本
8101.04$38.8K
3225.01$38.4K
1286.79$41.7K

约 19.4K–20.9K A100-hours/run。该表不是整个项目总成本,也没有分别披露所有 CommonCanvas final runs 和 Large 的总成本。

结果与消融

  • LAION 1.1B/90M/10M 子集在 MS COCO FID/KID/CLIP proxy 上接近,1M 开始发散,说明当前 SD2 U-Net 在这一协议下 10M–90M 已接近数据饱和。
  • BLIP-2 captions 在 FID/KID 上接近 LAION captions;CLIP-FID 结果随 COCO human-written 与 Conceptual Captions web-style domain 改变。
  • PartiPrompts 配对人评:S-C 约 37%、S-NC 约 38% 胜过 SD2;L-NC 与 SD2 差异不显著、约 50%。只有 Large 可称在该协议下“comparable”。
  • CommonCanvas 在 faces、general photography、paintings 等 Conceptual Captions 子域较弱。

证据边界

  • 支持开放许可 image-side provenance 能训练高质量 T2I;不证明完整供应链完全脱离 web scrape。
  • C/NC 同时改变规模与内容,不能把差异纯归因许可。
  • Large 只在 NC split 上训练,容量与数据 split 没有全因子交叉。
  • 对 iconic characters 的减少主要是定性例子,不是系统 copyright/memorization benchmark;仍能生成近似角色与名人。
  • YFCC 图像约十年前,时效性、覆盖与偏差有限;CC 许可仍附带 attribution/SA/NC 条款。

相关页面

备注

本库将 CommonCanvas 定位为 开放数据与训练透明度证据,已移除统一生成编辑实体和 DiT 暗示。