一句话结论
CommonCanvas 证明约 67M 个明确允许衍生的 CC 图像配合 BLIP-2 synthetic captions,可以从头训练出在人类 PartiPrompts 偏好上接近 SD2 的 SD-style latent diffusion U-Net;贡献是数据 provenance、caption transfer 与训练系统,不是 DiT 或新 generation interface。
数据与许可
| split | 图像数 | 许可构成 | 使用边界 |
|---|---|---|---|
| CommonCatalog-C | 26,232,417 | CC-BY、CC-BY-SA | 可商业,但需 attribution;SA 有 share-alike |
| CommonCatalog-NC | 67,015,331 | C + CC-BY-NC、CC-BY-NC-SA | 包含 NC 内容,不能概括为可商用 |
| ND evaluation | 约 30.6M | CC-BY-ND、CC-BY-NC-ND | 不用于训练,只发布 BLIP-2 captions 供评测 |
作者按 YFCC100M Flickr IDs 重新抓取高分辨率原图,排除 ND。BLIP-2 OPT-2.7B 为全量图像生成 caption,耗约 1,120 A100-hours;captioning 用 512 crop,diffusion 训练用高分辨率图。
“只用 CC images”准确,但“所有组件只依赖 CC 数据”不准确:BLIP-2 和 OpenCLIP 都在 LAION 上预训练。论文的法律分析是论证,不是许可无风险结论。
Backbone 与接口
- Small:与 SD2 同结构/参数命名的约 866M U-Net,SD2 VAE/tokenizer/OpenCLIP。
- Large:约 2.567B SDXL U-Net,cross-attention 改配 SD2 text hidden size,并用 SDXL VAE。
- 输入文本、输出图像;没有 editing、layout control、参考图条件或 any-to-any。
- 全部是 latent diffusion U-Net,不是 DiT;Large 也只是更大的 U-Net。
训练成本
FlashAttention、latent precompute、fp16 norm、FSDP 与仅最后 50K steps 做 EMA,累计带来 2.71× speed-up。SD2 U-Net 单 run 成本表约为:
| A100 | 天数 | 成本 |
|---|---|---|
| 8 | 101.04 | $38.8K |
| 32 | 25.01 | $38.4K |
| 128 | 6.79 | $41.7K |
约 19.4K–20.9K A100-hours/run。该表不是整个项目总成本,也没有分别披露所有 CommonCanvas final runs 和 Large 的总成本。
结果与消融
- LAION 1.1B/90M/10M 子集在 MS COCO FID/KID/CLIP proxy 上接近,1M 开始发散,说明当前 SD2 U-Net 在这一协议下 10M–90M 已接近数据饱和。
- BLIP-2 captions 在 FID/KID 上接近 LAION captions;CLIP-FID 结果随 COCO human-written 与 Conceptual Captions web-style domain 改变。
- PartiPrompts 配对人评:S-C 约 37%、S-NC 约 38% 胜过 SD2;L-NC 与 SD2 差异不显著、约 50%。只有 Large 可称在该协议下“comparable”。
- CommonCanvas 在 faces、general photography、paintings 等 Conceptual Captions 子域较弱。
证据边界
- 支持开放许可 image-side provenance 能训练高质量 T2I;不证明完整供应链完全脱离 web scrape。
- C/NC 同时改变规模与内容,不能把差异纯归因许可。
- Large 只在 NC split 上训练,容量与数据 split 没有全因子交叉。
- 对 iconic characters 的减少主要是定性例子,不是系统 copyright/memorization benchmark;仍能生成近似角色与名人。
- YFCC 图像约十年前,时效性、覆盖与偏差有限;CC 许可仍附带 attribution/SA/NC 条款。
相关页面
备注
本库将 CommonCanvas 定位为 开放数据与训练透明度证据,已移除统一生成编辑实体和 DiT 暗示。