一句话结论
ReCo 在 SD1.4/CLIP text encoder 中加入 1000 个坐标 token,把全图 caption 与任意区域自由文本放入同一序列;COCO AP 从 position-word 的 2.3 提到 32.0,说明数值位置 token 是有效控制接口,但同域 COCO 闭环、human judge 细节与训练成本不足。
接口、训练与数据
- 输入全图 caption + 任意多个
[x1,y1,x2,y2] + region description;输出 512² 图。无源图,因此不是 image editing。 - backbone 为 Stable Diffusion v1.4;同时微调 U-Net 与 CLIP text encoder,max length 616。
- ReCoCOCO:COCO train 83K images/414K pairs;GIT 为 GT crop 生成区域 caption;20K steps、batch 2048、LR $10^{-4}$。
- ReCoLAION:100K LAION-Aesthetics images,Detic 自动框+GIT caption,10K steps。
- 无 GPU、wall-clock、GPU-hours、显存或参数量拆分。
评测与结果
- COCO 30K:DETR AP/AP50、COCO crop classifier、SceneFID/FID。
- PaintSkill:1,050 object、2,520 count、3,528 spatial prompts;human skill correctness + exact-region classifier。
- LVIS:4,809 images/1,203 classes,测试开放词汇;不额外微调。
COCO ReCo:AP/AP50 32.0/52.4、object acc 62.42、SceneFID 6.51、FID 7.36;position-word 仅 2.3/7.5/42.02/15.54/8.82。PaintSkill human correctness 的 count/spatial 为 87.38/82.08。LVIS object acc 23.42、SceneFID 10.08、FID 17.73,优于 SD1.4,但可靠率仍低。
Judge、污染与公平性
- PaintSkill 使用 human judges,但人数、每图票数、盲测、IAA/显著性未报告;其余为自动 evaluator,无 LLM judge。
- DETR/ResNet 与训练数据同为 COCO,存在 ontology/evaluator 闭环;FID 不证明区域语义正确。
- COCO train→val 合法但非 OOD;SD/CLIP/GIT 是否见过公开 COCO/LVIS 未审计。
- guidance 4.0 用于控制、1.5 用于 FID SOTA 对比;不同表不能直接混读。
- ReCoCOCO 明显偏 COCO 风格;继承 SD 偏差,复杂异常组合仍失败。
证据评级
B(接口与消融强,开放词汇有初步迁移;同域数据闭环、人评协议、成本和污染审计有限)。