LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

ReCo以坐标 token 和开放区域文本控制图像生成

一句话结论

ReCo 在 SD1.4/CLIP text encoder 中加入 1000 个坐标 token,把全图 caption 与任意区域自由文本放入同一序列;COCO AP 从 position-word 的 2.3 提到 32.0,说明数值位置 token 是有效控制接口,但同域 COCO 闭环、human judge 细节与训练成本不足。

接口、训练与数据

  • 输入全图 caption + 任意多个 [x1,y1,x2,y2] + region description;输出 512² 图。无源图,因此不是 image editing。
  • backbone 为 Stable Diffusion v1.4;同时微调 U-Net 与 CLIP text encoder,max length 616。
  • ReCoCOCO:COCO train 83K images/414K pairs;GIT 为 GT crop 生成区域 caption;20K steps、batch 2048、LR $10^{-4}$。
  • ReCoLAION:100K LAION-Aesthetics images,Detic 自动框+GIT caption,10K steps。
  • 无 GPU、wall-clock、GPU-hours、显存或参数量拆分。

评测与结果

  • COCO 30K:DETR AP/AP50、COCO crop classifier、SceneFID/FID。
  • PaintSkill:1,050 object、2,520 count、3,528 spatial prompts;human skill correctness + exact-region classifier。
  • LVIS:4,809 images/1,203 classes,测试开放词汇;不额外微调。

COCO ReCo:AP/AP50 32.0/52.4、object acc 62.42、SceneFID 6.51、FID 7.36;position-word 仅 2.3/7.5/42.02/15.54/8.82。PaintSkill human correctness 的 count/spatial 为 87.38/82.08。LVIS object acc 23.42、SceneFID 10.08、FID 17.73,优于 SD1.4,但可靠率仍低。

Judge、污染与公平性

  • PaintSkill 使用 human judges,但人数、每图票数、盲测、IAA/显著性未报告;其余为自动 evaluator,无 LLM judge。
  • DETR/ResNet 与训练数据同为 COCO,存在 ontology/evaluator 闭环;FID 不证明区域语义正确。
  • COCO train→val 合法但非 OOD;SD/CLIP/GIT 是否见过公开 COCO/LVIS 未审计。
  • guidance 4.0 用于控制、1.5 用于 FID SOTA 对比;不同表不能直接混读。
  • ReCoCOCO 明显偏 COCO 风格;继承 SD 偏差,复杂异常组合仍失败。

证据评级

B(接口与消融强,开放词汇有初步迁移;同域数据闭环、人评协议、成本和污染审计有限)。

原始链接

相关页面