LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

文本到图像生成的可验证与可复现人工评测

一句话结论

论文把 T2I 人评设计成可审计实验:明确 fidelity/alignment 标签、AMT 资格、工资、IAA 与样本量;实验显示当时 FID/CLIPScore 可与人类排名冲突,小 prompt/rater 样本会翻转结论,但协议只覆盖自然图像与 AMT 人群。

协议与数据

  • 单图+caption 的绝对 1–5 分;fidelity 从 AI-generated 到 real photo,alignment 用 discrepancy 数量定义中间档。
  • 每图 3 ratings 后平均;AMT Masters;$0.05/task;每人最多 250。
  • 37 篇审计中,20 篇有人评;只有 4 报每样本 rating 数、0 报 IAA、3 报 compensation。
  • pilot 证明具体标签把 fidelity/alignment IAA 从 .18/.07 提到 .39/.26;Masters 组合达到 .53/.44。

模型、结果与成本

四模型:LAFITE、GLIDE lightweight、CogView2、SD1.4;不做 prompt engineering/候选筛选。

  • COCO:1,000 captions、15,000 annotations、148 annotators、30h、IAA .41/.48。
  • DrawBench:200 prompts、2,400、40 annotators、1.7h、IAA .13/.19。
  • PartiPrompts:1,337、16,044、181 annotators、48h、IAA .21/.40。
  • 直接 HIT payout(不含 pilot/平台费)约 $1,672.20;模型生成成本未报。

COCO 人评把 SD 评为生成模型最佳(fidelity/alignment 3.09/4.35),而 FID 把 CogView2 排在 SD 前;CLIPScore 给 LAFITE .82、real .76,与人类 alignment 相反,展示了 metric optimization 与人类偏好的错位。

样本量、judge 与污染

  • 无 LLM judge;human 是最终 judge。公开 UI/template、IAA、工资与耗时是主要可复现优势。
  • COCO 1,000 prompts 重采样 500 次显示小 $n$ 排名不稳;所需阈值依赖 effect size,不能把 >100 或 >500 当普适常数。
  • 13 captions×60 raters 的重采样显示少 rater 可翻转 real vs SD;应报告显著性和 effect size。
  • AMT Masters 标准不透明、平台专属;DrawBench IAA 仍低;无人口统计/层级随机效应模型。
  • COCO/DrawBench/PartiPrompts 公开,模型污染未审计;LAFITE 优化 CLIP 再用 CLIPScore 评是明显评价泄漏。

任务边界与评级

只覆盖自然照片的 aggregate fidelity/alignment;不覆盖 aesthetics、bias、安全、文字、编辑 preservation 或视频时序。

证据评级:A-(评测方法学)(透明度和实证设计强;平台、人群、旧模型与两指标范围限制外推)。

原始链接

相关页面