一句话结论
论文把 T2I 人评设计成可审计实验:明确 fidelity/alignment 标签、AMT 资格、工资、IAA 与样本量;实验显示当时 FID/CLIPScore 可与人类排名冲突,小 prompt/rater 样本会翻转结论,但协议只覆盖自然图像与 AMT 人群。
协议与数据
- 单图+caption 的绝对 1–5 分;fidelity 从 AI-generated 到 real photo,alignment 用 discrepancy 数量定义中间档。
- 每图 3 ratings 后平均;AMT Masters;$0.05/task;每人最多 250。
- 37 篇审计中,20 篇有人评;只有 4 报每样本 rating 数、0 报 IAA、3 报 compensation。
- pilot 证明具体标签把 fidelity/alignment IAA 从 .18/.07 提到 .39/.26;Masters 组合达到 .53/.44。
模型、结果与成本
四模型:LAFITE、GLIDE lightweight、CogView2、SD1.4;不做 prompt engineering/候选筛选。
- COCO:1,000 captions、15,000 annotations、148 annotators、30h、IAA .41/.48。
- DrawBench:200 prompts、2,400、40 annotators、1.7h、IAA .13/.19。
- PartiPrompts:1,337、16,044、181 annotators、48h、IAA .21/.40。
- 直接 HIT payout(不含 pilot/平台费)约 $1,672.20;模型生成成本未报。
COCO 人评把 SD 评为生成模型最佳(fidelity/alignment 3.09/4.35),而 FID 把 CogView2 排在 SD 前;CLIPScore 给 LAFITE .82、real .76,与人类 alignment 相反,展示了 metric optimization 与人类偏好的错位。
样本量、judge 与污染
- 无 LLM judge;human 是最终 judge。公开 UI/template、IAA、工资与耗时是主要可复现优势。
- COCO 1,000 prompts 重采样 500 次显示小 $n$ 排名不稳;所需阈值依赖 effect size,不能把 >100 或 >500 当普适常数。
- 13 captions×60 raters 的重采样显示少 rater 可翻转 real vs SD;应报告显著性和 effect size。
- AMT Masters 标准不透明、平台专属;DrawBench IAA 仍低;无人口统计/层级随机效应模型。
- COCO/DrawBench/PartiPrompts 公开,模型污染未审计;LAFITE 优化 CLIP 再用 CLIPScore 评是明显评价泄漏。
任务边界与评级
只覆盖自然照片的 aggregate fidelity/alignment;不覆盖 aesthetics、bias、安全、文字、编辑 preservation 或视频时序。
证据评级:A-(评测方法学)(透明度和实证设计强;平台、人群、旧模型与两指标范围限制外推)。