一句话结论
RefereeBench 用 925 clips、6,475 QA、11 项运动和约 30 名认证裁判评测规则化判罚;最佳 closed/open 模型 overall 仅 61.09%/47.07%,且负例中严重 over-call,说明 benchmark 有价值,但 multiple-choice、broadcast shortcuts、API/帧预算差异和无 human baseline 限制部署结论。
数据与标注
- 5,410 原视频,经 ASR/字幕关键词产生 40,000+ proposals,人工筛为 925 clips;
- 11 项运动;平均 37.25 秒;64 foul types、34 penalty types;平均每 clip 1.55 temporal segments;
- 每 clip 固定 7 问:existence、foul/penalty classification、两类 reasoning、entity、temporal grounding;
- 约 30 名国家级认证裁判,每项至少 2 名;第二人独立核查,不一致由 senior referee adjudicate;QA 另做 peer review;
- 标注者 $12.50/hour,但无总工时/费用、初始 agreement、kappa 或 adjudication 比例;
- 视频声明限制为 CC BY-NC 4.0,实际逐条许可与发布状态仍需跟踪。
评测协议
所有模型同看完整 clip、720p、多选题直接匹配答案,不用 LLM judge。temperature 0.1/top-p 0.95,但帧预算从 1 fps、32、50、64、92、100 到 180 帧不等;API 与 open model 不是等算力比较。没有 train/test split,也未说明同比赛/incident/replay 去重或训练污染审计。
核心结果
- Closed overall:Doubao-Seed-1.8 61.09%,Gemini-3-Flash 60.55%,Gemini-3-Pro 60.02%,GPT-5 54.82%;
- Open:Qwen3-VL-8B 47.07%,InternVL3.5 41.82%,VideoLLaMA3 36.04%,LLaVA-Video 27.40%;
- Doubao Q1 existence 92.54%、Q6 entity 76.76%,但 reasoning/grounding 明显更低;
- Qwen3-VL existence/perception/reasoning/grounding 为 50.81/67.35/37.14/38.96%。
跨项目结果显示足球/冰球较易,羽毛球/水球较难。足球数字不得外推羽毛球。
关键压力测试
音频
Gemini frames 60.55%→video+audio 76.54%;Qwen3-Omni 48.97%→65.65%。但接口同时从 sampled frames 改为 direct video,且解说/哨声可能直接泄露判罚,因此不能把全部增益归因于纯声学理解。
规则知识
2,684 道 text referee exams:Gemini 69.3%,Qwen 53.7%;题目极偏 Rule Knowledge(2,372),Game Management/Execution 仅 101/211。
负样本与诱导
另收每项 20 个负例。中性设置 Gemini Q1/Q2/Q4 误判 37.7/63.6/57.7%;Qwen 在诱导设置 Q2/Q4 达 60.4/74.9%。模型会把合法接触 over-call 为犯规。
Prompt / RAG
Targeted prompting 57.9%,只比 zero-shot 56.7% 小幅提高。Q2–Q5 上 zero-shot 55.91%,Plain-RAG 53.92%,Hybrid-RAG 50.98%;加入 rulebook 不能补偿错误视觉前提,反而可能强化过度解释。
泄漏与证据边界
- 主 925 clips 来自 verified incidents,Q1 可能正例偏置;220 negatives 仅在附加压力测试;
- 用 Gemini-3-Flash text-only 筛题,之后又评同一模型 family,存在 construction coupling;
- 音频、解说、裁判手势和 replay 是真实证据,也可能形成 shortcut;
- 6,475 QA 来自 925 clips,不是 6,475 个独立事件;
- temporal grounding 是选项分类,不是连续 IoU/mAP;
- 无 human upper bound、校准、拒答、置信区间、API 成本/延迟;
- 无模型训练污染与 source-match grouping 审计;
- benchmark 不授权自动执法,仍需人类裁判和证据审计。
对羽毛球 demo 的影响
可迁移 存在→类型/处罚→理由→实体→时间证据 分层协议、负例与诱导测试。羽毛球子集包含 service fault 案例,但不证明羽毛球自动裁判或技术纠错;应重建羽毛球规则/基率/专家/时间精度,不能采用足球或 overall 数字。
证据评级
- 多运动裁判 benchmark:A-
- 当前 MLLM 可靠性审计:A-
- 规则 RAG:B(提供重要反例)
- 羽毛球迁移:C+ benchmark 协议邻近
原始材料
raw/ingest/2026-05-05-refereebench-multi-sport-referees/paper.pdf(15 页)raw/ingest/2026-05-05-refereebench-multi-sport-referees/paper-text.md(2,043 行)raw/ingest/2026-05-05-refereebench-multi-sport-referees/analysis.md