LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

RefereeBench多运动项目规则化视频裁判评测

一句话结论

RefereeBench 用 925 clips、6,475 QA、11 项运动和约 30 名认证裁判评测规则化判罚;最佳 closed/open 模型 overall 仅 61.09%/47.07%,且负例中严重 over-call,说明 benchmark 有价值,但 multiple-choice、broadcast shortcuts、API/帧预算差异和无 human baseline 限制部署结论。

数据与标注

  • 5,410 原视频,经 ASR/字幕关键词产生 40,000+ proposals,人工筛为 925 clips;
  • 11 项运动;平均 37.25 秒;64 foul types、34 penalty types;平均每 clip 1.55 temporal segments;
  • 每 clip 固定 7 问:existence、foul/penalty classification、两类 reasoning、entity、temporal grounding;
  • 约 30 名国家级认证裁判,每项至少 2 名;第二人独立核查,不一致由 senior referee adjudicate;QA 另做 peer review;
  • 标注者 $12.50/hour,但无总工时/费用、初始 agreement、kappa 或 adjudication 比例;
  • 视频声明限制为 CC BY-NC 4.0,实际逐条许可与发布状态仍需跟踪。

评测协议

所有模型同看完整 clip、720p、多选题直接匹配答案,不用 LLM judge。temperature 0.1/top-p 0.95,但帧预算从 1 fps、32、50、64、92、100 到 180 帧不等;API 与 open model 不是等算力比较。没有 train/test split,也未说明同比赛/incident/replay 去重或训练污染审计。

核心结果

  • Closed overall:Doubao-Seed-1.8 61.09%,Gemini-3-Flash 60.55%,Gemini-3-Pro 60.02%,GPT-5 54.82%;
  • Open:Qwen3-VL-8B 47.07%,InternVL3.5 41.82%,VideoLLaMA3 36.04%,LLaVA-Video 27.40%;
  • Doubao Q1 existence 92.54%、Q6 entity 76.76%,但 reasoning/grounding 明显更低;
  • Qwen3-VL existence/perception/reasoning/grounding 为 50.81/67.35/37.14/38.96%。

跨项目结果显示足球/冰球较易,羽毛球/水球较难。足球数字不得外推羽毛球。

关键压力测试

音频

Gemini frames 60.55%→video+audio 76.54%;Qwen3-Omni 48.97%→65.65%。但接口同时从 sampled frames 改为 direct video,且解说/哨声可能直接泄露判罚,因此不能把全部增益归因于纯声学理解。

规则知识

2,684 道 text referee exams:Gemini 69.3%,Qwen 53.7%;题目极偏 Rule Knowledge(2,372),Game Management/Execution 仅 101/211。

负样本与诱导

另收每项 20 个负例。中性设置 Gemini Q1/Q2/Q4 误判 37.7/63.6/57.7%;Qwen 在诱导设置 Q2/Q4 达 60.4/74.9%。模型会把合法接触 over-call 为犯规。

Prompt / RAG

Targeted prompting 57.9%,只比 zero-shot 56.7% 小幅提高。Q2–Q5 上 zero-shot 55.91%,Plain-RAG 53.92%,Hybrid-RAG 50.98%;加入 rulebook 不能补偿错误视觉前提,反而可能强化过度解释。

泄漏与证据边界

  • 主 925 clips 来自 verified incidents,Q1 可能正例偏置;220 negatives 仅在附加压力测试;
  • 用 Gemini-3-Flash text-only 筛题,之后又评同一模型 family,存在 construction coupling;
  • 音频、解说、裁判手势和 replay 是真实证据,也可能形成 shortcut;
  • 6,475 QA 来自 925 clips,不是 6,475 个独立事件;
  • temporal grounding 是选项分类,不是连续 IoU/mAP;
  • 无 human upper bound、校准、拒答、置信区间、API 成本/延迟;
  • 无模型训练污染与 source-match grouping 审计;
  • benchmark 不授权自动执法,仍需人类裁判和证据审计。

对羽毛球 demo 的影响

可迁移 存在→类型/处罚→理由→实体→时间证据 分层协议、负例与诱导测试。羽毛球子集包含 service fault 案例,但不证明羽毛球自动裁判或技术纠错;应重建羽毛球规则/基率/专家/时间精度,不能采用足球或 overall 数字。

证据评级

  • 多运动裁判 benchmark:A-
  • 当前 MLLM 可靠性审计:A-
  • 规则 RAG:B(提供重要反例)
  • 羽毛球迁移:C+ benchmark 协议邻近

原始材料

  • raw/ingest/2026-05-05-refereebench-multi-sport-referees/paper.pdf(15 页)
  • raw/ingest/2026-05-05-refereebench-multi-sport-referees/paper-text.md(2,043 行)
  • raw/ingest/2026-05-05-refereebench-multi-sport-referees/analysis.md

相关页面