Sports-QA:专业体育视频的多尺度问答基准
来源:IJCV 2026
全文深读:analysis.md
一句话结论
Sports-QA 用 94,073 个模板化 QA pairs 评估描述、时间、因果和反事实体育问答;AFT accuracy/F1 为 59.2/25.6%,证明问题条件化时间尺度选择有小幅收益,也显示闭集专业问答仍受长尾答案、模板先验与时序理解限制。
数据集
- 94,073 QA pairs;
- 约 6K videos;
- 来源 MultiSports 与 FineGym;
- 篮球、足球、排球及多类体操;
- Split 60%/20%/20%;
- Questions:Description、Temporal、Causal、Counterfactual;
- 基于 action labels、attributes 和 templates 自动生成,再人工质控。
同一 sport 的视频随机分配,未明确 athlete、competition、original-video 或 broadcast grouping,存在来源泄漏风险。
Auto-Focus Transformer
- ResNet appearance + I3D motion features;
- 构造 global/local 多尺度 temporal representations;
- Auto-Focus Attention 根据 question 动态选择时间尺度;
- GloVe/BERT 和 LSTM/Transformer 编码问题;
- 输出闭集 answer class。
模型不输出支撑帧、action tube、自然语言解释或 calibrated confidence。
核心结果
| 方法 | Accuracy | F1 |
|---|---|---|
| BlindQA | 43.7 | 14.9 |
| HGA | 58.3 | 24.5 |
| HQGA | 57.9 | 25.0 |
| IGV | 58.5 | 24.8 |
| Baseline | 58.0 | 23.7 |
| AFT | 59.2 | 25.6 |
GloVe AFT 分项:Description 78.9、Temporal 35.3、Causal 55.1、Counterfactual 56.3。Temporal 是明显瓶颈。BERT AFT 为 59.1/25.4。
AFT 相对同作者 baseline 提升约 1.2 accuracy 与 1.5–1.9 F1,支持多尺度 focus,同时增益幅度有限。BlindQA 仍达 43.7 accuracy,说明 question-only priors 存在。
证据边界
- QA 语言主要由模板生成;
- 因果/反事实来自预定义规则关系;
- Random video split 未证明身份与源视频隔离;
- 闭集分类不评解释、证据引用与拒答;
- Macro-F1 约 25%,长尾答案仍弱;
- 不含最新长视频 MLLM;
- 未报告 human upper bound、校准、GPU-hours 和 latency;
- 不提供 pose、shuttle、racket、contact 或质量分。
对羽毛球 demo 的影响
可借用四类 query taxonomy 与 question-conditioned multi-scale context。羽毛球 QA 应建立在结构化 evidence 上,例如 contact frame、phase、pose 与 trajectory;回答必须回链证据。Question-only baseline 应用于检测模板泄漏。
建议层级:
structured evidence → temporal retrieval → constrained QA/NLG
Sports-QA 不能直接作为教练纠错或裁判能力证据。
证据评级
- 体育 VideoQA benchmark:A-
- 多尺度时间选择:B+
- 因果/反事实:B-(模板定义)
- 羽毛球纠错:C+
原始材料
raw/ingest/2026-05-05-sports-qa-video-question-answering/paper.pdf(19 页)raw/ingest/2026-05-05-sports-qa-video-question-answering/paper-text.md(2,770 行)raw/ingest/2026-05-05-sports-qa-video-question-answering/analysis.md