LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

SportsHHI体育视频中的高层人—人交互检测基准

一句话结论

SportsHHI 把体育理解从“跟住谁”推进到“哪两个人正在发生何种高层交互”:它以有方向的人对三元组显式标注篮球/排球中的技术动作、配合和对抗,并证明运动、相对位置及多人上下文都不可缺少;但它仍是关键帧级关系检测,不等于整场战术推理。

论文定位

这是视频人—人交互检测(HHI) benchmark,不是 MOT 数据集。它位于跟踪和高层比赛理解之间:

  • 相比 AVA/MultiSports 的单人动作标签,显式标出具体人对;
  • 相比 AG/VidVRD 的通用关系,双方都为人,不能依赖对象类别先验;
  • 相比 group activity recognition,不给整段视频一个群体标签,而是定位具体参与者与有方向的关系。

因此它直接补强 体育 AI 视频理解 的 interaction layer,对 视频理解 则是细粒度关系检测案例。

问题定义

每个实例写作 $\langle S,I,O\rangle$:主体人体框、交互类别、客体人体框。论文区分:

  • HHICls:使用 GT 人体框,只评交互分类;
  • HHIDet:从视频与检测框完成定位和分类。

主体框与客体框都需和对应 GT 达到 IoU $>0.5$ 且类别正确才算真阳性。

数据集与协议

项目规模/设置
视频篮球 80 段、排球 80 段,来自 MultiSports;720p、25 FPS,平均 603 帧
标注频率5 FPS 关键帧
总规模11,398 帧、118,075 人体框、50,649 交互实例
类别34 类:篮球 16、排球 18
场景密度平均每帧 10.36 人
train/val38,527 实例/8,719 帧;12,122 实例/2,679 帧
主评测类别两个 split 都至少 10 个实例的 28 类;排除参与者不可见实例

交互由专业运动员或资深爱好者双人重复标注,分歧由 meta-annotator 仲裁。类别分布近似 Zipf 长尾;人多但高层交互稀疏,且两人可能相距很远或严重重叠。

方法概述

两阶段 baseline 先用离线检测器得到 $N$ 个人体框并枚举 $N(N-1)$ 个有序人对,再融合:

  1. 主体和客体的视频 RoI 运动特征;
  2. 两人 union box 上下文;
  3. 两张独立空间 mask 的相对位置编码;
  4. 所有 proposal 之间的多头自注意力。

训练使用全部正 proposal 与采样负例,最佳正负比为 1:10。

核心实验与结果

指标为 mAP 与 Recall@20/50/100/150。

  • 最强 ViT-B baseline:HHICls mAP 10.69、R@50 68.13;HHIDet mAP 4.93、R@50 42.99
  • 同为 SlowFast-R50 时,作者 baseline 的 HHICls mAP 7.52,优于 SlowFast 5.00 与 ACARN 5.44;说明位置与人对上下文在动作特征之外有增益。
  • 人体框 [email protected]98.6、交互 proposal [email protected]98.4,但 IoU 0.9 时降到 58.2/37.7;精确定位仍会限制完整 HHIDet。
  • HHIDet 显著低于 HHICls,说明检测误差会向关系判断传导。

关键消融

  • 运动、上下文、位置三类特征全开并交换 proposal 信息:mAP 7.52;只用运动且无交换:5.00
  • 分离 subject/object mask 优于单 mask:7.52 vs 6.77 mAP,验证有向角色顺序重要。
  • MHSA 在不同特征组合下总体都有增益。
  • 1:10 正负比最佳;背景过多会淹没优化。
  • 错误分析中,无真实交互的人对假阳性很常见,定位与分类错误也经常共现。

计算与复现边界

检测器为 ResNeXt-101-FPN Faster R-CNN;主视频 backbone 为 Kinetics-400 预训练 SlowFast-R50,batch 8、20 epochs。论文没有报告 GPU、训练时长、参数量、FLOPs 或吞吐,不能据此判断部署成本。枚举人对的 proposal 数为 $O(N^2)$。

局限或疑问

  • 仅篮球与排球;作者因实例稀疏和失衡而排除足球。
  • 主任务是 5 FPS 关键帧级检测;person ID 可连接 tube,但没有 tube-level benchmark 结果。
  • 34 类只有 28 类进入主评测,长尾类未被充分验证。
  • 不可见参与者被排除,off-screen interaction 未覆盖。
  • mAP 低说明任务困难,但不能据此把局部关系检测外推为完整战术理解。

对羽毛球与体育路线的价值

  • 双打羽毛球人—人关系有中等直接价值:任务形式、标注流程和有向人对建模可迁移。
  • 单打价值较间接:两人关系简单,瓶颈更可能是小球、击球时刻和动作细粒度。
  • 不直接覆盖 shuttlecock 轨迹、球拍、击球质量、姿态纠错或回合因果。

与同批工作的边界

  • SportsMOT / TeamTrack 解决身份连续与轨迹,是 HHI 的上游,但不输出交互语义。
  • TranSPORTmer 用坐标轨迹做预测/补全/状态分类,可提供长期运动上下文,却不输出 SportsHHI 的人对类别。

对当前 Wiki 判断的影响

直接支持“体育视频理解不能停在 tracking,还需要显式 interaction layer”。对长视频推理、战术智能和羽毛球纠错只属于间接或背景证据。当前没有进入 claim/question 的证据列表。

可复核依据

  • PDF p.1-2:任务与贡献
  • PDF p.4-5:数据构建、规模、长尾与空间分布
  • PDF p.5-6:两阶段方法与评测协议
  • PDF p.7-8,Tables 2-6:消融、检测与主结果
  • raw/ingest/2026-04-24-sportshhi/paper-text.md:490-991

原始链接

相关页面