LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

FineDiving程序感知的细粒度动作质量评估

一句话结论

FineDiving 证明步骤分割与 query–exemplar 步骤级 cross-attention 能把跳水 AQA 的 Spearman $\rho$ 提至 0.9203;但最佳接口依赖已知 dive number、带真分参考样本和固定 transition 数,且 sample split 未说明 athlete/source-video 隔离。

论文定位

论文同时贡献 3,000 段细粒度跳水视频与 Temporal Segmentation Attention(TSA),把“整段视频黑盒回归”改造成“先分步骤、再和参考视频逐步对比”的 AQA。

数据集与标签

  • 3,000 clips、52 action types、29 sub-action types、23 difficulty types。
  • 两级语义:dive-number action type 与 take-off/somersault/twist/entry 等 sub-action type。
  • 两级时间:完整动作边界与连续步骤 transition。
  • FINA 官方 action score、judges’ scores、difficulty degree。
  • 专业运动员协助 lexicon,6 名 worker 交叉复核,总约 120 小时。
  • 未报告运动员唯一数量、身份、赛事/源视频 split;无步骤级执行质量/扣分原因。

方法与接口

I3D 提取特征,TSA 预测固定 $L=2$ 个 transition,把 query/exemplar 切为 3 段;transformer cross-attention 对齐同语义步骤,回归相对分数并加 exemplar 真分。测试用 $M=10$ 个训练集 exemplar 平均投票;最佳版本用已知 dive number 选同类参考。

因此它是检索/对比式评分器,而非单视频独立绝对评分器。

协议与核心结果

  • Kinetics 预训练 I3D;每视频 96 帧、9 snippets;75% train/25% test。
  • 指标:[email protected]/0.75、Spearman $\rho$、relative $\ell_2$。
方法exemplar$\rho$R-$\ell_2$
CoRe不用 DN0.86310.5565
TSA不用 DN0.89250.4782
CoRe用 DN0.90610.3615
TSA用 DN0.92030.3420

TSA 相对 CoRe 的 $\rho$ 绝对提升为 +0.0294(不用 DN)与 +0.0142(用 DN)。分割 [email protected] 只有 30.17/34.31,严格边界仍弱。

关键消融

  • 用 DN:F+R 0.8576;F+S+R 0.8793;TSA 0.9203;GT transition oracle 0.9310。
  • TSA 相对“只加分割”提升 +0.0410,支持步骤级 cross-attention。
  • oracle 只再提升 +0.0107,说明误差不全来自边界。
  • exemplar $M=1/5/10/15$:0.9085/0.9154/0.9203/0.9204,10 后饱和。
  • attention 可视化只表明关注区域,不等同于因果扣分解释。

局限与泄漏风险

  • 作者明确承认 transition 数需预先知道,专业步骤标注成本高;公开视频授权当时仍在确认。
  • 75/25 sample split 未说明 athlete/competition/source-video 分组,身份、背景、相邻镜头泄漏风险无法排除。
  • 已知 dive number 与参考真分是额外测试接口,不能与单视频方法混比。
  • 总分回归没有步骤级扣分真值;不应声称模型解释了“为何扣分”。
  • 只验证跳水闭集,无跨运动、跨规则、跨转播域证据。

对羽毛球 demo 的迁移边界

可迁移 query–exemplar 与阶段级对齐:同 stroke 类型参考库适合小数据 demo。不可直接固定 3 阶段;羽毛球需可变阶段、pose/racket/ball/contact 特征与 coach rubric。必须 athlete/session/court/camera-disjoint,并把 stroke classifier/参考检索误差纳入端到端评测。

对 Wiki 判断的影响

  • 体育 AI 视频理解:程序级监督改善 AQA 是直接支持;可解释训练反馈仅有限支持。
  • 体育 AI 路线图:动作阶段→评分接口是奠基支持,也暴露专家标注和 split 成本。
  • 视频理解:支持细粒度时间结构与 exemplar 对齐。

原始材料

  • 全文深分析
  • raw/ingest/2026-04-25-finediving/paper.pdf
  • raw/ingest/2026-04-25-finediving/paper-text.md
  • raw/ingest/2026-04-25-finediving/links.yaml