一句话结论
FineDiving 证明步骤分割与 query–exemplar 步骤级 cross-attention 能把跳水 AQA 的 Spearman $\rho$ 提至 0.9203;但最佳接口依赖已知 dive number、带真分参考样本和固定 transition 数,且 sample split 未说明 athlete/source-video 隔离。
论文定位
论文同时贡献 3,000 段细粒度跳水视频与 Temporal Segmentation Attention(TSA),把“整段视频黑盒回归”改造成“先分步骤、再和参考视频逐步对比”的 AQA。
数据集与标签
- 3,000 clips、52 action types、29 sub-action types、23 difficulty types。
- 两级语义:dive-number action type 与 take-off/somersault/twist/entry 等 sub-action type。
- 两级时间:完整动作边界与连续步骤 transition。
- FINA 官方 action score、judges’ scores、difficulty degree。
- 专业运动员协助 lexicon,6 名 worker 交叉复核,总约 120 小时。
- 未报告运动员唯一数量、身份、赛事/源视频 split;无步骤级执行质量/扣分原因。
方法与接口
I3D 提取特征,TSA 预测固定 $L=2$ 个 transition,把 query/exemplar 切为 3 段;transformer cross-attention 对齐同语义步骤,回归相对分数并加 exemplar 真分。测试用 $M=10$ 个训练集 exemplar 平均投票;最佳版本用已知 dive number 选同类参考。
因此它是检索/对比式评分器,而非单视频独立绝对评分器。
协议与核心结果
- Kinetics 预训练 I3D;每视频 96 帧、9 snippets;75% train/25% test。
- 指标:[email protected]/0.75、Spearman $\rho$、relative $\ell_2$。
| 方法 | exemplar | $\rho$ | R-$\ell_2$ |
|---|---|---|---|
| CoRe | 不用 DN | 0.8631 | 0.5565 |
| TSA | 不用 DN | 0.8925 | 0.4782 |
| CoRe | 用 DN | 0.9061 | 0.3615 |
| TSA | 用 DN | 0.9203 | 0.3420 |
TSA 相对 CoRe 的 $\rho$ 绝对提升为 +0.0294(不用 DN)与 +0.0142(用 DN)。分割 [email protected] 只有 30.17/34.31,严格边界仍弱。
关键消融
- 用 DN:F+R 0.8576;F+S+R 0.8793;TSA 0.9203;GT transition oracle 0.9310。
- TSA 相对“只加分割”提升 +0.0410,支持步骤级 cross-attention。
- oracle 只再提升 +0.0107,说明误差不全来自边界。
- exemplar $M=1/5/10/15$:0.9085/0.9154/0.9203/0.9204,10 后饱和。
- attention 可视化只表明关注区域,不等同于因果扣分解释。
局限与泄漏风险
- 作者明确承认 transition 数需预先知道,专业步骤标注成本高;公开视频授权当时仍在确认。
- 75/25 sample split 未说明 athlete/competition/source-video 分组,身份、背景、相邻镜头泄漏风险无法排除。
- 已知 dive number 与参考真分是额外测试接口,不能与单视频方法混比。
- 总分回归没有步骤级扣分真值;不应声称模型解释了“为何扣分”。
- 只验证跳水闭集,无跨运动、跨规则、跨转播域证据。
对羽毛球 demo 的迁移边界
可迁移 query–exemplar 与阶段级对齐:同 stroke 类型参考库适合小数据 demo。不可直接固定 3 阶段;羽毛球需可变阶段、pose/racket/ball/contact 特征与 coach rubric。必须 athlete/session/court/camera-disjoint,并把 stroke classifier/参考检索误差纳入端到端评测。
对 Wiki 判断的影响
- 对 体育 AI 视频理解:程序级监督改善 AQA 是直接支持;可解释训练反馈仅有限支持。
- 对 体育 AI 路线图:动作阶段→评分接口是奠基支持,也暴露专家标注和 split 成本。
- 对 视频理解:支持细粒度时间结构与 exemplar 对齐。
原始材料
- 全文深分析
raw/ingest/2026-04-25-finediving/paper.pdfraw/ingest/2026-04-25-finediving/paper-text.mdraw/ingest/2026-04-25-finediving/links.yaml