LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

FineCausal可解释细粒度动作质量评估

一句话结论

FineCausal 以 GAT 特征重加权和 temporal causal attention 联合跳水评分与阶段解析,在 FineDiving-HM 达到 ρ=0.9447、R-L2=0.2338;它提供有价值的阶段化 AQA 设计,但 attention 不能证明因果,且没有羽毛球或专家可用性验证。

论文定位与任务边界

这是 action quality assessment,不是 shuttle tracking,也不恢复球轨迹。输入 query/exemplar 跳水视频与 human-centric masks,输出 query 分数和 forward/twist/entry 阶段。它与 TrackNet 的连接必须经过 hit-frame、pose、trajectory 和动作阶段对齐,不能把二维 shuttle xy 直接当质量分数。

方法概述

  • I3D 提取 query/exemplar 原视频与 mask 特征,沿用 FineParser 的 SAP/TAP/对比回归框架。
  • 设定 O -> F -> S -> Y DAG:原始特征、融合特征、阶段特征、动作分数。
  • 两层 GAT 学习融合 foreground 与有益 background,并声称抑制环境伪相关。
  • masked Transformer 建模 forward→twist→entry 的顺序依赖,以 attention 权重作为阶段解释。
  • L_SAP + L_TAP + L_Reg 联合训练,并用 uncertainty weighting 平衡 mask、边界和分数任务。

“causal intervention”实际是 feature aggregation;没有真实干预、confounder 控制、反事实或可识别 causal effect。正文对 causal mask 方向还有公式/文字不一致,需代码核验。

数据与实验

FineDiving-HM:3,000 视频、52 action types、29 sub-actions、23 difficulty levels、312,256 mask frames,含时序边界与官方分数。75/25 train/test;每视频抽 96 帧、9 snippets。AQA 用 Spearman ρ 与 relative L2;阶段解析用 [email protected]/0.75。

表 1:FineCausal ρ=0.9447,略高于 FineParser 0.9435;R-L2=0.2338,优于 0.2602(作者称相对改善 10.16%)。TAP 略低于 FineParser。正文把最终 [email protected] 写成 0.9907,但表/消融为 0.9937,存在内部不一致;[email protected] 为 0.9453。

关键消融

配置ρR-L2[email protected][email protected]
GAT only0.94250.25720.99200.9069
TCA only0.93820.27070.99730.9666
GAT + TCA0.94470.23380.99370.9453

组合对分数最优,TCA-only 对边界最优,说明 scoring 与 temporal parsing 有 trade-off。论文缺少 causal mask vs 双向 attention、背景交换/OOD、图结构、随机种子和显著性消融。

“因果解释”审计

图 4–5 的 attention 和零分失败案例只显示模型依赖与叙事一致性,不能等价于 P(S_{t+1}|do(S_t))。要支持因果诊断,应编辑/替换单阶段、交换背景或场馆,检查分数与后续阶段变化,并与教练标注比较。当前更准确的称谓是因果图启发的阶段注意力 AQA

局限或疑问

  • 作者承认 causal structure 需要专家知识,精细 mask/阶段标注昂贵。
  • 只验证 FineDiving-HM;无跨赛事、跨场馆、跨运动泛化。
  • ρ 仅 +0.0012 且无多 seed/显著性;R-L2 改善更可信。
  • 背景可能携带赛事/评分偏差,未用 domain shift 证明已去混杂。
  • 没有教练/运动员用户研究、解释准确率或 actionable feedback 评估。
  • 跳水三阶段不能直接映射羽毛球 preparation–swing–contact–follow-through。

真实 10 样本羽毛球 demo 价值

概念价值中等,直接复用低。 可借鉴 query–exemplar、阶段化评分和阶段贡献可视化,但 10 个样本不足以训练/验证 FineCausal。MVP 应由专家定义 stroke-specific rubric,先对齐 pose、shuttle trajectory 与 hit frame,再输出与 exemplar 的阶段差异;attention 只能称“模型关注”,不能称“因果错误”。

对当前 Wiki 判断的影响

  • 直接支持:细粒度 mask、阶段解析与分数回归可联合建模;GAT+TCA 在单一跳水 benchmark 降低回归误差。
  • 间接支持:训练反馈产品应给阶段解释,而非只给总分。
  • 不支持:已识别真实因果关系;已适用于羽毛球;解释已通过专家验证。
  • Roadmap 必须分开 tracking/trajectory 感知与 AQA 高层判断,并增加 hit/pose/trajectory alignment 桥接。

证据评级:B-(单 benchmark 方法证据;因果与跨运动主张需降级)

原始链接

相关页面