LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

TrackMAE用轨迹遮挡与预测学习运动敏感的视频表征

一句话结论

TrackMAE 把 point-tracker 轨迹同时用于 masked motion reconstruction 与高/低运动平衡采样,在 FineGYM、SSv2 和 SEVERE 的细粒度动作设置上增强视频表征;它适合作为羽毛球 demo 的 motion-aware RGB backbone,纠正能力仍需球拍/球轨迹、错误标签与专家反馈层。

论文定位

这是一篇通用视频自监督预训练论文。贡献发生在 representation learning 层,体育证据来自 Gym99/FineGYM 与细粒度动作划分。它与 VideoMAE 的关系是加入显式长程运动监督;与 skeleton GCN/Transformer 形成 RGB-motion 与人体姿态的互补输入。

问题定义

高遮挡率 MVM 容易依靠纹理、空间相关性和短时连续性完成重建。TrackMAE要求模型从少量可见 token 预测 point-track displacement,让 encoder学习“对象如何移动及跨帧对应”,同时用轨迹决定可见 token分布。

方法概述

  1. 共享 ViT encoder:处理可见 tubelets。
  2. 双 decoder:分别重建 pixels/CLIP features与 masked轨迹位移;总损失 $\mathcal L=\mathcal L_{spatial}+\lambda\mathcal L_{motion}$。
  3. CoTracker3 targets:默认14×14首帧 query grid,每隔一帧跟踪;用14→28空间插值增加监督密度。
  4. Motion-aware masking:按平均位移划分高/低运动 bins,默认各采样50%可见 token。

可复核依据:PDF Fig.2–3、Eq.3–4,pp.3–5;paper-text.md 147–292。

数据与实验

  • K400预训练:ViT-B、800 epochs、16帧、224×224、16×A100。
  • 线性探测:K400、HMDB51、SSv2、Gym99。
  • 微调:K400、SSv2。
  • SEVERE:domain shift、1K样本、FineGYM细粒度划分、重复计数和多标签任务,共8项。
  • Gym99包含99类,20,484 train / 8,521 test,是本文最直接的体育动作证据。

核心结果

设置对照TrackMAE差异
Linear SSv2,CLIP targetSMILE 23.727.3+3.6
Linear Gym99,CLIP targetSMILE 30.231.8+1.6
Finetune SSv2,ViT-B CLIPSMILE 72.172.8+0.7
Finetune K400,ViT-B CLIPSMILE 83.183.9+0.8
SEVERE FX-S1 / UB-S1SMILE 55.1 / 88.359.0 / 90.1+3.9 / +1.8

SEVERE 中 Gym-1K为34.4,低于SMILE 35.1;Charades为30.5,低于32.5;UCF repetition error为0.170,未超过MGM 0.152。优势主要落在细粒度分类与部分低样本迁移。

关键消融

  • Pixel 46.0/52.2 → Pixel+trajectory 48.9/55.7;CLIP 52.7/57.1 → CLIP+trajectory 55.8/61.1。
  • motion-aware masking在 pixel+trajectory上从48.9/55.7升至49.4/56.2。
  • 14×14轨迹为48.9/55.7;14→28插值为50.6/57.6,增加+1.7/+1.9且无额外tracking成本。
  • 25/50/75% motion ratio中50%最佳。
  • 独立双decoder为49.4/56.2,共享decoder为48.7/55.5。

局限或疑问

  • Point tracking使预训练时间增加约50%。高速运动、遮挡和camera motion会造成轨迹噪声。
  • 首帧规则query无法完整覆盖后续出现的小球/球拍;插值假设patch内局部运动平滑。
  • FineGYM实验是动作类别识别,未包含动作质量、错误类型或纠正建议。
  • 轨迹没有人体关节、拍头、羽毛球等语义身份。
  • ViT-S子集消融与完整ViT-B主实验存在规模差异。

对羽毛球动作纠正 demo 的影响

可迁移:作为RGB/motion backbone;用于击球短窗口、动作阶段和异常运动表征;高低运动平衡采样保留挥拍与站位上下文。

专用模块:hit-frame detection、人体/拍/球身份轨迹、skeleton phase encoder、错误模式标签、标准动作参照和专家反馈评价。通用action recognition与stroke correction是两个评测层,后者需报告错误检测F1、阶段定位和反馈可执行性。

Wiki 证据分类

原始材料

  • raw/ingest/2026-05-12-trackmae/paper.pdf
  • raw/ingest/2026-05-12-trackmae/paper-text.md
  • raw/ingest/2026-05-12-trackmae/analysis.md
  • raw/ingest/2026-05-12-trackmae/abstract.md
  • raw/ingest/2026-05-12-trackmae/links.yaml

相关页面