一句话结论
SkateFormer把近/远关节与局部/全局时间组合成四类partition-specific attention,在NTU60 single-joint达到92.6/97.0,整网仅2.03M参数、3.62G FLOPs和11.46ms;它适合羽毛球实时骨架encoder,动作纠正仍需击球时刻、拍/球token和错误监督。
论文定位
这是一篇通用 skeleton Transformer。它解决naive joint×frame attention的二次复杂度,并避免先将joint groups压缩为单token。方法保留joint-element粒度,同时融合G-Conv与T-Conv inductive bias。
问题定义
GCN沿骨骼边传播,对远距关节关系建模受限;全局Transformer attention内存昂贵。已有方法分开做skeletal/temporal attention或先tokenize joints,容易削弱“某个joint在某些frames”的联合关系。
方法概述
- Block channel split:1/4通道做learnable G-Conv,1/4做T-Conv,1/2做Skate-MSA,concat后接FFN。
- 四类Skate-Type:neighboring/distant joints × local/global frames。
- Joint-element attention:每类partition内做MSA,再reverse回原joint-time位置。
- Skate-Embedding:learnable skeletal embedding与fixed sampled-time sinusoidal embedding按通道外积。
- 增强:trimmed-uniform frame sampling及跨样本bone-length交换。
实验配置下Skate-MSA理论attention complexity约为naive attention的1/48;这是attention子层量级,整网仍包含projection、G-Conv、T-Conv和FFN。
可复核依据:PDF Fig.2–5、Eq.1–9,pp.5–10;paper-text.md 229–697。
数据与实验
- NTU60:56,880 videos、60类;NTU120:114,480 videos、120类。
- NTU-Inter / NTU-Inter120用于双人interaction分类。
- NW-UCLA:1,475 videos、10类、cross-view。
- NTU输入为24 joints×2 persons、64 frames;500 epochs、AdamW、batch128、single DGX A100 GPU。
- E1/E2/E4分别为joint、joint+bone、四modality独立模型融合。
核心结果
| Split | E1 | E2 | E4 |
|---|---|---|---|
| NTU60 X-Sub | 92.6 | 93.0 | 93.5 |
| NTU60 X-View | 97.0 | 97.4 | 97.8 |
| NTU120 X-Sub | 87.7 | 89.4 | 89.8 |
| NTU120 X-Set | 89.3 | 91.0 | 91.4 |
| NW-UCLA | -- | -- | 98.3 |
Interaction E1:NTU-Inter 97.1/99.3;NTU-Inter120 92.3/93.2。相对ISTA-Net分别提升+2.2/+1.6和+1.7/+1.5。
效率:2.03M params、3.62G FLOPs、11.46ms;Hyperformer为2.71M、9.64G、18.07ms。绝对latency依赖公开代码实现与测量硬件。
关键消融
- 无attention 90.7/95.7;naive attention 90.6/95.0且memory 1612.1MB。
- 仅skeletal types 91.8/96.4;仅temporal types 91.9/96.6;完整四类92.6/97.0,较baseline +1.9/+1.3,memory 137.6MB。
- Learnable skeletal + fixed temporal embedding为92.6/97.0;learnable temporal版本为91.4/96.2。
- 完整trimmed sampling与增强为92.6/97.0;fixed为91.4/96.4,uniform为91.6/96.8。
- Inter-instance augmentation单独在X-View下降0.3,与intra-instance联合时获得峰值,收益依赖evaluation protocol。
局限或疑问
- Joint partitions是预定义人体分组,羽毛球的手—拍—球关系需要重构partition。
- 训练500 epochs;E4独立模型融合显著增加实际推理成本。
- 标准Kinect 3D skeleton无法代表真实单摄像机pose抖动、遮挡和深度歧义。
- 64-frame固定窗口没有专门对齐击球接触瞬间。
- 论文没有阶段定位和explanation fidelity评测,attention权重无法直接等同于错误原因。
- skeleton-only缺少球拍、羽毛球、场地与接触事件。
对羽毛球动作纠正 demo 的影响
可迁移:四类relation对应近邻关节链/远端身体协同与局部击球瞬间/全局动作阶段;single-joint E1兼顾实时性;fixed time index适合非均匀动作采样。
专用改造:围绕hit frame建立contact-local branch;加入racket head、shuttle与court landmarks;左右手和视角canonicalization;保留pose confidence;用专家错误标签与phase supervision训练。attention map只作为候选证据,需反事实和专家复核。
Wiki 证据分类
- 对 主流视觉 Backbone:直接支持高效joint-time Transformer。
- 对 体育 AI 视频理解:间接支持“关键关节×关键时间”建模。
- 对 羽毛球动作纠正 demo:实时姿态encoder候选;关键帧解释与纠正结论待验证。
- 最终评级:A(通用SAR)/ B-(羽毛球纠正迁移)。
原始材料
raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/paper.pdfraw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/paper-text.mdraw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/analysis.mdraw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/abstract.mdraw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/links.yaml