LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

SkateFormer用四类骨架—时间分区实现高效联合注意力

一句话结论

SkateFormer把近/远关节与局部/全局时间组合成四类partition-specific attention,在NTU60 single-joint达到92.6/97.0,整网仅2.03M参数、3.62G FLOPs和11.46ms;它适合羽毛球实时骨架encoder,动作纠正仍需击球时刻、拍/球token和错误监督。

论文定位

这是一篇通用 skeleton Transformer。它解决naive joint×frame attention的二次复杂度,并避免先将joint groups压缩为单token。方法保留joint-element粒度,同时融合G-Conv与T-Conv inductive bias。

问题定义

GCN沿骨骼边传播,对远距关节关系建模受限;全局Transformer attention内存昂贵。已有方法分开做skeletal/temporal attention或先tokenize joints,容易削弱“某个joint在某些frames”的联合关系。

方法概述

  1. Block channel split:1/4通道做learnable G-Conv,1/4做T-Conv,1/2做Skate-MSA,concat后接FFN。
  2. 四类Skate-Type:neighboring/distant joints × local/global frames。
  3. Joint-element attention:每类partition内做MSA,再reverse回原joint-time位置。
  4. Skate-Embedding:learnable skeletal embedding与fixed sampled-time sinusoidal embedding按通道外积。
  5. 增强:trimmed-uniform frame sampling及跨样本bone-length交换。

实验配置下Skate-MSA理论attention complexity约为naive attention的1/48;这是attention子层量级,整网仍包含projection、G-Conv、T-Conv和FFN。

可复核依据:PDF Fig.2–5、Eq.1–9,pp.5–10;paper-text.md 229–697。

数据与实验

  • NTU60:56,880 videos、60类;NTU120:114,480 videos、120类。
  • NTU-Inter / NTU-Inter120用于双人interaction分类。
  • NW-UCLA:1,475 videos、10类、cross-view。
  • NTU输入为24 joints×2 persons、64 frames;500 epochs、AdamW、batch128、single DGX A100 GPU。
  • E1/E2/E4分别为joint、joint+bone、四modality独立模型融合。

核心结果

SplitE1E2E4
NTU60 X-Sub92.693.093.5
NTU60 X-View97.097.497.8
NTU120 X-Sub87.789.489.8
NTU120 X-Set89.391.091.4
NW-UCLA----98.3

Interaction E1:NTU-Inter 97.1/99.3;NTU-Inter120 92.3/93.2。相对ISTA-Net分别提升+2.2/+1.6和+1.7/+1.5。

效率:2.03M params、3.62G FLOPs、11.46ms;Hyperformer为2.71M、9.64G、18.07ms。绝对latency依赖公开代码实现与测量硬件。

关键消融

  • 无attention 90.7/95.7;naive attention 90.6/95.0且memory 1612.1MB。
  • 仅skeletal types 91.8/96.4;仅temporal types 91.9/96.6;完整四类92.6/97.0,较baseline +1.9/+1.3,memory 137.6MB。
  • Learnable skeletal + fixed temporal embedding为92.6/97.0;learnable temporal版本为91.4/96.2。
  • 完整trimmed sampling与增强为92.6/97.0;fixed为91.4/96.4,uniform为91.6/96.8。
  • Inter-instance augmentation单独在X-View下降0.3,与intra-instance联合时获得峰值,收益依赖evaluation protocol。

局限或疑问

  • Joint partitions是预定义人体分组,羽毛球的手—拍—球关系需要重构partition。
  • 训练500 epochs;E4独立模型融合显著增加实际推理成本。
  • 标准Kinect 3D skeleton无法代表真实单摄像机pose抖动、遮挡和深度歧义。
  • 64-frame固定窗口没有专门对齐击球接触瞬间。
  • 论文没有阶段定位和explanation fidelity评测,attention权重无法直接等同于错误原因。
  • skeleton-only缺少球拍、羽毛球、场地与接触事件。

对羽毛球动作纠正 demo 的影响

可迁移:四类relation对应近邻关节链/远端身体协同与局部击球瞬间/全局动作阶段;single-joint E1兼顾实时性;fixed time index适合非均匀动作采样。

专用改造:围绕hit frame建立contact-local branch;加入racket head、shuttle与court landmarks;左右手和视角canonicalization;保留pose confidence;用专家错误标签与phase supervision训练。attention map只作为候选证据,需反事实和专家复核。

Wiki 证据分类

原始材料

  • raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/paper.pdf
  • raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/paper-text.md
  • raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/analysis.md
  • raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/abstract.md
  • raw/ingest/2026-05-16-skateformer-skeletal-temporal-transformer/links.yaml

相关页面