LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

BlockGCN保留骨架拓扑并轻量建模多种关节关系

一句话结论

BlockGCN用 graph-distance静态编码、persistent-homology动态编码和 block-diagonal graph convolution,在NTU120 X-Sub单关节消融中把85.2%提高到86.9%,同时把参数从2.1M降至1.3M;它适合作为羽毛球姿态encoder候选,纠正系统仍需球拍/球、动作阶段与错误标签。

论文定位

这是一篇通用 skeleton-based action recognition GCN。核心贡献是保留物理骨架先验与高效多关系建模,连接 ST-GCN 的固定物理图与后续 adaptive topology方法。

问题定义

可学习 adjacency虽然灵活,却会在训练后偏离bone-connectivity初始化;多个并行GC用于表达不同joint relations时又增加参数。论文用不同邻接初始化最终精度接近与权重可视化证明“初始化本身无法稳定保留拓扑”,再设计独立的Topological Encoding持续注入结构。

方法概述

  1. Static Topological Encoding:按骨架最短路径距离为joint pair查表得到可学习embedding,joint-pair分组固定。
  2. Dynamic Topological Encoding:对pose sequence的joint-distance graph做Vietoris–Rips filtration,以0D persistent-homology barcode形成input-dependent feature。
  3. BlockGC:通道分组,各组使用独立adjacency与projection;projections组成block-diagonal matrix,复杂度约缩为原GC的$1/K$。
  4. 完整网络:BlockGC与multi-scale temporal convolution交替堆叠10层,最后时空pooling分类。

可复核依据:PDF Fig.4–6、Eq.2–6,pp.4–6;paper-text.md 264–422。

数据与实验

  • NTU RGB+D 60、NTU RGB+D 120、NW-UCLA。
  • 主结果采用4-stream:joint、bone、joint motion、bone motion,独立训练后融合。
  • 关键消融采用NTU120 X-Sub single-joint modality。
  • 64帧、SGD Nesterov、标准cross-entropy、Tesla V100。

核心结果

方法参数NTU60 X-Sub / X-ViewNTU120 X-Sub / X-SetNW-UCLA
FR-Head2.0M92.8 / 96.989.5 / 90.9--
BlockGCN1.3M93.1 / 97.090.3 / 91.596.8

相对FR-Head四个NTU split分别为+0.3、+0.1、+0.8、+0.6,参数减少约35%。single-joint比较的平均增益约0.8点;4-stream融合压缩了方法差距,并带来多模型部署成本。

关键消融

  • 邻接初始化:CTR-GCN在bone/identity/ones/Kaiming下为84.9/85.0/84.8/84.8,差异≤0.2。
  • 完整组件:85.2→86.9(+1.7),参数2.1M→1.3M;static encoding贡献大于dynamic encoding,二者组合最佳。
  • BlockGC 8 groups:1.2M/85.8;DecouplingGC 8 groups:2.2M/85.6。
  • Topological Encoding注入0/1/5/10层:86.0/86.4/86.7/86.9。
  • Barcode vector dim 32/64/128:86.5/86.9/86.4。

局限或疑问

  • “catastrophic forgetting”由初始化不敏感与权重偏离支撑;部分偏离也可能是有益的任务适应,因果命名强于实验。
  • 没有报告persistent-homology模块的独立latency、预处理成本与pose-noise鲁棒性。
  • 标准Kinect骨架无法覆盖真实广播视频的遮挡、运动模糊和2D/3D pose误差。
  • 主结果依赖4个modality模型。
  • global pooling分类无法直接定位错误阶段,也不输出教练建议。
  • 人体骨架图缺少球拍、羽毛球、场地与击球接触关系。

对羽毛球动作纠正 demo 的影响

可迁移:STE保留肩—肘—腕与躯干/下肢链路;BlockGC以较小参数表达多种身体协同;适合作为pose baseline。

专用改造:hit-frame与动作阶段切分、racket/shuttle/court异构节点、左右手/视角规范化、pose confidence、错误标签和标准动作参照。建议先在同一羽毛球pose输入上与CTR-GCN做受控对比,再评估DTE带来的准确率与延迟收益。

Wiki 证据分类

原始材料

  • raw/ingest/2026-05-16-blockgcn-topology-aware-skeleton-action-recognition/paper.pdf
  • raw/ingest/2026-05-16-blockgcn-topology-aware-skeleton-action-recognition/paper-text.md
  • raw/ingest/2026-05-16-blockgcn-topology-aware-skeleton-action-recognition/analysis.md
  • raw/ingest/2026-05-16-blockgcn-topology-aware-skeleton-action-recognition/abstract.md
  • raw/ingest/2026-05-16-blockgcn-topology-aware-skeleton-action-recognition/links.yaml

相关页面