HDBN:用于鲁棒的基于骨架的动作识别的新型混合双分支网络

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

本文介绍了多种基于图卷积网络的骨架动作识别方法,如双流自适应图卷积网络和共生图神经网络。这些方法通过优化网络结构和特征提取,显著提高了在NTU-RGBD和Kinetics-Skeleton数据集上的识别性能,优于现有技术。

🔎

延伸解读

技术演进脉络

从2018年的2s-AGCN到2023年的BlockGCN,骨架动作识别领域在五年间持续迭代。早期工作如2s-AGCN通过数据驱动学习拓扑结构,后续研究则分别从部件分解、噪声鲁棒性、模型效率等角度切入。这种演进反映了该领域从追求精度到兼顾效率与鲁棒性的趋势,也说明单一模型难以解决所有问题,需针对不同场景选择合适方法。

效率与精度的平衡

EfficientGCN-B4和BlockGCN均强调在保持或提升性能的同时减少模型规模与计算量。EfficientGCN-B4在NTU RGB+D数据集上超越其他SOTA模型且训练更快,BlockGCN在NTU RGB+D 120上参数减少40%以上。这表明骨架动作识别正从单纯追求精度转向实际部署可行性,对资源受限场景具有实用价值。

鲁棒性提升路径

针对遮挡和噪声干扰,文章提及两种思路:一是通过最大化正常与噪声骨架间的互信息进行训练,二是采用多流图卷积网络学习所有关节的最优特征。这些方法不依赖理想数据,更贴近真实场景中骨架提取不完整或存在误差的情况,为实际应用提供了更可靠的解决方案。

❓

Q&A

什么是双流自适应图卷积网络 (2s-AGCN)?

双流自适应图卷积网络 (2s-AGCN) 是一种用于基于骨架的动作识别的网络,通过数据驱动的方法学习网络拓扑结构,包含一阶和二阶信息。

如何提高骨架动作识别的鲁棒性?

通过采用多流图卷积网络,可以提高模型的鲁棒性,学习到所有骨架关节的最优特征,显著减轻遮挡和干扰导致的性能下降。

基于部件图卷积网络的模型有什么优势?

基于部件图卷积网络的模型将骨骼图分为四个子图,使用相对坐标和时间位移代替3D关节点特征,从而提升了识别性能。

共生图神经网络模型解决了哪些问题?

共生图神经网络模型解决了三维骨架动作识别和运动预测问题,采用双骨图和多尺度图卷积网络提取特征。

EfficientGCN-B4基线模型的特点是什么?

EfficientGCN-B4基线模型在提取骨架联结的区分特征方面表现优越,且模型规模更小、训练速度更快。

新的基于骨架的动作分类方法有什么创新?

新的基于骨架的动作分类方法使用多层次空间时间图网络联合建模粗粒度和细粒度骨架运动模式,实验证明在多个大规模数据集上取得了最先进的性能。

🏷️

标签

➡️

继续阅读