零样本基于骨架的动作识别的信息补偿框架

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

本文提出了一种新方法用于基于骨架的零样本动作识别(STAR),通过对骨架和语义空间的对齐,提升了高相似动作类别的区分能力。实验结果表明,该方法在多个数据集上表现优异,特别是在广义零样本动作识别(GZSSAR)中,利用多语义融合模型显著提高了性能。

🔎

延伸解读

方法核心:信息补偿与双提示学习

文章提出通过侧面信息和双提示学习,在精细级别对齐骨架与语义空间,以区分高相似动作类别。该方法旨在补偿零样本场景下未见类别的信息缺失,提升模型对细粒度动作的识别能力。

多语义融合提升广义零样本性能

针对广义零样本基于骨骼的动作识别(GZSSAR),文章提出多语义融合(MSF)模型,采集动作描述和运动描述两种类级文本作为辅助语义信息,增强骨骼特征学习。结合VAE跨模态对齐和看见未见分类门,MSF在GZSSAR上表现卓越。

实验验证与基准表现

在NTU RGB+D、NTU RGB+D 120和PKU-MMD数据集上的广泛实验表明,该方法在零样本学习(ZSL)和广义零样本学习(GZSL)设置上均取得了最先进的性能,验证了其有效性。

❓

Q&A

什么是零样本基于骨架的动作识别(STAR)?

零样本基于骨架的动作识别(STAR)是一种新方法,通过对骨架和语义空间的对齐,提升高相似动作类别的区分能力。

该方法在实验中表现如何?

该方法在NTU RGB+D、NTU RGB+D 120和PKU-MMD数据集上表现优异,特别是在广义零样本动作识别(GZSSAR)中取得了最先进的性能。

多语义融合模型的作用是什么?

多语义融合模型通过类级文本描述作为辅助语义信息,显著提高了广义零样本基于骨骼的动作识别(GZSSAR)的性能。

如何实现骨架和语义特征的对齐?

通过预训练的语言编码器和骨骼编码器提取特征,并利用变分自动编码器(VAE)学习跨模态对齐。

在GZSSAR中如何预测样本类别?

在GZSSAR中采用看见未见分类门来预测样本是否来自已知动作类别。

该研究的主要贡献是什么?

该研究提出了一种新方法和多语义融合模型,显著提升了零样本基于骨架的动作识别性能,尤其是在高相似动作类别的区分上。

🏷️

标签

➡️

继续阅读