零样本基于骨架的动作识别的信息补偿框架
内容提要
本文提出了一种新方法用于基于骨架的零样本动作识别(STAR),通过对骨架和语义空间的对齐,提升了高相似动作类别的区分能力。实验结果表明,该方法在多个数据集上表现优异,特别是在广义零样本动作识别(GZSSAR)中,利用多语义融合模型显著提高了性能。
延伸解读
方法核心:信息补偿与双提示学习
文章提出通过侧面信息和双提示学习,在精细级别对齐骨架与语义空间,以区分高相似动作类别。该方法旨在补偿零样本场景下未见类别的信息缺失,提升模型对细粒度动作的识别能力。
多语义融合提升广义零样本性能
针对广义零样本基于骨骼的动作识别(GZSSAR),文章提出多语义融合(MSF)模型,采集动作描述和运动描述两种类级文本作为辅助语义信息,增强骨骼特征学习。结合VAE跨模态对齐和看见未见分类门,MSF在GZSSAR上表现卓越。
实验验证与基准表现
在NTU RGB+D、NTU RGB+D 120和PKU-MMD数据集上的广泛实验表明,该方法在零样本学习(ZSL)和广义零样本学习(GZSL)设置上均取得了最先进的性能,验证了其有效性。
Q&A
什么是零样本基于骨架的动作识别(STAR)?
零样本基于骨架的动作识别(STAR)是一种新方法,通过对骨架和语义空间的对齐,提升高相似动作类别的区分能力。
该方法在实验中表现如何?
该方法在NTU RGB+D、NTU RGB+D 120和PKU-MMD数据集上表现优异,特别是在广义零样本动作识别(GZSSAR)中取得了最先进的性能。
多语义融合模型的作用是什么?
多语义融合模型通过类级文本描述作为辅助语义信息,显著提高了广义零样本基于骨骼的动作识别(GZSSAR)的性能。
如何实现骨架和语义特征的对齐?
通过预训练的语言编码器和骨骼编码器提取特征,并利用变分自动编码器(VAE)学习跨模态对齐。
在GZSSAR中如何预测样本类别?
在GZSSAR中采用看见未见分类门来预测样本是否来自已知动作类别。
该研究的主要贡献是什么?
该研究提出了一种新方法和多语义融合模型,显著提升了零样本基于骨架的动作识别性能,尤其是在高相似动作类别的区分上。