面向高效人体网格估计的 MoCap 到视觉领域自适应从 2D 关键点

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

本文探讨了通过2D姿态估计和3D运动捕捉数据推导三维人体姿态的方法,提出了基于虚拟标记的中间表示和Pose and Mesh Co-Evolution网络,成功解决了从视频中恢复3D人体运动的挑战。研究结果显示,该方法在多个基准数据集上优于现有技术,展现出强大的泛化能力。

🔎

延伸解读

从2D到3D:虚拟标记作为中间表示

文章提出基于虚拟标记的中间表示方法,通过学习64个身体表面关键点来重构3D网格。这种表示在2D姿态和3D网格之间建立了桥梁,避免了直接回归3D姿态的困难,并取得了高于现有方法的精度。

PMCE网络:分解任务提升时序一致性

Pose and Mesh Co-Evolution网络将视频中的3D人体运动恢复分解为基于3D人体姿势估计和网格顶点回归两个子任务。在3DPW、Human3.6M和MPI-INF-3DHP三个基准数据集上,该方法在逐帧准确度和时间一致性方面均优于先前的最先进方法。

弱监督框架:解决姿势转换的三大挑战

针对三维姿势转换中缺乏配对训练数据、姿势与形状信息分离困难以及网格拓扑结构差异三大挑战,文章提出了一种弱监督基于关键点的框架。该框架使用拓扑无关的关键点检测器和逆向运动学,仅需关键点监督,即可实现形状不变的姿势转换,并适用于不同拓扑结构的网格。

泛化能力:跨数据集与跨物种验证

该方法在基准人类和动物数据集上进行了评估,与最先进的无监督方法相比达到了卓越性能,甚至与完全监督方法具有可比性。在更具挑战性的Mixamo数据集上的测试验证了其处理不同拓扑结构和复杂服装的能力,跨数据集评估进一步展示了强大的泛化能力。

❓

Q&A

如何通过2D姿态估计推导三维人体姿态?

通过2D姿态估计和3D运动捕捉数据,结合虚拟标记的中间表示方法,可以推导出三维人体姿态。

Pose and Mesh Co-Evolution网络的主要功能是什么?

Pose and Mesh Co-Evolution网络旨在从视频中准确、平滑地恢复3D人体运动。

该方法在基准数据集上的表现如何?

该方法在3DPW、Human3.6M和MPI-INF-3DHP等多个基准数据集上表现优于现有技术。

如何克服三维姿势转换中的主要挑战?

通过提出一种弱监督基于关键点的框架,利用与拓扑无关的关键点检测器和逆向运动学来克服这些挑战。

该方法的泛化能力如何?

该方法在多个数据集上评估,展现出强大的泛化能力,能够处理不同拓扑结构和复杂服装。

该研究的创新点有哪些?

研究提出了基于虚拟标记的中间表示和弱监督框架,解决了姿势与形状信息分离的问题。

🏷️

标签

➡️

继续阅读