NToP: 用于顶视鱼眼图像中的 2D 和 3D 人体姿态估计的基于 NeRF 的大规模数据集生成
内容提要
该文综述基于神经辐射场(NeRF)的人体姿态与自由视点渲染研究,包括:用NeRF生成3D人体姿态数据集以提升估计器鲁棒性;提出THEODORE+全景数据集;以多视角图像训练可泛化人体NeRF;基于SMPL扭曲辐射场实现姿态依赖渲染;利用HoloLens数据进行高分辨率重建;HumanNeRF实现单目视频自由视点合成;RigNeRF支持肖像头部控制与场景编辑。
延伸解读
NeRF 数据生成如何提升姿态估计鲁棒性
文章指出,利用 NeRF 生成 3D 人体姿态数据集,并通过预训练的姿态估计器优化生成的数据分布,能够提高模型鲁棒性。实验表明,该方法相比基准模型提升了 6% 的预测准确率。这提示读者,合成数据并非简单扩充样本,而是可以针对估计器的弱点进行定向优化,从而在数据稀缺或分布不均的场景中改善性能。
全景与自由视点:数据集和渲染的进展
文章提到 THEODORE+ 数据集用于全景相机中的人体姿态识别,并提供了四种重训练或微调方法,在 PoseFES 数据集上取得明显改进。同时,HumanNeRF 支持单目视频中的自由视点渲染,可在任意新相机视角或 360 度路径下呈现主体。这些工作表明,全景和自由视点场景正成为人体姿态与渲染研究的重要方向,但需注意其依赖特定数据集和训练策略。
从合成数据到机器人重定位的跨领域应用
文章描述了一项将新视角合成用于机器人重定位的研究:通过 NeRF 类算法渲染合成数据集,选择虚拟相机位置,改进了姿态回归器的定位精度,大幅降低了 Cambridge 地标和 7 景数据集的误差。作者认为,姿态回归精度受限于训练数据的大小和分布,而非模型能力。这提示读者,合成数据有望缓解数据偏差问题,但需确保几何一致性。
Q&A
NToP 是什么?它主要解决什么问题?
NToP 是一个使用神经辐射场(NeRF)生成 3D 人体姿势数据集的端到端框架,旨在通过训练预训练的姿势估计器优化生成的数据分布,从而提高模型在顶视鱼眼图像中的 2D 和 3D 人体姿态估计的鲁棒性。
NToP 方法相比基准模型在预测准确率上提升了多少?
实验证明,该方法相对于基准模型提高了 6% 的预测准确率。
THEODORE+ 数据集有什么用途?
THEODORE+ 是一个用于训练和评估卷积神经网络(CNNs)在全景相机中识别人体姿态的新数据集,并提供了四种重新训练或微调神经网络的训练方法,在 PoseFES 数据集中取得较明显的改进。
如何训练可泛化的人体 NeRF 以适用于不同人?
使用多视角图像作为条件输入,将规范空间与输入和目标图像相连,并利用参数化的 3D 人体模型来导出变形,从而训练出适用于不同人的可泛化 NeRF,在新视角合成和姿势动画任务方面表现良好。
HumanNeRF 能实现什么功能?
HumanNeRF 是一种自由视点渲染方法,可以在给定的人体复杂运动的单目视频中工作,使主体在任意新的相机视角或特定帧和身体姿势的全 360 度相机路径下呈现。
RigNeRF 系统有哪些主要功能?
RigNeRF 系统不仅能让用户通过单个肖像视频控制头部姿态和面部表情,还能实现场景物体的编辑和自由视角合成。