iHuman: 单目视频中即时可动态化的数字人体
内容提要
该研究提出了一种基于3D高斯散点的动态人体模型,能够实时渲染逼真的人体化身。与现有技术相比,该模型在THuman4数据集上的PSNR提升了1.5dB,渲染速度超过20fps。通过学习非刚性变形网络并引入正则化,该方法在训练和推理速度上分别提高了400倍和250倍,同时在外观质量和渲染效率上表现优越。
延伸解读
实时渲染性能的突破
该研究在THuman4数据集上实现了超过20fps的渲染速度,PSNR提升1.5dB,表明基于3D高斯散点的动态人体模型在保持高质量的同时达到了实时性。与基于NeRF的方法相比,训练和推理速度分别提升400倍和250倍,这得益于非刚性变形网络和正则化的引入,为实际应用如虚拟现实和在线会议提供了可能。
单目视频输入的便利性
该方法仅需单目视频即可创建可动画化的人体化身,无需多视角设备或额外注释,降低了数据采集成本。通过可动画化的3D高斯函数和动态外观网络,模型能够从2D观察中融合3D外观,并联合优化动作与外观,解决了单眼设置中运动估计不准确的问题,使消费级硬件上的高效推理成为可能。
与现有技术的对比优势
文章提及的GaussianAvatar、GoMAvatar和GauHuman等模型均基于3D高斯散点,在渲染效率和质量上超越传统NeRF方法。例如,GoMAvatar达到43 FPS且内存占用仅3.63MB,GauHuman训练仅需1-2分钟。这些对比凸显了高斯散点表示在动态人体建模中的优势,但各方法在具体指标上仍有差异,需根据应用场景选择。
Q&A
什么是GaussianAvatar方法?
GaussianAvatar是一种从单个视频中创建具有动态3D外观的逼真人类化身的高效方法。
该研究在THuman4数据集上的表现如何?
该模型在THuman4数据集上的PSNR提升了1.5dB,渲染速度超过20fps。
该方法如何提高训练和推理速度?
通过学习非刚性变形网络并引入正则化,该方法在训练和推理速度上分别提高了400倍和250倍。
GaussianAvatar如何处理姿势和外观的建模?
该方法通过设计动态外观网络和可优化特征张量,支持姿势相关的外观建模。
GoMAvatar与其他方法相比有什么优势?
GoMAvatar是一种实时、内存高效的可动画人体建模方法,具有较短的训练时间和高质量的重建。
GauHuman模型的训练和渲染速度如何?
GauHuman模型实现快速训练(1~2分钟)和实时渲染(最高189 FPS),显著优于基于NeRF的框架。