高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧画面即可实时重建上万帧3D场景。该模型通过局部位姿预测与残差优化,在精度、速度和显存上均优于现有方法,误差降低40.6%,显存仅6.71GB,支持单目RGB输入,适用于自动驾驶、具身智能等领域。
字节Seed的康炳易团队推出Depth Anything 3(DA3),该模型利用单一Transformer实现任意视图的3D重建,提升了相机定位和几何重建的准确性。通过简化架构和核心预测,DA3能够从单图、多图或视频中提取深度和光线信息,展现出强大的性能和广泛的应用潜力。
AerialMegaDepth是一种新技术,利用空中和地面视角生成高质量3D数据,支持无缝视角转换,广泛应用于导航、城市规划和虚拟旅游。
该研究提出了一种新方法,通过热方法从无方向点云计算神经有符号距离场(SDF),有效解决了传统方法在Eikonal方程中的挑战。该方法分为两步:首先计算热流的时间步,然后拟合SDF梯度,实现在不同点云密度下的高精度重建,优于现有技术。
本研究全面评估了事件驱动的3D重建方法,分类为几何、学习基础和混合方法,识别研究差距与未来方向,为领域发展提供指导。
本研究提出了一种全自动化的管道,将文本描述转化为高保真3D模型。该方法结合文本到图像生成、图像处理和深度学习技术,能够生成语义和几何精确的3D模型,具有在增强现实、虚拟现实和数字内容创建等领域的重要应用潜力。
潮汐力是天体间引力相互作用的结果,影响星体的形状和运动,尤其在双星系统和红巨星中尤为重要。3D重建技术如Fast3R提高了图像处理的速度和准确性,帮助我们更好地理解宇宙现象。研究潮汐力有助于深入了解星体演化及其对宇宙结构的影响。
本研究提出了Fast3R方法,旨在提高多视图3D重建的效率和准确性。该方法能够并行处理多个视角图像,显著提升推理速度,减少误差累积,增强可扩展性,并保持重建精度。
本研究解决了在视觉定位任务中,大型基础模型Dust3r输出的高质量3D点云的推理时间和计算资源消耗过大的问题。我们提出了一个知识蒸馏策略,构建了以Dust3r为教师的学生模型,通过训练不同架构的学生模型来学习场景特定的表示,从而实现与Dust3r相当的3D点输出。我们的实验结果显示,基于视觉变换器的模型在视觉和定量评估上表现最佳。
本文提出了一种双管齐下的方法解决单视图图像的三维重建问题,设计了3D-LMNet,通过潜在嵌入匹配实现多方案重建,实验结果表明其性能优于现有技术。同时,文中综述了三维点云分析技术及其应用,分析了当前技术面临的挑战和未来趋势。
本文探讨了结合fMRI信号与深度学习模型重建复杂图像场景的方法,提出了MindDiffuser和MindEye模型,利用稳定扩散技术和对比学习实现图像重建与检索,展现了在自然场景数据集上的优越性能。此外,介绍了BrainDiVE和MinD-3D框架,强调fMRI信号在3D视觉重建中的应用,展示了脑解码模型在处理稀缺数据时的有效性。
本文探讨了结合盲音频录音与3D场景信息进行新视角声学合成的优势。通过2-4个麦克风的录音和场景的3D几何及材料信息,估计场景中的声音。主要挑战包括声源定位、分离和去混响。研究表明,利用3D重建的房间脉冲响应(RIR)显著提高合成质量。模型在Matterport3D-NVAS数据集上表现优异,声源定位准确率接近完美,声源分离和去混响的PSNR和SDR指标优于现有方法。
本文探讨了物体和人体姿态估计的最新研究进展,提出了多种方法以提高在遮挡和视频污染下的鲁棒性。研究表明,基于点对特征的方法效果最佳,并提出了新的数据集和评估基准,以推动姿态估计技术的发展。
本文介绍了一种名为EndoGaussian的实时内窥镜动态重建方法,利用高斯喷洒技术实现手术场景的高质量重建。该方法显著提高了渲染速度和重建准确性,具有重要的临床应用价值。此外,研究提出了Deform3DGS和HFGS等新方法,进一步优化了动态场景重建,展示了在机器人辅助微创手术中的潜力。
完成下面两步后,将自动完成登录并继续当前操作。