CVPR 2026在丹佛举行,收到16092篇投稿,华人研究者表现突出。最佳论文D4RT实现动态场景的高效重建,最佳学生论文ChordEdit由广东工业大学等团队完成,展现了本科生的实力。华人在计算机视觉领域的贡献持续增加。
本文介绍了LGTM(Less Gaussians, Texture More)框架,旨在解决现有3D高斯点云方法在高分辨率合成中的局限性。LGTM通过预测紧凑的高斯原语及其纹理,实现了高保真4K视图合成,并显著减少了所需的高斯原语数量。此外,HUGS(Human Gaussian Splats)方法用于表示可动画的人类与场景,提升了动态场景的渲染效果。
文章讨论了使用Nano Banana Pro模型生成3D迷你商店的概念,展示了星巴克和麦当劳的创意设计,营造出迷人的城市氛围。还提到动态生成天气卡片和古诗意境的3D场景,强调细腻的建模和生动的视觉效果。
苏黎世联邦理工学院与卡内基梅隆大学提出了一种新型数据驱动的多视角3D点追踪方法,能够在动态场景中通过少量相机实现鲁棒且精确的在线追踪,有效应对遮挡和复杂运动问题。
本文全面综述了基于事件相机的3D重建技术,分析了不同输入方式和重建方法的现有成果,指出了数据可用性、评估和动态场景处理的局限性,并展望了未来的发展方向。
本研究提出了一种利用单目连续波飞行时间(C-ToF)摄像头重建动态场景的方法,优化了场景几何表示,能够在受限条件下实现高保真的动态三维重建,尤其在快速运动场景中表现优异。
本研究提出MASSeg模型,解决复杂视频物体分割中的小物体识别、遮挡处理和动态场景建模问题,利用MOSE+数据集和数据增强策略显著提升模型性能。
本文介绍了一种名为Uni-Gaussians的仿真系统,旨在解决自动驾驶中相机与LiDAR联合仿真的问题。该系统利用高斯基元实现高效的动态场景模拟,显著提升了仿真质量和计算效率。实验结果表明,Uni-Gaussians在点云和图像渲染方面表现优异,提供了有效的解决方案。
该研究论文总结了WideRange4D项目,针对动态场景的4D重建挑战,创建了30个复杂运动场景的数据集,结合神经辐射场和人类跟踪技术,实现高质量重建,显著提升了时间和空间的一致性。
本研究提出了一种新方法4DGS-1K,旨在解决现有4D高斯散点技术在动态场景重建中的存储需求和渲染速度问题。该方法通过引入时空变化评分,显著降低了存储需求,并实现了超过1000帧每秒的渲染速度,同时保持了视觉质量。
本研究提出了一种新的基于规则的决策框架,解决了传统方法在动态场景中的抖动和死锁问题,特别是在代理群体对抗中。该框架结合了概率有限状态机、深度卷积网络和强化学习,显著提升了代理的合作与竞争策略,实验结果表明其性能优于其他方法。
DynamicCity是一个创新的4D场景生成框架,通过特征降维和扩散模型实现高质量动态场景生成,突破静态生成的局限。该项目由多所高校合作,支持可控生成,广泛应用于自动驾驶等领域。
Meta推出的VideoJAM框架显著提升了运动一致性近20%,能够生成复杂的舞蹈和杂技等动态场景,效果接近真实。该框架在训练和推理阶段优化了DiT模型,采用联合外观-运动表示和内部引导机制,确保生成视频的运动连贯性。
本研究提出了StreamChat框架,旨在解决现有视频理解模型在长视频、多轮对话和动态场景中的不足。通过分层记忆系统,StreamChat实现了高效的视频特征处理,实验结果表明其在准确性和响应时间上优于现有模型。
该研究提出了CatV2TON方法,旨在提升虚拟试穿技术在图像和视频中的质量。通过时间拼接衣物和人像输入,该方法在混合数据集上训练,显著改善了静态和动态场景下的虚拟试穿效果,展现出良好的应用潜力。
AIxiv报道了李飞飞教授团队的研究,展示了通过单张图片生成三维物理世界的潜力。极佳科技与多方合作推出ReconDreamer,实现自动驾驶场景的高精度重建与生成,显著提升动态场景的渲染质量,推动自动驾驶技术发展。
本研究提出了Driv3R框架,显著提高了自主驾驶中动态场景的实时4D重建速度和准确性,推理速度比现有方法快15倍。
本研究提出了一种新方法,通过稀疏多视角事件流和RGB帧实现动态场景的时空重建,超越了RGB基线,取得了先进的效果。
本研究提出了一种新的动态场景表示方法SaRO-GS,旨在解决视频序列重建动态场景时的渲染速度慢和处理复杂性问题。该方法结合了尺度感知残差场和自适应优化策略,在实时渲染中展现出优越的性能。
本研究提出CAT4D方法,填补了从单目视频生成4D场景的技术空白。该方法结合多视角视频扩散模型和新采样技术,实现了精准的4D重建,并在新视角合成和动态场景重建方面表现出色。
完成下面两步后,将自动完成登录并继续当前操作。