国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

💡 原文中文,约2300字,阅读约需6分钟。
📝

内容提要

李飞飞团队世界模型榜单更新,兔展智能联合北大、鹏城实验室的UniWorld-View登顶。该模型支持单图或视频生成新视角,通过遮挡感知渲染和双流条件注入解决大基线难题,实现精确相机控制,并统一单图3D与视频4D生成,代码已开源。

🔎

延伸解读

大基线难题的破解思路

新视角合成的核心难点在于大基线,即仅凭单张或少量图像生成大幅变化视角。传统重建方法(如NeRF、3DGS)依赖多视角输入,而生成式方法缺乏显式3D约束。UniWorld-View采用几何与生成结合的策略,先用点云渲染提供几何条件,再让扩散模型补全细节,从而在保持相机控制精度的同时,提升生成质量。

遮挡处理的技术细节

点云渲染在大视角变化时易出现前景背景撕裂和背面漏光。UniWorld-View通过双重投影生成遮挡掩码,剔除被遮挡区域,避免错误纹理误导生成模型;同时利用法向过滤移除背对相机的点,确保条件图只包含可靠几何信息。这些处理显著减少了生成过程中的结构扭曲和伪影。

统一框架与开源价值

UniWorld-View采用同一套代码和模型,统一了单图3D生成与视频4D生成,简化了技术栈。模型已适配国产昇腾算力,代码和权重全部开源,有利于社区复现和二次开发。训练数据来自元空智能,体现了产学研协作,为世界模型研究提供了可参考的实践路径。

Q&A

UniWorld-View是什么?它有什么特点?

UniWorld-View是兔展智能联合北大、鹏城实验室研发的世界模型,登顶李飞飞团队榜单。它支持单图或视频生成新视角视频,提供精确的相机位姿控制,能实现单图3D生成和视频4D生成,且代码和权重已全部开源,并适配国产昇腾算力。

UniWorld-View解决了什么技术难题?

它解决了新视角合成中的大基线难题,即仅凭单目视频或单张图片生成大角度变化的新视角时,传统方法会出现结构扭曲、伪影等问题。UniWorld-View通过遮挡感知点云渲染和双流条件注入,实现了精确的相机控制和高质量的生成。

UniWorld-View如何实现精确的相机控制?

它采用遮挡感知点云渲染,包括双重投影和法向过滤,去除错误几何信号;再通过双流条件注入,一个流控制构图,一个流控制上色,从而在生成时精确遵循指定的相机轨迹。

UniWorld-View如何统一单图3D和视频4D生成?

它使用同一套代码和模型,通过生成多视角视频,再将其输入4DGS优化,从而将单目视频或单图转换为可自由视角漫游的4D场景,实现了单图3D和视频4D生成的统一。

UniWorld-View的代码和权重是否开源?

是的,UniWorld-View的代码和权重已全部开源,官方地址为PKU-YuanGroup/UniWorld-View,并且模型已适配国产昇腾算力。

UniWorld-View的训练数据来自哪里?

训练数据来自北大系初创企业元空智能。

兔展智能在视觉AI领域有哪些其他成果?

兔展智能自主研发了Open-Sora Plan和UniWorld系列模型,其中Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量全球第一;UniWorld-V2早于NanoBanana三个月发布,UniWorld-V2.5在InfoGraph等场景对齐GPT-Image-2的生成能力。

🏷️

标签

➡️

继续阅读