李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

李飞飞团队发布全球首个多模态世界模型Atlas,可通过单张图片生成像素级相机控制的视频,重建3D场景并模拟时空变化。该模型融合文本、图像、视频和3D数据,支持机器人训练和视觉特效,性能优于现有SOTA模型,现已开放早期访问。

🔎

延伸解读

技术架构:融合LLM与视频模型思想

Atlas采用多模态自回归扩散Transformer架构,将文本、图像、视频、3D数据锚定在三维空间中形成空间上下文。它融合了大语言模型中的KV Cache、缓存感知路由等技术,以及视频模型中的扩散蒸馏、无分类器引导等算法。这种设计使其能利用现有优化技术,并为未来扩展奠定基础。

对机器人训练的意义

Atlas支持Real-to-Sim工作流,仅需几张照片即可生成逼真的RGB和深度数据,为机器人提供多样化的模拟训练环境。这有助于解决机器人训练中数据获取成本高、场景单一的问题,是迈向更高效具身智能的重要一步。

性能评估与开放情况

在相机控制生成和3D重建任务上,Atlas均优于现有SOTA模型,尤其在复杂相机轨迹下优势明显。目前Atlas已向部分合作伙伴开放早期访问,并可在官网申请权限。其能力随规模扩大而提升的证据,表明该模型具有持续发展的潜力。

Q&A

李飞飞团队发布的Atlas是什么?

Atlas是李飞飞团队(World Labs)发布的全球首个多模态世界模型,能够通过单张图片生成像素级相机控制的视频,重建3D场景并模拟时空变化。

Atlas有哪些主要功能?

Atlas的主要功能包括:相机控制生成(从单张图片生成像素级相机控制的图片和视频,最高1分钟1440p)、空间重建(从一张到数十张图像重建3D场景)、时空模拟(根据输入视频建模空间和时间,转换视角)、图像生成(根据文本生成图片和360°全景图)。

Atlas的技术架构是怎样的?

Atlas是一个多模态自回归扩散Transformer,融合了文本、图像、视频和3D数据,所有输入锚定在三维空间中形成空间上下文,然后生成多模态输出。它结合了大语言模型和视频模型的技术,如KV Cache、扩散蒸馏等。

Atlas在机器人领域有什么应用?

Atlas可以仅凭几张照片生成逼真的RGB和深度数据,为机器人提供更多不同的模拟空间进行训练和测试,支持Real-to-Sim工作流,是机器人领域的一大进步。

Atlas的性能表现如何?

在相机控制生成任务上,Atlas优于现有SOTA视频模型,且相机轨迹越复杂优势越大;在3D重建任务上,Atlas超过了专业开源3D重建模型。

Atlas的早期访问如何申请?

Atlas目前正在向部分合作伙伴开放早期访问,也可以在官网申请访问权限。

Atlas的发布对世界模型领域有何意义?

Atlas是李飞飞团队定义的模拟器类世界模型,打通了从真实照片/视频到3D空间再到机器人传感器视图的路径,为具身智能和视觉特效等领域打开了大门,是World Labs的里程碑式成果。

🏷️

标签

➡️

继续阅读