内容提要
World Labs发布3D世界模型Atlas,仅需3-5台手机或相机即可生成“子弹时间”效果,替代传统60台相机阵列。它融合文字、图像、深度和相机位姿,构建三维空间,支持后期自由调整机位、生成新视角,甚至重建场景为点云或Gaussian Splat。该技术旨在推动空间智能,降低机器人训练成本,让创作摆脱设备限制。
延伸解读
从“堆相机”到“算出来”:子弹时间的成本革命
传统子弹时间需要数十台相机同步拍摄,成本高昂且部署复杂。Atlas 仅用 3-5 台设备就能生成类似效果,大幅降低了硬件门槛。这意味着中小型团队甚至个人创作者,都可能以更低成本实现过去只有大制作才能完成的视觉特效,推动影视和内容创作民主化。
不只是视频生成:可精确控制的虚拟摄影机
与主流文本生成视频不同,Atlas 将相机位姿作为原生输入,允许用户像在 3D 软件中一样精确控制虚拟镜头轨迹,而非依赖提示词“碰运气”。这种空间一致性让后期调整机位成为可能,甚至能生成现场不存在的视角,为导演和摄影师提供了前所未有的创作自由度。
空间智能的潜力:从影视特效到机器人训练
Atlas 不仅能生成视频,还能输出深度图、点云和 Gaussian Splat,重建三维场景。这为具身智能和机器人训练提供了低成本方案:通过真实视频重建数字孪生环境,让虚拟机器人在其中反复试错,减少对物理硬件和场地的依赖,有望加速机器人技术的研发与落地。
Q&A
World Labs发布的Atlas是什么?
Atlas是World Labs发布的3D世界模型,能够从少量视频或图像中生成3D场景,支持自由视角的“子弹时间”效果,并可用于机器人训练等空间智能应用。
Atlas与传统子弹时间拍摄相比有什么优势?
传统子弹时间需要60台甚至120台相机阵列,而Atlas仅需3-5台普通手机或相机即可生成类似效果,大幅降低了设备成本和技术门槛。
Atlas是如何实现从少量视角生成3D场景的?
Atlas采用多模态自回归扩散Transformer架构,将文字、图像、深度和相机位姿融合到统一的空间上下文中,通过稀疏视角推断未覆盖区域,并保持几何一致性。
Atlas与普通AI视频生成模型有何不同?
普通AI视频生成模型在2D像素层面根据文本生成视频,而Atlas在神经网络内部构建三维世界,支持精确的相机位姿控制,允许后期自由调整机位,生成新视角。
Atlas能输出哪些3D数据格式?
Atlas可以输出稠密深度图、三维点云和3D Gaussian Splat,这些数据可用于实时渲染和数字孪生场景构建。
Atlas在机器人训练领域有哪些应用?
Atlas可以通过少量视频重建逼真的数字孪生世界,用于生成机器人训练数据,降低训练成本,支持Real-to-Sim-to-Real流程。
李飞飞创立World Labs的目标是什么?
李飞飞创立World Labs旨在推动空间智能的发展,让AI理解三维空间的物理规律和几何关系,而不仅仅是识别二维图像。