内容提要
文章介绍了世界模型的最新进展:李飞飞团队发布多模态世界模型Atlas,能重建3D场景并生成新视角;国内影溯的InSpatio-World也能从视频构建动态4D场景,并登顶WorldArena 2.0榜单。文章强调,世界模型正从生成视频转向建模空间,同时影溯联合多方启动SIDO计划,推动3D数据底座建设。
延伸解读
世界模型竞赛:从“生成视频”到“建模空间”
文章指出,Atlas与InSpatio-World虽技术路径不同,但共同标志着世界模型正从“生成一段看起来合理的视频”转向“围绕持续存在的空间或时空状态,生成不同视角的观测”。这一转变意味着模型需理解三维结构、保持空间一致性,并支持相机轨迹改变。对读者而言,这提示世界模型的核心能力正从视觉逼真度转向空间理解与交互一致性,为具身智能等应用奠定基础。
榜单第一的含金量:底层能力胜过画面质量
影溯的InSpatio-Curious在WorldArena 2.0中总分第一,但其Image Quality仅60.64分,低于第二名近9分,却凭借轨迹准确性、深度精度、时空表征一致性等指标夺冠。这显示评测更看重物理规律遵循与空间关系准确性,而非单纯画质。对读者而言,这提示在评估世界模型时,应关注其能否准确模拟运动轨迹、深度关系及物理交互,而非仅看生成视频的视觉效果。
评测的局限:高分不等于通用空间智能
文章强调,WorldArena 2.0虽为具身世界模型提供标准化评测,但主要基于仿真环境和机器人操作任务,对真实世界的长尾场景覆盖有限。模型在固定题库中得分高,不代表在真实环境或新物体上表现稳定。此外,评测指标多为视觉与运动代理,不直接测量力、摩擦等物理量。因此,榜单成绩更多反映特定任务下的能力,而非通用空间智能的最终证明。
数据底座:空间智能竞争的新前沿
影溯联合多方启动SIDO计划,旨在建设百万级3D/4D场景数据底座,并推进评测基准建设。这反映出当模型能力触及现有数据与评测边界时,竞争焦点转向数据生产、任务定义与评价标准的统一。对读者而言,这提示空间智能的发展不仅依赖算法创新,更需高质量、大规模的数据支撑,以及能衡量真实可用性的评测体系,以推动从实验室到实际应用的落地。
Q&A
李飞飞团队发布的Atlas是什么?它有哪些核心能力?
Atlas是李飞飞创办的World Labs于9月2日发布的多模态世界模型,它能将文字、图像、视频和3D信息统一到空间上下文中,从一张或几张图片重建三维场景、生成新视角,并支持相机沿指定轨迹移动,保持空间结构一致性。
影溯的InSpatio-World与Atlas有何异同?
两者都能从有限的观测构建可探索的3D/4D场景,并允许改变相机视角。区别在于Atlas从图像出发,侧重空间一致性;而InSpatio-World从视频出发,显式处理时间维度,允许用户改变观察时刻,从新视角观察动态过程。
影溯的InSpatio-Curious在WorldArena 2.0榜单上的表现如何?
截至8月27日,InSpatio-Curious以66.11分位列77个参评模型第一,并在Physics Adherence、Trajectory Accuracy、JEPA Similarity和Depth Accuracy四项指标上均排名第一。尽管Image Quality得分较低,但总分仍居榜首。
WorldArena 2.0评测的重点是什么?
WorldArena 2.0是面向具身世界模型的评测,不仅关注视频生成效果,还检查运动轨迹准确性、深度与空间关系稳定性,以及物体是否遵循物理逻辑。它更像一个为机器人准备的考场,强调模型的真实可用性。
WorldArena 2.0评测有哪些局限性?
WorldArena 2.0主要围绕标准化仿真环境和机器人操作任务,对真实世界的长尾情况覆盖有限。Track 1的总分主要来自生成与视觉代理指标,无法直接测量真实世界中的力、摩擦、质量等物理量,因此高分不代表通用空间智能。
SIDO计划的目标是什么?
SIDO计划由影溯联合20余家机构启动,旨在建设大规模空间智能3D数据底座,计划未来两年建设百万级3D/4D场景数据,并推进评测基准建设,以打通数据生产、模型训练到应用反馈的完整链路。