文章介绍了世界模型的最新进展:李飞飞团队发布多模态世界模型Atlas,能重建3D场景并生成新视角;国内影溯的InSpatio-World也能从视频构建动态4D场景,并登顶WorldArena 2.0榜单。文章强调,世界模型正从生成视频转向建模空间,同时影溯联合多方启动SIDO计划,推动3D数据底座建设。
World Labs发布3D世界模型Atlas,仅需3-5台手机或相机即可生成“子弹时间”效果,替代传统60台相机阵列。它融合文字、图像、深度和相机位姿,构建三维空间,支持后期自由调整机位、生成新视角,甚至重建场景为点云或Gaussian Splat。该技术旨在推动空间智能,降低机器人训练成本,让创作摆脱设备限制。
World Labs发布全球首个多模态世界模型Atlas,支持相机控制生成、空间重建与时空模拟,可从少量照片生成1分钟1440p视频,并补全未拍摄区域。其空间重建能力优于现有模型,旨在解决具身智能训练数据不足问题,通过Real to Sim路线降低仿真成本。Atlas采用多模态自回归扩散Transformer架构,在盲测中胜率高达94%,未来将作为Marble平台底层模型。
李飞飞团队发布全球首个多模态世界模型Atlas,可通过单张图片生成像素级相机控制的视频,重建3D场景并模拟时空变化。该模型融合文本、图像、视频和3D数据,支持机器人训练和视觉特效,性能优于现有SOTA模型,现已开放早期访问。
李飞飞在访谈中强调,AI不是人类的替代者,而是个人能力的放大器。她指出,视觉是智能基石,AI发展依赖算法灵感与数据觉醒,如ImageNet项目。AI在医疗、教育等领域有巨大潜力,但缺乏私人情感与内在驱动力。她主张人机协作,警惕过度依赖或全盘禁止AI,并呼吁社会共同参与技术设计,重视教师与家长支持,培养青少年提问能力。
World Labs收购SceniX,推动世界模型从生成空间转向模拟行动后果,实现R2S2R闭环。无问智科提出“采集世界—生成世界—模拟世界”技术路线,构建物理AI数据基础设施,通过真实数据、生成扩展和物理模拟,持续训练和评测机器人,提升模型能力。
李飞飞团队World Labs发布机器人训练引擎R2S2R,通过Real-to-Sim将真实任务重建为仿真环境,再经Sim-to-Real训练策略并部署回现实,打通仿真到真实闭环。该引擎无需真实数据即可让机器人连续自主运行1小时,并支持多平台任务,旨在规模化获取经验、评估策略,推动机器人商业化落地。
李飞飞团队世界模型榜单更新,兔展智能联合北大、鹏城实验室的UniWorld-View登顶。该模型支持单图或视频生成新视角,通过遮挡感知渲染和双流条件注入解决大基线难题,实现精确相机控制,并统一单图3D与视频4D生成,代码已开源。
EgoVerse是由佐治亚理工等机构发起的全球第一视角人类操作数据生态,旨在为机器人学习建立统一数据标准。光轮智能作为唯一中国公司参与,提供端侧采集、云端处理和仿真验证的质量控制体系,并同时参与NVIDIA等发起的Newton仿真标准,推动物理AI基础设施的全球定义。
SimFoundry是由英伟达与多所高校合作开发的系统,利用真实视频自动生成可交互的机器人仿真环境。该系统通过提取、生成和增强三个阶段,创建数字孪生和数字表亲,提供丰富的训练数据。实验表明,SimFoundry能有效预测机器人在真实环境中的表现,提高任务成功率,减少对真实数据的依赖。
谷歌的离职潮加剧,推理专家周登勇已转投Meta,谷歌内部人才流失严重。Meta吸引了多位顶尖研究人员,显示其在AI领域的吸引力。谷歌正在重组AI Coding团队,优先发展编程能力以应对竞争。
谷歌的“推理之王”Sato已离开Meta,此消息引发了对科技行业人才流动的关注。
李飞飞的文章探讨了“世界模型”的概念,指出其定义混乱,行业需重新梳理。文章将世界模型分为渲染器、模拟器和规划器三类,强调模拟器在连接视觉与行动中的重要性。三者的融合将推动空间智能的发展,使机器不仅能理解世界,还能参与其中。
李飞飞探讨了“世界模型”的定义与功能,强调其在人工智能中的重要性。她将世界模型分为渲染、模拟和规划三大功能,指出模拟器是连接渲染与规划的关键。渲染器关注视觉效果,规划器决定行动。三者的融合将推动机器智能与物理世界的关系发展,未来的挑战在于数据获取与精度的平衡。
李飞飞团队发布了ESI-Bench,这是一个用于评测具身空间智能的新基准。该基准要求AI主动探索以获取信息,研究显示当前AI在空间智能方面,尤其是主动探索和推理能力上仍存在不足。ESI-Bench包含3081个任务实例,覆盖人类核心空间认知能力,旨在提升AI的空间推理能力。
这篇文章讨论了Odyssey公司推出的多人AI生成游戏Agora-1,玩家与AI在同一虚拟世界中对战,体验独特的操作和视觉效果。同时,文章探讨了AI生成世界模型的复杂性及其对真实感的影响,并对未来虚拟体验进行了思考。
李飞飞宣布3D高斯泼溅技术可在移动端流式传输,尽管技术成熟,但3D内容尚未成为主流创作工具。关键在于解决用户对3D技术应用的疑问,行业需建立基础设施以融入3D数据,才能实现应用价值。3D高斯技术正从展示转向生产力工具,未来有望迎来“MP4时刻”。
群核科技近日在港股上市,股价大幅上涨。公司专注于空间智能,致力于让AI理解和重建物理世界。其技术积累了大量三维数据,推动AI从文本理解向空间理解转变。群核的空间语言模型和生成模型已取得显著成果,未来将助力机器人等领域的发展,空间智能被视为AI的基础设施,具有广阔的应用前景。
苏昊加盟复旦大学,担任浩清特聘教授,负责建设通用物理智能研究院。他是具身智能领域的领军人物,参与过ImageNet等重要项目,致力于推动AI在物理世界中的应用。苏昊强调研究院将打破学科界限,培养未来AI领军人才,推动物理智能的发展。
李飞飞的World Labs发布了Spark 2.0,这是一个动态3D高斯点云渲染引擎,能够在手机浏览器中流畅展示超过1亿个3D粒子。该技术通过连续细节层级、流式加载和GPU虚拟内存等手段,解决了渲染效率和内存限制问题,开发者们已利用Spark 2.0创建多种3D应用,旨在让普通用户轻松体验3D世界。
完成下面两步后,将自动完成登录并继续当前操作。