生数科技发布世界模型Motus2,集行动、预测、评估于一体,形成“生成动作—预测后果—评估结果—更新策略”闭环,初步探索机器人自进化。该模型新增触觉与记忆模块,依托约13万小时人类第一视角数据训练,在多项真机任务中显著提升成功率,代表世界模型向自主智能体迈进。
量子位启动MEET2027智能未来大会,主题为“智行合一,驭见未来”,聚焦AI从“能想”走向“能干”,探讨智能体、具身智能、世界模型、AI Infra等议题。大会已办八届,将发布2026人工智能年度榜单及年度AI十大趋势报告,12月在北京举行。
9月10日,高德发布全球首个3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的全尺寸AI生成,覆盖196个国家和地区。输入卫星图或文字,10分钟即可在消费级GPU生成公里级3D城市场景,效率提升千倍。用户可自由探索、实时交互,已应用于飞行街景2.0。高德称其空间智能分三维表达、动态感知、时空推演三层,将向全行业开放。
蚂蚁灵波开源轻量版世界模型 LingBot-World 2.0,参数仅 1.3B,可在消费级单卡 GPU 上本地实时生成世界。团队先训练因果世界模型底座,再通过一致性蒸馏与分布匹配蒸馏压缩计算,并让模型适应自身长时生成状态,从而降低使用门槛。
9月9日,京东全球科技探索者大会在北京举行,主题为“JoyAI·跃迁物理世界”。京东宣布建设国产十万卡算力集群、推进1000万小时具身数据采集,发布JoyAI系列世界模型及AI购物助手“东东”,并启动“物理AI加速计划”,目标在具身智能领域实现六项全球第一。
英伟达与哈佛等团队提出Hydra-0,一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,统一跨本体、任务和环境的预测。该模型降低机器人运动误差90.4%,物体运动误差60.2%,支持零样本组合,并在RoboLab中预测成功率与真实结果高度相关(r=0.96),同时实现高效推理和真实世界验证。
智象未来发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判,在RoboColiseum扰动适应榜单登顶。模型通过全模态底座、多视角融合及非理想条件训练提升鲁棒性,并采用“真实基座+生成增强”数据策略,与交互式世界模型互补,构建统一世界模型基座。
AI虽擅长语言理解,却缺乏对物理世界的认知与决策能力,难以应对暴雨洪水等真实灾害。飞渡科技推出空间智能“峥嵘大模型”,构建全栈基础设施,通过动态边界控制、1:1验证和智能体调度,实现洪水推演与决策,将响应从经验驱动转为模型驱动,并获HICOOL一等奖,标志世界模型从生成迈向实用决策。
光象科技联合清华发布物理原生世界模型ActEffect,训练时预测动作后果并优化策略,执行时退出部署以降低成本。在LIBERO等基准测试中成功率领先,已用于汽车制造场景,验证了稳定性和效率。
文章介绍了世界模型的最新进展:李飞飞团队发布多模态世界模型Atlas,能重建3D场景并生成新视角;国内影溯的InSpatio-World也能从视频构建动态4D场景,并登顶WorldArena 2.0榜单。文章强调,世界模型正从生成视频转向建模空间,同时影溯联合多方启动SIDO计划,推动3D数据底座建设。
World Labs发布全球首个多模态世界模型Atlas,支持相机控制生成、空间重建与时空模拟,可从少量照片生成1分钟1440p视频,并补全未拍摄区域。其空间重建能力优于现有模型,旨在解决具身智能训练数据不足问题,通过Real to Sim路线降低仿真成本。Atlas采用多模态自回归扩散Transformer架构,在盲测中胜率高达94%,未来将作为Marble平台底层模型。
李飞飞团队发布全球首个多模态世界模型Atlas,可通过单张图片生成像素级相机控制的视频,重建3D场景并模拟时空变化。该模型融合文本、图像、视频和3D数据,支持机器人训练和视觉特效,性能优于现有SOTA模型,现已开放早期访问。
英伟达发布DLSS 5,利用生成式AI重绘游戏画面,补充光照、材质等细节,使老游戏如《GTA 5》焕然一新,接近新作效果。该技术适合写实游戏,但对风格化作品如《最终幻想7》可能破坏原有审美。DLSS 5被视为游戏专用世界模型,AI理解并增强画面,但创造力仍属人类。
该研究将大语言模型视为信息处理规则,通过贝叶斯更新偏差衡量其内部一致性。实验发现,非贝叶斯启发式更新常优于精确贝叶斯更新,表明模型世界模型存在错误设定。该度量可用于诊断LLM推理系统问题。
世界人形机器人运动会展示了机器人技术进展,但真实场景应用仍面临挑战。自变量机器人发布世界模型WALL-SS,通过虚拟训练场预演动作、保持长任务连贯性,并验证虚拟策略与真机结果高度一致,减少现实试错成本,推动机器人从赛场走向家庭等真实场景。
视频展示了一个神秘团队开发的具身智能模型,让宇树和智元两款不同机器人共用同一“大脑”,在10分钟一镜到底的真实环境中自主协作完成家务。机器人展现出跨本体协作、自我推理、工具使用和任务中断恢复等能力,突破了传统VLA和世界模型的局限,可能颠覆具身智能行业认知和Scaling Law。
超维动力在世界机器人大会展示全栈具身智能系统,包括人形机器人KAI Bot、灵巧手KAI Hand、数采头环KAI Halo及世界模型。公司成立约一年,通过硬件、模型、数据采集和训练Infra的闭环,让机器人打乒乓球并跨本体适配。其目标是对标Figure,以高效闭环追赶硅谷巨头,推动具身智能产业化。
生数科技朱军提出通用世界模型五级发展路线,强调理解、预测、行动三能力闭环。模型需数据、架构、算力支撑,已发布Vidu、Motus、Motubrain等产品,覆盖前三层级,未来需突破六项挑战,迈向自主决策与多智能体协作。
任少卿创立具身智能公司,获蔚来战略投资,估值超10亿美元。他仍任蔚来智驾负责人,蔚来借此布局机器人业务。任少卿是ResNet作者,主导蔚来世界模型研发,推动智驾技术突破。新公司将聚焦物理AI与具身智能,利用车端技术积累,探索机器人应用。
智象未来CEO梅涛在世界机器人大会论坛上演讲,提出高IQ不等于全能,强调世界模型对具身智能的重要性。公司发布原生全模态交互式世界模型HiDream-O1-World,支持多模态输入和长时程时空一致性,应用于AI影游、仿真和3D生成,并构建“数据—认知—行动—反馈”闭环飞轮,推动Physical AI商业化。
完成下面两步后,将自动完成登录并继续当前操作。