WRC 2026|原生全模态世界模型:从模拟世界到交互世界

WRC 2026|原生全模态世界模型:从模拟世界到交互世界

💡 原文中文,约2200字,阅读约需6分钟。
📝

内容提要

智象未来CEO梅涛在世界机器人大会论坛上演讲,提出高IQ不等于全能,强调世界模型对具身智能的重要性。公司发布原生全模态交互式世界模型HiDream-O1-World,支持多模态输入和长时程时空一致性,应用于AI影游、仿真和3D生成,并构建“数据—认知—行动—反馈”闭环飞轮,推动Physical AI商业化。

🔎

延伸解读

高IQ不等于全能:世界模型为何关键

梅涛指出,顶级大模型IQ已接近140,但高IQ不代表全能。正如成绩好不等于综合能力强,模型在考试中表现优异,未必能在真实物理世界中长期稳定地完成任务。这解释了Physical AI的重要性:真正的世界模型需同时具备对世界状态的完整表达、物理规律推演和重构能力,而不仅是知识压缩与推理。

长时程时空一致性:交互世界模型的核心突破

HiDream-O1-World的核心突破在于长时程的时空一致性与物理一致性,使其在长时序交互中能“记住”已探索场景结构,保持物理合理性。这区别于传统多模态模型,支持漫游、编辑、交互,可应用于AI互动影游、具身智能仿真和3D场景生成,为Physical AI提供高保真虚拟训练底座。

数据飞轮:三类数据驱动具身智能闭环

梅涛强调“数据—认知—行动—反馈”闭环飞轮,其中数据底座包含互联网先验数据、仿真物理试错数据和真实交互数据,三者缺一不可。世界模型作为认知中枢,推演世界规律;智能体基于预测决策,具身本体执行,真实反馈回流为新训练数据。智象未来已积累近千万小时视频数据,并与诺亦腾合作增强动作数据,降低真实采集成本。

Q&A

智象未来在世界机器人大会上发布了什么模型?

智象未来发布了原生全模态交互式世界模型HiDream-O1-World,该模型基于自研UiT架构,支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力。

梅涛为什么认为高IQ不代表全能?

梅涛认为高IQ不代表全能,因为就像孩子成绩好不代表综合能力强一样,一个在考试中表现优异的模型,不等于能在真实物理世界中长期、稳定、可靠地完成任务,这正是Physical AI重要的原因。

HiDream-O1-World在技术上有哪些核心突破?

HiDream-O1-World的核心突破在于长时程的时空一致性与物理一致性,使模型在长时序交互中能够记住已探索的场景结构,在复杂交互中保持较高的物理合理性。

HiDream-O1-World有哪些产业应用场景?

HiDream-O1-World的应用场景包括:AI互动影游中用户成为叙事主动参与者;具身智能仿真中搭建高保真虚拟训练底座;3D场景生成中高效生成结构完整的3D空间,缩短创意到成品的迭代路径。

世界模型在具身智能中扮演什么角色?

世界模型是具身智能的认知中枢,负责理解世界状态、推演物理规律,为智能体提供预测结果,智能体基于预测进行决策和规划,具身本体执行动作,形成“数据—认知—行动—反馈”的闭环飞轮。

智象未来如何利用仿真数据降低真实数据采集成本?

智象未来与诺亦腾机器人合作,利用原生全模态大模型对真实采集的人体动作数据进行增强处理,生成大量符合物理约束的视频,使同一动作在不同背景、场景、肤色下保持一致,从而降低真实数据采集的成本和压力。

🏷️

标签

➡️

继续阅读