原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

💡 原文中文,约2700字,阅读约需7分钟。
📝

内容提要

智象未来发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判,在RoboColiseum扰动适应榜单登顶。模型通过全模态底座、多视角融合及非理想条件训练提升鲁棒性,并采用“真实基座+生成增强”数据策略,与交互式世界模型互补,构建统一世界模型基座。

🔎

延伸解读

榜单登顶的含金量

RoboColiseum的扰动适应子榜被公认为最具挑战性,它通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。HiDream-O1-Embodied以0.692的平均分登顶,说明其并非在理想条件下表现优异,而是在各种“意外”中仍能保持稳定,这更贴近真实应用场景。

从“理解”到“执行”的跨越

智象近期发布的交互式世界模型HiDream-O1-World侧重“理解与推演”,而此次的具身世界模型则侧重“操作与执行”。两者互补,共同构成统一世界模型基座。这一布局表明,智象正从数字世界的模拟走向物理世界的真实交互,试图打通从感知、认知到行动的全链路,为具身智能的落地提供更完整的模型支撑。

数据策略的独特之处

智象采用“真实基座+生成增强”的数据生产范式,让模型既当“考生”又当“出题人”。例如,与诺亦腾合作,利用高精度动作捕捉数据作为真实底座,再通过生成变体视频(切换背景、光照、物体形态等)实现百倍级数据扩增。这种数据与模型互相驱动的飞轮,可能是其鲁棒性优势的关键来源,也缓解了具身训练数据稀缺的难题。

Q&A

智象未来发布的HiDream-O1-Embodied是什么?

HiDream-O1-Embodied是智象未来(HiDream.ai)发布的具身世界模型,旨在强化机器人的物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。

HiDream-O1-Embodied在RoboColiseum评测中表现如何?

在RoboColiseum的扰动适应(Robustness)子榜单中,HiDream-O1-Embodied以平均分0.692的成绩登顶榜首。

HiDream-O1-Embodied如何实现对多样化指令的理解?

HiDream-O1-Embodied覆盖多元动词、句式与表达方式的等价指令空间,能够穿透字面锁定用户意图,不受句式束缚,从而理解多样化的指令。

HiDream-O1-Embodied如何应对视觉干扰?

HiDream-O1-Embodied综合多个视角的信息,让不同视觉通道相互补充,当部分视觉信息出现偏差或不可用时,仍能借助其他视角理解场景并继续执行任务,实现局部受限时整体仍可运行。

HiDream-O1-Embodied的训练数据策略是什么?

智象采用“真实基座+生成增强”的数据生产范式,以真实动作捕捉数据为底座,利用原生全模态能力生成变体视频,在保持物理约束不变的前提下切换背景、光照等变量,产出海量训练样本,形成数据与模型互相驱动的增长飞轮。

HiDream-O1-Embodied与HiDream-O1-World有何区别与联系?

HiDream-O1-World是交互式世界模型,解决“理解与推演”,让AI在数字世界中具备完整认知;HiDream-O1-Embodied是具身世界模型,解决“操作与执行”,让AI在物理世界中完成真实任务。两者互补,共同构建统一世界模型基座。

智象未来发布HiDream-O1-Embodied的意义是什么?

该模型的发布标志着智象实现了打通图像、视频、3D、动作等模态,贯通理解-推演-执行全流程的技术闭环,是其技术战略从“模拟世界”迈向“真实世界”的关键里程碑。

🏷️

标签

➡️

继续阅读