内容提要
诺因发布GLOW生成式学习架构,使机器人通过一次人类演示即可跨物体、环境和任务复用技能。该架构采用统一多模态自回归模型协同认知与行动,在RoboDojo、LIBERO-Pro和Embodied Arena三项评测中均排名第一,验证了自回归具身智能路线。
延伸解读
GLOW如何实现“一教就会”
GLOW通过统一多模态自回归模型KnowinGLOW,将视觉理解、空间推理、任务规划与动作生成整合在同一模型内,而非模块拼接。人类演示一次后,系统将操作编码为可复用技能,执行时结合环境、机器人状态和历史反馈实时决策,无需重新训练。这使机器人能跨物体、环境、任务复用技能,如换盒换物、换壶浇水等。
四大模块协同的完整链路
GLOW由KnowinGLOW、KnowinDream、KnowinWorld和KnowinAgent四大模块组成。KnowinGLOW是核心大脑,统一认知与动作;KnowinDream合成多样化物理交互经验;KnowinWorld推演动作后果,预判风险;KnowinAgent管理任务进度与动态调整。四者协同形成从经验学习、任务理解到行动反馈的闭环,支撑长程任务连贯执行。
评测表现与路线验证
GLOW在RoboDojo、LIBERO-Pro和Embodied Arena三项评测中均排名第一。RoboDojo平均成功率62.2%,较GPT-6基线高40个百分点;LIBERO-Pro平均成功率86.7%,较GPT-6 Astra提升28.5个百分点;Embodied Arena综合得分65.62,位列20个模型第一。这些结果验证了自回归具身智能路线的有效性,表明统一架构能协同认知与行动。
对具身智能行业的启示
GLOW的发布回应了GPT-6等通用大模型对具身智能的冲击。行业共识认为自回归架构正成为收敛方向,竞争核心转向数据与学习方式。诺因坚持用规模化物理经验训练模型,以统一架构协同认知与行动,以闭环执行适应环境变化。这提示从业者,高质量物理经验和生成式学习能力可能比单纯扩大模型规模更关键。
Q&A
GLOW是什么?它主要解决机器人学习中的什么问题?
GLOW是诺因发布的生成式学习架构,旨在让机器人通过一次人类演示即可实现跨物体、跨环境和跨任务的任务复用,解决传统机器人学习需要重新采集数据、编写固定流程或针对性训练的问题。
GLOW如何实现机器人“一教就会”的能力?
GLOW将人的一次完整操作、当前环境、机器人自身状态与执行历史放在同一条链路中理解,让机器人捕捉物体、空间关系、动作顺序和状态变化,从而从“看过”走向“学会”,拥有跨物体、跨环境、跨任务复用的通用能力。
GLOW架构包含哪些核心模块?各自的作用是什么?
GLOW包含四个核心模块:KnowinGLOW是统一多模态自回归模型,协同视觉理解、空间推理、任务规划与动作生成;KnowinDream是合成具身经验引擎,生成多样化的物理交互经验;KnowinWorld是动作条件下的世界推演模块,预判动作后果和物理约束;KnowinAgent(Harness)是上下文驱动的任务运行系统,管理任务进度、执行反馈与动态调整。
GLOW在哪些评测中取得了领先成绩?具体表现如何?
GLOW在RoboDojo、LIBERO-Pro和Embodied Arena三项评测中均排名第一。在RoboDojo的18项仿真任务中,平均成功率为62.2%,平均得分71.1分,较GPT-6基线分别高出40个百分点和41.3分;在LIBERO-Pro中,平均成功率达到86.7%,较GPT-6 Astra的58.2%提升28.5个百分点,位列单策略模型第一;在Embodied Arena的2D-Embodied QA Benchmarks榜单中,KnowinBrain-1.5以65.62的综合得分位列20个参评模型第一。
GLOW能完成哪些实际任务?请举例说明。
GLOW能完成开盒收纳、浇水、擦桌、调酒等家务工作。例如,在开盒收纳中,即使更换盒子和物品,机器人也能完成全套动作;在浇水中,更换浇水壶后仍能精准迁移动作;在擦桌中,能复现人类的心形擦拭轨迹;在调酒中,能按顺序完成多杯多步骤的复杂流程。
GLOW与GPT-6等通用大模型在具身智能路线上的主要区别是什么?
GLOW采用自回归架构,以规模化物理经验训练模型,以统一架构协同认知与行动,以闭环执行适应环境变化,专注于物理交互和任务执行。而GPT-6等通用大模型拓展智能的知识、理解与推理能力,可能对既有具身智能路线形成冲击,但GLOW在物理任务执行和具身场景理解上表现更优,在多项评测中领先GPT-6。