一分钟读论文:《G0.5:单流自回归统一机器人推理与动作》

一分钟读论文:《G0.5:单流自回归统一机器人推理与动作》

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

银河通用发布G0.5模型,采用单一自回归流同时处理推理与动作,替代主流VLA架构中VLM仅作编码器、另配动作专家的设计。该模型通过跨本体动作tokenizer、原生思维链和视觉记忆模块,实现推理与动作共享权重。真机微调成功率76.7%,优于π0.5和GR00T-N1.7,但BEHAVIOR基准绝对成功率仅31.4%,实验样本量小,评测协议多样,需谨慎看待。

🔎

延伸解读

架构变革的意义

G0.5的核心变化在于将VLM从上下文编码器转变为直接决策者,推理与动作共享同一套权重。这意味着VLM预训练获得的指令跟随能力可以直接迁移到物理行为上,模型对指令的遵循更紧密。相比主流VLA配方中VLM仅作编码器、另配动作专家的设计,这是架构层面的改变,而非训练技巧,为机器人策略设计提供了新思路。

跨本体动作tokenizer的价值

G0.5通过跨本体可学习动作tokenizer,将14种本体的异构机器人动作映射到共享词表,统一为27维动作空间。这使得不同机器人的动作可以用同一套token表示,增强了模型的泛化能力。对于多机器人协作或迁移场景,这种统一表示可能降低适配成本,但论文未提供跨本体迁移的详细实验,实际效果仍需验证。

评测结果的谨慎解读

虽然G0.5在真机微调成功率上达到76.7%,超过π0.5和GR00T-N1.7,但需注意真机实验每配置仅15 episodes、共4个任务,样本量偏小且为团队自报数据。BEHAVIOR基准绝对成功率仅31.4%,说明长程家庭任务远未解决。此外,7个评测设置混合了不同协议,横向可比性有限,读者应谨慎看待这些数字。

Q&A

G0.5模型的核心架构创新是什么?

G0.5采用单一自回归流,在同一token流中同时输出推理与动作,替代了主流VLA架构中VLM仅作编码器、另配动作专家的设计,使VLM直接成为决策者。

G0.5模型由哪些关键组件构成?

G0.5由三个组件支撑:跨本体可学习动作tokenizer(将14种本体的异构动作映射到共享词表)、原生思维链流(推理token与动作token交替出现在同一自回归序列中)、视觉记忆模块(通过视觉编码器注入数秒级历史观测)。

G0.5在真机实验中的成功率是多少?与π0.5和GR00T-N1.7相比如何?

G0.5在真机微调后的成功率为76.7%,高于π0.5的53.3%和GR00T-N1.7的24.4%。

G0.5在BEHAVIOR基准上的表现如何?

G0.5在2025 BEHAVIOR Challenge中取得31.4%的绝对成功率,超过π0.5的26.3%和冠军方案RLC的26.1%,但绝对成功率仍较低,表明长程家庭任务远未解决。

G0.5的推理与动作是如何结合的?

G0.5通过原生思维链流实现推理与动作的结合,推理token(如任务分解、物体定位)与动作token交替出现在同一自回归序列中,由单一目标函数训练,推理成为动作生成过程的一部分。

G0.5模型有哪些局限性?

G0.5的局限性包括:BEHAVIOR基准绝对成功率仅约31.4%,长程家庭任务仍困难;真机实验样本量小(每配置仅15 episodes,共4个任务),且为团队自报数据;评测协议多样,横向可比性有限。

G0.5模型权重是否开放?

是的,G0.5模型权重已开放,为社区验证这一路线提供了可复现起点。

🏷️

标签

➡️

继续阅读