GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent

💡 原文中文,约6400字,阅读约需16分钟。
📝

内容提要

清华大学等联合开源具身智能体基础设施RPent,将大模型规划、VLA精细操作与记忆系统结合,形成感知到纠错的闭环。在LIBERO-PRO上达到92.6%成功率,并通过任务卡复用经验使执行提速约7倍,推动机器人在物理世界持续学习进化。

🔎

延伸解读

分层架构:让大模型与专家模型各司其职

RPent没有让单一模型包办从理解到控制的所有环节,而是将系统拆分为用户层、智能层、接口层和环境层。智能层中,Agentic Planner负责任务理解与规划,Action Primitive则封装VLA、WAM等专家模型和程序化技能,形成可调用的工具。这种设计让大模型专注于泛化决策,专家模型保障亚厘米级操作精度,从而在开放任务中兼顾灵活性与可靠性。

记忆系统:从单次成功到可复用经验

物理世界试错成本高,RPent的Memory系统将经验按复用范围组织为三层,并记录适用范围、可信度与支撑证据。新经验需验证后才提升可信度,冲突记录被隔离,避免偶然成功污染能力。记忆以Recipe形式保存可迁移的任务方案,而非固定坐标。在LIBERO-Pro位置交换任务中,引入记忆后成功率从31.0%提升至87.0%,表明经验复用能显著增强扰动环境下的适应性。

Flash Mode:用任务卡平衡速度与适应力

大模型推理速度常成为机器人控制的延迟瓶颈。RPent通过Flash Mode将探索阶段验证成功的任务流程压缩为Task Card,保存任务阶段、动作原语与检查条件,但不保存固定坐标。再次执行时优先按任务卡运行,视觉模块重新定位物体,执行模块根据当前状态调整动作;仅当检查失败或环境偏离时才重新调用规划器。在LIBERO Object的200次评测中,平均执行时间从283.6秒降至40.9秒,成功率仅下降3.5个百分点,实现约7倍加速。

开放接口:连接模型、工具与物理设备

机器人、相机、传感器和仿真器接口各异,若每接入一种设备就重写Agent,智能体难以规模化。RPent通过MCP、RPC与MHS三层接口,将智能决策与物理执行解耦,上层任务逻辑不绑定特定机器人或仿真器。目前框架已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备,新增设备只需实现标准动作、状态与环境接口即可接入。

Q&A

RPent是什么?由哪些机构联合开源?

RPent是由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施,面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环。

RPent在LIBERO-PRO基准测试上的表现如何?

在LIBERO-PRO基准测试中,RPent达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。具体来说,RPent/GPT-6 Astra达到92.63%,相比第二名RPent/Opus-4.7的82.4%高出10.23个百分点。

RPent如何实现任务加速?Flash Mode和任务卡是什么?

RPent通过Flash Mode和任务卡(Task Card)实现加速。在探索阶段,RPent将成功且经过验证的任务流程压缩为Task Card,保存任务阶段、动作原语、关键目标与检查条件,不保存固定坐标。进入Flash Mode后,系统优先按照Task Card执行,仅根据当前视觉状态做必要调整,避免每一步都重新调用大模型。在LIBERO Object的200次评测中,开启Flash Mode将平均执行时间从283.6秒降低至40.9秒,成功率仅下降3.5个百分点,实现约7倍加速。

RPent的Memory系统是如何工作的?有什么作用?

RPent的Memory系统将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需验证后才能提高可信度,冲突记录会被保留和隔离。记忆机制中包含Recipe(可迁移的任务方案),而不是固定坐标。探索模式允许更新记忆,评测模式只读使用冻结经验。在LIBERO-Pro Goal实验中,引入记忆机制后,位置交换任务的成功率从31.0%提升至87.0%。此外,RPent支持记忆资产分发,使单个智能体的能力成为整个系统持续进化的基础。

RPent的架构分为哪几层?各层有什么功能?

RPent采用模块化设计,分为四大层级:用户层提供交互式CLI和Web Dashboard,用于下达任务和查看推理过程;智能层由Agentic Planner和Action Primitive组成,负责任务规划与能力调度;接口层将智能体决策转换为机器人可执行指令,提供统一调用接口;环境层负责任务执行,支持多种仿真环境和真实设备。各层独立部署,通过轻量级通信连接。

RPent与纯VLA端到端和纯大模型Agent路线有何不同?

纯VLA端到端模型精细操作好,但任务变长、语言变花或场景扰动时迅速退化;纯大模型Agent(如CAP-X)能直接输出动作,但在亚厘米级精度、执行时延和持续学习上存在短板。RPent并非折中,而是将具身智能拆解为不同层次的能力,让通用大模型负责任务理解与规划,专家模型负责高精度动作执行,并通过记忆、工具和接口形成闭环,兼顾泛化能力与操作精度。

🏷️

标签

➡️

继续阅读