Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作赋能机器人

💡 原文英文,约1500词,阅读约需6分钟。
📝

内容提要

谷歌发布Gemini Robotics ER 2,作为机器人高级“大脑”,支持实时空间推理、多步任务规划及多机器人协作。它通过视频理解追踪进度、自我纠错,并提升工具编排与安全性。该模型现通过Gemini API等公开提供,性能优于前代,旨在让机器人更安全、高效地协助人类。

🔎

延伸解读

从“感知”到“编排”:ER 2 的角色定位

Gemini Robotics ER 2 并非直接控制机器人动作的低层模型,而是充当“高级大脑”,负责实时空间推理、多步任务规划,并将执行指令下发给 VLA 等低层控制模型。这种分层设计让开发者可以灵活组合不同的执行器,也意味着 ER 2 的能力提升主要体现在任务编排和决策层面,而非机械控制本身。

视频理解带来的任务进度追踪能力

ER 2 通过连续视频流实时追踪任务进度,并能将进度划分为五个等级(0-20% 至 80-100%),在进度分类任务上达到 57.4% 的准确率。这种能力让机器人可以自我纠错、避免从头重来,同时“时刻查找”功能(91.3% 准确率、0.96 秒平均绝对距离)帮助机器人精确判断关键节点,如停止倒咖啡的时机。

多机器人协作与工具调用

ER 2 支持多机器人通过共享语义理解进行协作,例如轮式机器人和人形机器人可分工完成复杂任务。此外,模型原生支持调用 Google Search 等工具,开发者可将 VLA 模型或导航 API 声明为工具,实现灵活的任务编排。这种设计旨在让不同形态的机器人互补,完成单一机器人难以独立完成的工作。

安全性与性能权衡

ER 2 在安全指令遵循和人类接近检测基准上表现优于前代,能在检测到人靠近时暂停人形机器人,待区域清空后自动恢复。同时,模型在时刻查找任务上以更低的计算成本和 4 倍执行速度接近更大模型的精度,体现了在实时物理环境中对延迟的优化。但需注意,这些结果基于特定基准和模拟环境,实际应用效果可能因场景而异。

Q&A

Gemini Robotics ER 2是什么?

Gemini Robotics ER 2是谷歌发布的一款新型模型,旨在作为机器人的高级“大脑”,提供实时空间推理、多步任务规划以及多机器人协作能力。

Gemini Robotics ER 2如何帮助机器人追踪任务进度?

Gemini Robotics ER 2通过连续视频流理解,将任务进度分为五个等级(0-20%到80-100%),实现进度分类,并能在关键时刻精确识别(如停止倒咖啡),从而让机器人实时调整动作或重试失败步骤,而无需重启整个流程。

Gemini Robotics ER 2支持多机器人协作吗?

是的,Gemini Robotics ER 2支持多机器人协作,允许不同类型的机器人通过共享语义理解进行通信和任务交接,从而完成单个机器人无法完成的复杂工作流。

Gemini Robotics ER 2在安全方面有哪些改进?

Gemini Robotics ER 2在安全指令遵循和人类接近检测方面有显著提升,例如当人靠近时,机器人会停止动作,待区域清空后自动恢复工作。此外,它还引入了新的基准来评估安全编排能力。

开发者如何获取和使用Gemini Robotics ER 2?

开发者可以通过Gemini API、Google AI Studio以及Gemini Enterprise Agent Platform(私有预览)访问该模型,并可使用提供的示例代码进行配置和提示,以构建物理AI代理。

Gemini Robotics ER 2与上一代ER 1.6相比有哪些提升?

Gemini Robotics ER 2在工具编排、视频理解、进度追踪、空间推理和安全性能等方面均有提升,例如在进度分类上达到57.4%的准确率,在关键时刻发现上达到91.3%的准确率,且执行速度更快。

Gemini Robotics ER 2在空间推理方面有哪些具体能力?

Gemini Robotics ER 2在空间推理方面包括成功/失败检测(基于原始视频流)、通用仪器读数(涵盖数字显示屏、线性刻度、尺子、液体温度计等10种类型)以及增强的空间视觉问答(VQA)能力。

🏷️

标签

➡️

继续阅读