推出Gemini Robotics ER 2

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

谷歌发布Gemini Robotics ER 2,这是其最先进的机器人“具身推理”模型,旨在提升机器人的实时决策与多步任务规划能力。该模型支持视频理解、进度追踪、工具调用及多机器人协作,并显著增强了空间推理与安全性。开发者现可通过Gemini API等平台使用,其性能在多项基准测试中超越前代。

🔎

延伸解读

从“感知”到“执行”的桥梁

Gemini Robotics ER 2 并非直接控制机器人动作,而是作为“高层大脑”负责理解、规划和决策,再将指令传递给底层的视觉-语言-动作(VLA)模型。这种设计让开发者可以灵活组合不同的控制接口,例如导航API或VLA模型,从而适配多种机器人硬件。文章强调,该模型通过工具调用和实时视频流,实现了边思考边执行,减少了传统“停下思考”的延迟,这对于物理世界的实时交互至关重要。

任务进度追踪:从“做”到“做对”

文章指出,机器人面临的一大挑战是判断任务是否完成。Gemini Robotics ER 2 通过连续视频流进行进度分类(将任务进度分为五档)和关键时刻定位(如倒咖啡何时停止),准确率分别达到57.4%和91.3%。这意味着机器人能实时感知自身进度,在出错时局部重试,而无需从头开始。这种“时间智能”对于多步骤任务(如拧灯泡、系垃圾袋)的可靠性至关重要。

多机器人协作与安全考量

该模型支持多机器人协作,通过共享语义理解,让不同形态的机器人(如轮式机器人和人形机器人)协同完成复杂任务。安全方面,Gemini Robotics ER 2 在安全指令遵循和人类接近检测基准上表现优异,能在人靠近时暂停动作,人离开后自动恢复。文章还提到,他们引入了新的基准来评估模型作为安全VLA编排器的能力,强调在物理世界中安全约束的重要性。

Q&A

Gemini Robotics ER 2是什么?

Gemini Robotics ER 2是谷歌推出的最先进的机器人“具身推理”模型,作为机器人的高级大脑,它能让机器人理解物理世界、与人类对话、规划多步任务,并将动作执行交给底层的视觉-语言-动作(VLA)模型。

Gemini Robotics ER 2相比前代有哪些提升?

相比前代ER 1.6,ER 2在视频理解、进度追踪、工具编排、空间推理和安全性方面有显著提升,并新增了多机器人协作能力。

Gemini Robotics ER 2如何实现实时决策?

它通过集成到Gemini Live API,使用双向流式端点优化延迟,使模型能够边思考边执行,避免“停下来思考”的停顿,从而实现流畅的实时决策。

Gemini Robotics ER 2在进度分类和时刻查找上的性能如何?

在进度分类任务上,准确率达到57.4%;在时刻查找任务上,准确率为91.3%,平均绝对距离为0.96秒,且计算成本更低,执行速度是前代的4倍。

Gemini Robotics ER 2如何支持多机器人协作?

它通过共享语义理解,让不同类型的机器人(如轮式机器人和人形机器人)能够通信和交接任务,从而完成单个机器人无法完成的复杂工作流程。

Gemini Robotics ER 2在安全性方面有哪些改进?

它在安全指令遵循和人类接近检测基准上取得显著进步,能检测到附近的人并暂停机器人,待人员离开后自动恢复工作。此外,还引入了新的安全基准来评估模型作为安全VLA编排器的能力。

开发者如何获取和使用Gemini Robotics ER 2?

开发者可以通过Gemini API、Google AI Studio以及Gemini Enterprise Agent Platform(私有预览)获取该模型,并参考官方提供的配置和提示示例来构建物理AI应用。

🏷️

标签

➡️

继续阅读