内容提要
谷歌DeepMind发布Gemini Robotics 2,包含三个模型,赋予机器人全身灵巧控制、多步任务规划和自我纠错能力。其轻量版可离线运行,ER模型支持人机协作,并推出ASIMOV-Agentic安全基准,旨在推动机器人从简单动作迈向真实世界物理辅助。
延伸解读
从“上半身”到“全身”:机器人控制的关键跃迁
文章指出,Gemini Robotics 2 相比前代 1.5 模型,将控制范围从上半身扩展到全身,使机器人能够行走、蹲下、伸展并处理各种物体。这一变化意味着机器人不再局限于桌面任务,而是能执行如“从顶层书架取书”等需要全身协调的指令。对于开发者而言,这不仅是动作范围的扩大,更要求视觉、运动规划与执行等子系统紧密协作,以应对真实世界的动态变化。
离线运行与边缘计算:隐私与可靠性的考量
Gemini Robotics On-Device 2 支持本地运行,无需互联网连接。RealSense 的 Chris Matthieu 强调,机器人不应在决定停止、避让或抓取物体时等待网络响应,这关乎安全与可靠性。他预测未来机器人将采用混合架构:感知、运动规划和安全决策在边缘完成,而云端模型负责更深层的推理和长期学习。这一设计对隐私敏感或网络不稳定的应用场景尤为重要。
自我纠错与人机协作:迈向长时程任务的关键
Gemini Robotics ER 2 作为“机器人的高层大脑”,不仅能理解环境并与人类沟通,还能在任务执行中自我纠错。文章引用 Matthieu 的观点,指出真正的挑战不在于做出第一个决策,而在于当世界变化(如门被关上、物体被移动)时,如何从第一百次失败中恢复。这种持续重规划的能力,加上与 VLA 模型的协同,使机器人能够完成持续数分钟、涉及数百个决策的复杂任务。
安全基准与快速适配:降低部署门槛
Google 推出 ASIMOV-Agentic 安全基准,用于衡量机器人拒绝不安全工具调用和请求人类帮助的能力,这为安全部署提供了量化标准。同时,Gemini Robotics 2 支持快速适配新机器人形态,仅需约 200 个示例和数小时即可适应新的双臂机器人,这有助于技能在不同硬件间迁移,加速机器人技术的实际应用。
Q&A
Gemini Robotics 2是什么?它包含哪些模型?
Gemini Robotics 2是谷歌DeepMind发布的智能层,包含三个模型:Gemini Robotics 2(视觉-语言-动作模型)、Gemini Robotics On-Device 2(轻量版,可离线运行)和Gemini Robotics ER 2(具身推理模型)。
Gemini Robotics 2相比前代Gemini Robotics 1.5有哪些主要改进?
Gemini Robotics 2实现了全身控制,而前代只能控制上半身进行桌面任务。它使机器人能够行走、蹲下、伸展并处理各种物体,例如执行“从顶层书架取书”的命令。
Gemini Robotics ER 2模型的主要功能是什么?
Gemini Robotics ER 2是机器人的“高级大脑”,能理解环境、与人类沟通、制定多步任务计划,并具备自我纠错能力。它可与VLA模型协同完成需要数百个决策的复杂任务。
Gemini Robotics On-Device 2模型有什么优势?
轻量版模型可离线运行,无需互联网连接即可做出决策,如停止、避让或抓取物体,从而提升隐私、可靠性和确定性。
Gemini Robotics 2如何支持机器人适应不同的硬件形态?
Gemini Robotics 2允许开发者快速适应不同机器人形态,仅需约200个示例和几小时的适应时间,即可将技能迁移到具有不同形状、传感器和自由度的新系统。
ASIMOV-Agentic基准的作用是什么?
ASIMOV-Agentic是谷歌推出的安全基准,用于衡量智能体拒绝不安全工具调用并在不确定能否安全完成任务时向人类求助的能力。
Gemini Robotics 2如何实现人机协作?
通过ER模型,机器人能理解环境并与人类沟通,从而制定计划并执行多步任务,如清空洗碗机并整理物品。此外,机器人还能与其他机器人协作完成复杂工作流。
Gemini Robotics ER 2目前在哪里可以使用?
Gemini Robotics ER 2现已在Google AI Studio上提供,并在Gemini Enterprise Agent Platform上提供私有预览。