视觉语言机器人的大爆发:从RT2、VoxPoser、OK-Robot到Figure 01、清华CoPa
内容提要
OpenAI与Figure合作推出了人形机器人,可以与人类自然对话并完成任务。机器人通过图像和语音输入,经过OpenAI的多模态模型处理后,输出语言和行为结果。机器人的动作预测和执行分为两步,首先进行常识推理得出高级计划,然后通过大模型生成动作,由全身控制器跟踪。机器人的行为由Transformer策略驱动。
延伸解读
端到端控制的实际含义
文章强调Figure机器人属于“端到端”控制,即从语言输入开始,模型直接输出语言和行为结果,而非中间输出再交由其他程序处理。这意味着视觉、语言理解与动作生成被整合进同一套模型流程,减少了传统模块化系统中的信息传递损耗,但也对模型的实时性和稳定性提出了更高要求。
VLM如何支撑常识与记忆
OpenAI的VLM模型不仅处理对话,还负责常识推理和短期记忆。例如,它能理解“它们”和“那里”的指代,并判断桌上餐具可能进入晾衣架。这种能力让机器人能应对模糊指令,但文章也暗示,其决策依赖于预训练模型对图像和文本的联合理解,而非专门的任务编程。
动作生成的两级分工
机器人动作分为两步:先由互联网预训练模型进行常识推理,形成高级计划;再由大模型以200Hz生成24-DOF动作,作为设定点供全身控制器跟踪。这种分工兼顾了高层语义与低层控制,全身控制器负责保持平衡和安全,而Transformer策略则将像素直接映射到动作。
Q&A
Figure人形机器人是如何与人类自然对话的?
Figure人形机器人通过图像和语音输入,利用OpenAI的多模态模型处理后输出语言和行为结果。
OpenAI与Figure的合作有什么重要意义?
这次合作使得人形机器人能够流畅地与人类互动并完成任务,推动了机器人技术的发展。
机器人动作的预测和执行是如何进行的?
机器人动作的预测和执行分为两步:首先进行常识推理得出高级计划,然后通过大模型生成具体动作。
OpenAI的VLM模型在机器人中起什么作用?
OpenAI的VLM模型提供视觉推理和语言理解,使机器人能够与世界交互并具备短期记忆和常识推理能力。
Figure人形机器人如何处理复杂的指令?
机器人通过常识推理将模棱两可的请求转化为适合上下文的具体行为,例如递给对方一个苹果。
机器人行为是如何确保安全和稳定的?
机器人行为由全身控制器跟踪,确保安全、稳定的动力,如保持平衡。