具身智能之RT2

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

RT-2模型将预训练的视觉-语言大模型集成到机器人的低级控制中,以提高泛化能力和语义推理。RT-2具备多模态推理能力,优于基线模型。然而,由于数据集限制,RT-2无法学习新的行为。

🔎

延伸解读

RT-2如何实现视觉-语言-动作对齐

RT-2的核心创新在于将动作表示为token,并与文本token对齐。具体来说,每个动作由7个token表示,这些action token在训练时被当作自然语言token处理,与网络文本数据共同微调。这样,模型就能利用预训练VLM的语义知识,直接输出可执行的动作序列,实现从视觉输入和语言指令到机器人动作的闭环控制。

泛化能力提升与行为学习限制

实验表明,RT-2在新对象、背景和环境上的泛化能力比基线模型提升约2倍,并在符号理解、推理等任务上表现更优。然而,由于机器人数据集仅130k条,且无法覆盖未做过的新行为,RT-2无法学习全新的行为。网络数据主要提供视觉语义知识,而非新的动作技能,因此模型的行为范围仍受限于训练数据。

模型规模与实时推理的权衡

RT-2最大模型达55B参数,运行频率仅1-3Hz,而5B小模型可达5Hz。大模型虽泛化更强,但难以满足实时控制需求。文章指出,未来可通过模型量化和蒸馏来加速推理。这揭示了具身智能中模型容量与实时性之间的根本矛盾,也是后续研究需重点优化的方向。

❓

Q&A

RT-2模型的主要功能是什么?

RT-2模型将预训练的视觉-语言大模型集成到机器人的低级控制中,以提高泛化能力和语义推理。

RT-2相比于RT1有哪些优势?

RT-2在新对象、背景和环境的泛化能力上优于RT1,并且能够通过联合微调实现视觉-语言-动作模型。

RT-2模型的训练过程中如何处理动作token?

RT-2在训练过程中将动作token与文本token对齐,以便生成可执行的动作。

RT-2模型的限制是什么?

RT-2无法学习新的行为,因为数据集限制无法提供足够的多样性,且参数量大导致无法实时推理。

RT-2如何实现闭环控制?

RT-2通过进一步训练视觉-语言模型,使其能够直接控制机器人的动作,从而实现闭环控制。

RT-2模型的参数量对其性能有什么影响?

RT-2的参数量较大,虽然可以提高模型的能力,但也导致无法进行实时推理。

🏷️

标签

➡️

继续阅读