机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作

机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作

💡 原文中文,约3100字,阅读约需8分钟。
📝

内容提要

Generalist AI发布机器人基础模型GEN-1.5,支持一次性学习,机器人看3-12秒演示即可学会新任务,无需梯度更新或微调。模型能举一反三,结合不同演示,甚至从模拟器学后直接应用于现实。此能力源于大规模物理数据预训练,类似GPT-3的上下文学习,但成功率仅59%,提升至83%需额外微调。

🔎

延伸解读

物理世界的上下文学习

GEN-1.5的核心突破在于将大语言模型中的上下文学习(In-Context Learning)引入物理世界。它通过观看3-12秒的动作演示,无需梯度更新或微调即可学会新任务,这类似于GPT-3通过几个例子理解新任务。这种能力源于大规模物理数据预训练,模型在连续动作中自然涌现出根据上下文调整行为的能力,而非专门设计。

成功率与局限性

尽管GEN-1.5展示了惊人的一次性学习能力,但其成功率目前仅为59%(10种任务平均)。若额外提供5分钟数据和10步梯度更新,成功率可提升至83%。团队指出,通过上下文临时学到的技能稳定性不及专门微调的模型,且测试任务多为短程、原子化操作,实际应用仍需谨慎评估。

模拟到现实的迁移

GEN-1.5不仅能从真实演示中学习,还能利用模拟器中的演示(如脚本策略、强化学习Agent或人类遥控操作)作为上下文,直接应用于现实世界。例如,模型观看模拟器中的虚拟演示后,能在真实环境中1:1复现任务,且该任务此前未在模拟或现实中训练过。这为机器人学习提供了更灵活的数据来源。

Q&A

GEN-1.5是什么?它有什么核心能力?

GEN-1.5是Generalist AI发布的机器人基础模型,主打一次性学习(One-shot Learning)。它通过大规模物理数据预训练,能让机器人只看3-12秒的动作演示就学会新任务,无需梯度更新或微调。此外,它还能结合不同演示、从模拟器学到的技能直接应用到现实世界。

GEN-1.5是如何实现一次性学习的?

GEN-1.5通过大规模物理数据预训练,在连续的真实物理交互数据中学习。这些数据天然包含重复、延续和失败恢复,使模型能够根据刚刚发生的动作和结果来预测下一步,从而在上下文中学习新任务,无需梯度更新或微调。

GEN-1.5的成功率如何?如何提升?

在10种任务上,仅给一次物理提示且无梯度更新时,GEN-1.5的平均成功率为59%。如果每个任务额外提供5分钟数据并进行10步梯度更新,成功率可提升至83%。

GEN-1.5能结合不同的演示吗?

能。GEN-1.5可以将两段不同的教学演示拼接起来,自主完成中间未演示的衔接动作,如重新定位、调整抓法、切换姿势,甚至从错误中恢复,从而形成一个连续任务。

GEN-1.5能从模拟器学习并应用到现实吗?

可以。GEN-1.5能够从模拟器中的虚拟演示(如脚本策略、强化学习Agent或人类遥控操作)中学习,然后直接应用到真实世界,无需在模拟器或现实中专门训练。

GEN-1.5的一次性学习能力是专门设计的吗?

不是。Generalist AI表示,他们并没有专门设计模型架构、元学习循环或目标函数来教GEN-1.5进行一次性学习。这种能力是在大规模物理数据预训练过程中自然涌现的,类似于GPT-3的上下文学习能力。

GEN-1.5的局限性是什么?

目前GEN-1.5的测试任务多为短程、相对原子化的操作,通过上下文学习临时获得的技能稳定性不如专门微调后的模型。此外,在无梯度更新时成功率仅为59%,仍有较大提升空间。

🏷️

标签

➡️

继续阅读