教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

💡 原文中文,约3400字,阅读约需9分钟。
📝

内容提要

灵初智能提出逆向思路:用真实机器人数据经Psi-W0生成对应人手示范,构建强配对数据,训练端到端转换器,将人类视频转为机器人可执行动作。Psi-R2.5借此提升数据质量与任务多样性,并探索上下文学习,让示范直接提示机器人。预训练旨在减少后训练数据量,降低部署成本,手机盒装配成功率约99%。

🔎

延伸解读

逆向生成:从机器人数据反推人手示范

灵初智能提出一种逆向思路:以真实机器人操作数据为起点,利用Psi-W0生成对应的人手示范,从而构建强配对数据。这种数据要求场景一致、动作时序逐帧对应,且机器人动作能在真机回放成功。相比直接采集,逆向生成更易获得高质量配对样本,用于训练端到端转换器,将人类视频转为机器人可执行动作。

数据质量:从堆时长转向任务多样性

Psi-R2.5重新梳理数据质量,减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线将任务拆解为原子动作再标注审核。灵初强调,数据价值不能只按小时算,还要看覆盖多少种任务、机器人能用上多少。这种思路旨在让预训练积累的能力更有效地迁移到后训练,减少适配所需数据量。

上下文学习:示范作为即时提示

灵初在Psi-R2.5中探索上下文学习,让机器人无需更新模型参数,仅根据当前上下文提供的示范推断该做什么。人类示范可通过强配对数据模型转换为机器人数据,作为提示输入已训练好的模型。这提供了一种新交互方式:新任务不一定重新训练,也可以用一段示范告诉机器人怎么做。但当前展示限于特定任务,更多细节尚待公布。

预训练与后训练:降低部署成本

灵初指出,预训练并非让后训练消失,而是让后训练需要的数据更少,从而降低适配与部署成本。以手机盒装配为例,结合人工参与与强化学习的后训练框架,经几轮迭代,任务成功率达到约99%,耗时1-2个工作日。机器人无需从零学起,只需补充少量任务数据,并在客户现场持续收集失败数据用于下一轮改进。

Q&A

灵初智能提出的逆向思路具体是什么?

灵初智能逆向使用Psi-W0,从真实机器人数据出发,生成对应的人手操作数据,构建强配对数据,再训练端到端转换器,将人类视频转为机器人可执行动作。

强配对数据和弱配对数据有什么区别?

弱配对数据指人和机器人执行类似任务、主要在任务含义上对应的数据;强配对数据则要求除了本体不同,场景基本一致,动作时序逐帧对应,且机器人一侧动作能在真机上直接回放成功。

Psi-R2.5如何提升数据质量?

Psi-R2.5减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线将任务拆解到更细的原子动作,再进行标注和审核。

上下文学习(ICL)在Psi-R2.5中有什么作用?

ICL让机器人无需更新模型参数,根据当前上下文提供的线索推断该做什么、如何做。人类示范可转换为机器人数据作为提示输入模型,帮助机器人理解眼前示范。

预训练对机器人部署有什么意义?

预训练并非让后训练消失,而是让后训练需要的数据更少,从而降低适配与部署成本。机器人不用从零学起,只需补充少量任务数据。

手机盒装配任务的成功率和耗时如何?

通过结合人工参与与强化学习的后训练框架,经过几轮迭代,手机盒装配任务成功率达到约99%,耗时1-2个工作日。

🏷️

标签

➡️

继续阅读