PRISM——用4段真人搬运视频,让机器人学会搬运各种东西:以真实视频为“种子”,生成“换个物体人会怎么搬”的反事实交互视频,再重建并重定向为符合物理规则的轨迹,最后通过师生蒸馏出策略

PRISM——用4段真人搬运视频,让机器人学会搬运各种东西:以真实视频为“种子”,生成“换个物体人会怎么搬”的反事实交互视频,再重建并重定向为符合物理规则的轨迹,最后通过师生蒸馏出策略

💡 原文中文,约5900字,阅读约需14分钟。
📝

内容提要

PRISM提出“真实到仿真再到真实”框架,利用视频到视频生成将少量真实视频扩增为256段反事实人-物交互视频,并以接触为锚点重建和重定向为物理合理的机器人轨迹,训练单一深度策略。人形机器人无需真实微调,仅凭机载深度即可零样本抓取、搬运和放置箱子、桶、料箱和球等未见物体。

🔎

延伸解读

数据瓶颈的破解思路

文章指出,训练人形机器人搬运物体的主要障碍不是算法,而是缺乏多样且高质量的人–物交互视频。互联网视频虽多,但符合全身可见、交互清晰等条件的片段筛选成本极高。PRISM的应对策略是用视频到视频生成,将4段真实种子视频扩增为256段反事实视频,从而绕开大规模数据采集的难题。

反事实视频的独特价值

PRISM生成的反事实视频并非简单替换物体外观。当物体类别、尺寸或姿态改变时,人的搬运行为也会相应调整,例如弯腰幅度、手部间距和接触策略。这意味着每个视频片段提供了一种基于物体条件的交互策略,而不仅是几何增强。这种行为层面的多样性,是硬编码增强难以获得的。

接触锚点如何贯穿全流程

文章的核心技术洞见是将接触信号作为共享约束,贯穿重建、重定向和策略学习。重建阶段,接触耦合人体与物体运动,物体接触可修正人体姿态误差;重定向阶段,接触锚点指定机器人末端执行器在物体上的作用位置,引导优化出物理合理的轨迹;策略学习阶段,锚点定义接触奖励,用于训练教师策略。

零样本部署的边界与意义

PRISM训练出的单一深度策略,无需真实世界微调,仅凭机载深度和摇杆指令,就能让人形机器人抓取、搬运和放置箱子、桶、料箱和球等未见物体。文章强调,该策略还能泛化到生成视频中从未出现的类别。不过,这一结论基于特定实验设置,实际部署中的鲁棒性仍需进一步验证。

❓

Q&A

PRISM 是什么?它主要解决人形机器人学习中的什么问题?

PRISM 是一种“真实到仿真再到真实”的框架,旨在通过将少量真实视频扩增为大规模且多样化的训练集,解决人形机器人视觉模仿学习中高质量人-物交互视频难以大规模获取的瓶颈。

PRISM 如何从少量真实视频生成大量训练数据?

PRISM 使用视频到视频(V2V)生成技术,以4段真实搬运视频为种子,通过类别级文本提示替换被操控物体,生成256段反事实人-物交互视频,涵盖箱子、球、垃圾桶和桶等不同几何形状和初始配置。

什么是反事实视频?它在 PRISM 中起什么作用?

反事实视频是指展示在源视频中并未发生、但更换物体后本可以发生的交互情形的视频。在 PRISM 中,它们用于提供行为层面的多样性,使模型能够学习适应不同物体几何、尺寸和姿态的交互策略,而不仅仅是几何增强。

PRISM 如何确保从单目视频重建的轨迹物理合理?

PRISM 采用以接触为锚点的 real-to-sim 流水线:在重建阶段,利用人-物体接触联合正则化人体和物体运动;在重定向阶段,使用接触锚点指定机器人末端执行器在物体上的接触位置,将嘈杂的重建结果优化为物理合理的机器人-物体轨迹。

PRISM 训练出的策略在真实机器人上表现如何?

PRISM 训练出一个基于深度信息的单一策略,在真实人形机器人上无需任何真实世界微调,仅凭机载深度观测和摇杆控制,即可零样本抓取、搬运和放置箱子、桶、料箱和球等未见物体,并适应全新实例、不同尺寸和多种初始配置。

PRISM 的核心技术挑战是什么?它如何解决?

核心挑战是在反事实视频生成和单目重建均引入误差的情况下,仍获得物理合理的机器人示范。PRISM 的关键洞见是将接触信号作为贯穿重建、重定向和策略学习各阶段的共享约束,从而耦合人体与物体运动,纠正重建误差并引导物理合理的轨迹优化。

🏷️

标签

➡️

继续阅读