内容提要
莱斯大学与英伟达提出RoboTok,一个面向互联网规模人类视频的示范检索数据引擎。它从网络视频中筛选片段、重建三维手部轨迹,学习运动嵌入空间,实现高效相似行为检索,无需任务标签。实验显示其检索质量远超基线,并能提升灵巧操作策略成功率,为机器人学习提供可持续扩展的数据来源。
延伸解读
互联网视频作为机器人示范数据的潜力与挑战
互联网视频包含海量人类操作行为,覆盖多样场景、物体和视角,为机器人学习提供了低成本、可扩展的示范数据来源。然而,网络视频非结构化,拍摄视角、遮挡和主体可见性差异大,且视觉相似不意味着操作行为相似。因此,需要能自动识别操作相关行为的数据引擎,不依赖任务标签或特定摄像机配置。RoboTok 正是针对这一需求设计,从异构视频中检索相似操作示范。
RoboTok 检索性能显著优于现有基线
在自建评估语料库上,RoboTok 达到 mAP@20=0.353、Recall@20=0.996,而最佳基线 STRAP 的 mAP@20 仅 0.007、Recall@20 为 0.12。在 AssemblyHands 跨数据集测试中,RoboTok 的 mAP@5 为 0.261,高于 STRAP 的 0.133。平均 DTW 代价方面,RoboTok 为 1.095 米,仅比真实邻居的 0.966 米高 13%,远低于随机检索的 1.911 米。这表明 RoboTok 能稳定检索出运动匹配的示范。
检索示范切实提升下游灵巧操作策略成功率
在 VTDexManip 仿真基准上,使用 RoboTok 检索示范引导的策略在 6 个任务中的 5 个超过最佳预训练方法,已见物体平均成功率提高 7.45%,未见物体提高 5.83%。在更高难度设置下,RoboTok 优势更明显:BottleCap Turning 任务成功率 77.3%,比 HAND 高 17.8 个百分点;Faucet Screwing 任务 44.8%,高 38.0 个百分点;Lever Sliding 任务 79.3%,高 59.8 个百分点。这证明检索数据能实际改善策略性能。
可扩展的数据引擎与未来方向
RoboTok 将计算成本高的轨迹比较转移到训练阶段,推理时仅需编码查询视频并在内积索引中进行最近邻搜索,新视频可直接编码加入索引而无需重新训练。这使其能持续吸收新增互联网视频,作为不断扩展的示范数据源。研究团队计划未来扩展至运动摄像机拍摄的视频,包括第三人称和自我中心视角,以进一步缓解机器人学习的数据采集瓶颈。
Q&A
RoboTok是什么?它主要解决机器人学习中的什么问题?
RoboTok是莱斯大学和英伟达联合提出的一个面向互联网规模人类视频的示范检索数据引擎。它旨在解决机器人学习中示范数据采集成本高昂、难以扩展到长尾任务的问题,通过从互联网视频中自动检索与任务相关的操作示范,为下游机器人策略提供训练数据。
RoboTok是如何从互联网视频中提取和利用人类操作示范的?
RoboTok首先筛选出手部清晰可见且摄像机基本静止的4-8秒视频片段,然后使用WiLoR以5fps估计三维手部关键点,并用HaWoR补全缺失姿态,重建真实尺度的三维手部轨迹。接着,通过轻量级轨迹编码器将轨迹映射到运动嵌入空间,实现基于运动相似度的检索,无需任务标签。
RoboTok在检索性能上相比现有方法有哪些优势?
在评估中,RoboTok的mAP@20达到0.353,Recall@20为0.996,远优于最佳基线STRAP(mAP@20仅0.007)。在AssemblyHands数据集上,RoboTok的mAP@5为0.261,也高于STRAP的0.133。其检索结果的平均DTW代价仅比真实邻居高13%,表明检索质量更高。
使用RoboTok检索的示范数据如何提升下游机器人任务的成功率?
在VTDexManip仿真基准上,使用RoboTok检索示范引导的策略在6个任务中的5个超过了最佳预训练方法,已见物体平均成功率提高7.45%,未见物体提高5.83%。在高难度设置下,RoboTok在BottleCap Turning任务中成功率达77.3%,比第二名高17.8个百分点;在Faucet Screwing中达44.8%,提高38.0个百分点;在Lever Sliding中达79.3%,提高59.8个百分点。
RoboTok的检索模型是如何训练的?
RoboTok采用轻量级轨迹编码器处理三维手部轨迹,生成归一化嵌入向量。训练时使用以锚点为中心的分组构建批次,每个锚点采样两条正样本和一条边界负样本。训练目标包括集合损失(鼓励DTW排名前K的邻居得分更高)和排序损失(保持正样本间的相对排序与DTW一致),从而学习到能复现局部DTW邻域结构的嵌入空间。
RoboTok如何实现高效检索并支持持续扩展?
RoboTok在离线阶段将每条轨迹编码一次并存储到内积索引中;在线阶段,给定查询视频,直接进行余弦相似度最近邻搜索,无需计算DTW。新视频片段可通过编码器生成嵌入并加入索引,无需重新训练模型,因此能持续吸收新增视频,实现可持续扩展。