BeingBeyond发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8,将触觉纳入“预测-执行-反馈”链路。模型通过TactoHand从无触觉标注视频中推断接触,通用触觉编码器统一信号,TopoHand对齐动作,并利用超50万小时数据训练,实现包中取物、毛笔写字等精细任务。
本文探讨了PI公司发布的Human to Robot数据采集工作,强调通过人类视频学习技能的潜力。研究表明,多样化的数据预训练能提升机器人对人类数据的迁移能力,促进其在新任务和场景中的泛化。作者提出了一种联合训练方案,验证了多样化预训练的重要性。
本文介绍了XSkill模仿学习框架,通过分析人类和机器人操纵视频,提取可重用的机器人操作技能。该框架结合条件扩散策略和人类视频经验,显著提升了机器人在复杂任务中的表现,实验结果表明其性能优于传统方法。
完成下面两步后,将自动完成登录并继续当前操作。