莱斯大学与英伟达提出RoboTok,一个面向互联网规模人类视频的示范检索数据引擎。它从网络视频中筛选片段、重建三维手部轨迹,学习运动嵌入空间,实现高效相似行为检索,无需任务标签。实验显示其检索质量远超基线,并能提升灵巧操作策略成功率,为机器人学习提供可持续扩展的数据来源。
具身智能领域兴起In-Context Learning(ICL)趋势,机器人通过观看演示视频即可学习新任务,无需微调。Skild AI和Generalist AI等公司展示了相关成果,但面临视觉理解、多模态和长上下文记忆等挑战。国内创业公司可可矩阵致力于将ICL作为底层范式,通过条件表征和轻量动作生成提升机器人学习效率,并探索自我纠错能力。
RoboPocket系统利用智能手机作为边缘计算设备,通过实时反馈和AR视觉前瞻,统一数据采集、训练和测试角色,实现无机器人的即时策略迭代。它采用同构夹爪和感知完备设计确保数据质量,并通过主动验证和时空同步支持多设备协作,降低机器人学习门槛。
自变量机器人发布HOST框架,使机器人仅需观看29秒人类演示视频即可学会新技能,无需更新参数或采集数据。该框架采用双专家MoT架构,视觉大脑理解任务进度,动作大脑反推动作,成功率62%,比传统方案快507倍。HOST避免灾难性遗忘,抗干扰强,已开源,推动普通人教机器人做家务的时代到来。
EgoVerse是由佐治亚理工等机构发起的全球第一视角人类操作数据生态,旨在为机器人学习建立统一数据标准。光轮智能作为唯一中国公司参与,提供端侧采集、云端处理和仿真验证的质量控制体系,并同时参与NVIDIA等发起的Newton仿真标准,推动物理AI基础设施的全球定义。
原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。
本文探讨了觉-语言-动作(VLA)模型在机器人学习中的应用,提出了一种视频生成式价值模型(ViVa),通过预测未来状态来改进价值估计。ViVa结合预训练的视频生成模型、当前观测和本体感知,评估任务进展,提升机器人在复杂环境中的操作能力。研究表明,该方法在真实世界任务中表现优越,能够有效跟踪任务进度并处理新颖物体。
本文介绍了一种新型机器人学习模型X-VLA,采用软提示技术以提升跨具身机器人学习的适应性和泛化能力。通过引入可学习的嵌入,X-VLA有效解决了不同硬件和任务环境下的异质性问题,增强了模型在多样化数据集上的表现。该模型在多个基准测试中表现优异,展现出在灵巧操作和适应新领域方面的强大能力。
本文探讨了具身智能的研究及其在物理世界中的应用,强调通过与环境互动形成智能。推荐了一系列高质量数据集、在线教程和论文,涵盖机器人学习、视觉问答等领域,以支持学习与研究。
本文探讨了视觉语言动作(VLA)与强化学习(RL)结合的必要性,提出了GR-RL框架,以提高机器人在长时域操作中的灵巧性和精确度。GR-RL通过离线RL过滤次优数据,增强动作并进行在线RL调整,解决了人类示范中的噪声和不匹配问题。尽管GR-RL在高精度任务中表现出色,但仍面临行为漂移等局限性。
本文介绍了RECAP框架在π∗0.6模型中的应用,通过结合示范数据和自主经验,提升机器人在复杂任务中的学习能力。该框架采用离线预训练和在线微调,优化决策过程,显著提高了机器人在制作咖啡和折叠衣物等任务中的表现。
NVIDIA的Newton物理引擎和Isaac GR00T模型通过OpenUSD加速机器人学习,支持人形机器人在复杂环境中高效操作。采用“模拟优先”方法,机器人可在虚拟环境中并行训练,提升技能,优化在工厂和公共场所的应用。
美国东北大学与波士顿动力RAI联合提出的HEP框架,通过坐标系转移接口实现机器人高效学习。该框架的分层结构提升了灵活性,自动适应空间变化,显著降低了数据依赖。实验结果显示,HEP在复杂任务中的成功率提升了60%,为未来多模态智能体集成提供了新路径。
NVIDIA在亚特兰大国际机器人与自动化会议上展示了其在生成AI、仿真和自主操作方面的研究突破。这些创新将推动自主车辆和类人机器人的发展,提升安全性和控制能力,主要研究包括生成4D驾驶场景、实时感知故障监测和人机交互政策调整,旨在改善机器人学习和应用的可靠性。
RoboVerse是一个统一的机器人学习平台,解决了数据集和评估体系的碎片化问题。它提供MetaSim接口,支持多种仿真器,构建高质量合成数据集,并实现混合仿真,提升迁移效果。此外,平台支持遥操作和AI自动生成任务,显著提高研究效率与实验规模。
本研究提出AutoEval系统,旨在全自动化评估机器人学习中的策略,提升评估效率与质量,并与人工评估高度一致,促进广泛应用。
本研究提出了一种增强时间感知和任务完成感的方法,以应对预训练视觉表征(PVRs)在视觉-运动机器人学习中的挑战,显著提升了在分布外场景中的鲁棒性和机器人学习性能。
Imagination-to-Real通过结合生成性AI和经典物理模拟器,提供真实、多样和几何准确的视觉数据,改变了机器人学习方式,帮助机器人训练复杂任务,并鼓励开源贡献。
「新锐论前沿」第四期线上分享活动将于12月18日举行,普渡大学博士生徐政通将分享机器人学习中的数据高效触觉表征,介绍GelSight的应用,并探讨少量样本学习的可泛化触觉表征。活动还将进行抽奖,参与者有机会获得算力资源。
本研究提出了一种自回归预训练方法Moto,旨在解决机器人学习中缺乏标记数据的问题。通过将视频内容转化为潜在运动标记序列,提升机器人在动态环境中的操控性能。
完成下面两步后,将自动完成登录并继续当前操作。