小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
从海量互联网视频中检索人类操作示范,英伟达联合莱斯大学发布RoboTok,提升下游机器人任务成功率

莱斯大学与英伟达提出RoboTok,一个面向互联网规模人类视频的示范检索数据引擎。它从网络视频中筛选片段、重建三维手部轨迹,学习运动嵌入空间,实现高效相似行为检索,无需任务标签。实验显示其检索质量远超基线,并能提升灵巧操作策略成功率,为机器人学习提供可持续扩展的数据来源。

从海量互联网视频中检索人类操作示范,英伟达联合莱斯大学发布RoboTok,提升下游机器人任务成功率

HyperAI超神经 HyperAI超神经 · 2026-09-10T15:06:52Z
具身ICL来了创业玩家!上下文成Scaling新赛道

具身智能领域兴起In-Context Learning(ICL)趋势,机器人通过观看演示视频即可学习新任务,无需微调。Skild AI和Generalist AI等公司展示了相关成果,但面临视觉理解、多模态和长上下文记忆等挑战。国内创业公司可可矩阵致力于将ICL作为底层范式,通过条件表征和轻量动作生成提升机器人学习效率,并探索自我纠错能力。

具身ICL来了创业玩家!上下文成Scaling新赛道

量子位 量子位 · 2026-09-06T11:44:21Z
RoboPocket——从UMI式被动采集到无机器人即时策略迭代:基于iPhone与AR视觉前瞻的实时闭环数采系统(无需离线SLAM后处理)

RoboPocket系统利用智能手机作为边缘计算设备,通过实时反馈和AR视觉前瞻,统一数据采集、训练和测试角色,实现无机器人的即时策略迭代。它采用同构夹爪和感知完备设计确保数据质量,并通过主动验证和时空同步支持多设备协作,降低机器人学习门槛。

RoboPocket——从UMI式被动采集到无机器人即时策略迭代:基于iPhone与AR视觉前瞻的实时闭环数采系统(无需离线SLAM后处理)

结构之法 算法之道 结构之法 算法之道 · 2026-09-01T05:03:12Z
机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了

自变量机器人发布HOST框架,使机器人仅需观看29秒人类演示视频即可学会新技能,无需更新参数或采集数据。该框架采用双专家MoT架构,视觉大脑理解任务进度,动作大脑反推动作,成功率62%,比传统方案快507倍。HOST避免灾难性遗忘,抗干扰强,已开源,推动普通人教机器人做家务的时代到来。

机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了

爱范儿 爱范儿 · 2026-08-03T09:00:36Z
李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业

EgoVerse是由佐治亚理工等机构发起的全球第一视角人类操作数据生态,旨在为机器人学习建立统一数据标准。光轮智能作为唯一中国公司参与,提供端侧采集、云端处理和仿真验证的质量控制体系,并同时参与NVIDIA等发起的Newton仿真标准,推动物理AI基础设施的全球定义。

李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业

量子位 量子位 · 2026-07-24T03:27:38Z
用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。

用世界模型给VLA当教练,原力灵机发布DW0.5,把RL搬进虚拟世界

量子位 量子位 · 2026-07-16T02:30:46Z
ViVa——基于视频生成模型的机器人RL价值估计:比原先基于VLM的价值函数,能更好的在动态交互环境中对当前进度和未来走势下所带来的回报做估计

本文探讨了觉-语言-动作(VLA)模型在机器人学习中的应用,提出了一种视频生成式价值模型(ViVa),通过预测未来状态来改进价值估计。ViVa结合预训练的视频生成模型、当前观测和本体感知,评估任务进展,提升机器人在复杂环境中的操作能力。研究表明,该方法在真实世界任务中表现优越,能够有效跟踪任务进度并处理新颖物体。

ViVa——基于视频生成模型的机器人RL价值估计:比原先基于VLM的价值函数,能更好的在动态交互环境中对当前进度和未来走势下所带来的回报做估计

结构之法 算法之道 结构之法 算法之道 · 2026-04-16T05:50:55Z
X-VLA——基于Soft Prompt的Transformer编码器练就可扩展的跨本体VLA:VLM做多模态感知,DiT-style做动作生成

本文介绍了一种新型机器人学习模型X-VLA,采用软提示技术以提升跨具身机器人学习的适应性和泛化能力。通过引入可学习的嵌入,X-VLA有效解决了不同硬件和任务环境下的异质性问题,增强了模型在多样化数据集上的表现。该模型在多个基准测试中表现优异,展现出在灵巧操作和适应新领域方面的强大能力。

X-VLA——基于Soft Prompt的Transformer编码器练就可扩展的跨本体VLA:VLM做多模态感知,DiT-style做动作生成

结构之法 算法之道 结构之法 算法之道 · 2026-02-21T05:00:30Z
具身智能资源汇总:机器人学习数据集,在线体验世界建模模型,英伟达/字节/小米等最新研究论文……

本文探讨了具身智能的研究及其在物理世界中的应用,强调通过与环境互动形成智能。推荐了一系列高质量数据集、在线教程和论文,涵盖机器人学习、视觉问答等领域,以支持学习与研究。

具身智能资源汇总:机器人学习数据集,在线体验世界建模模型,英伟达/字节/小米等最新研究论文……

HyperAI超神经 HyperAI超神经 · 2026-01-23T04:03:34Z
GR-RL——首个让机器人系鞋带的VLA:先离线RL训练一个“分布式价值评估器”以做任务进度预测,后数据增强,最后在线RL

本文探讨了视觉语言动作(VLA)与强化学习(RL)结合的必要性,提出了GR-RL框架,以提高机器人在长时域操作中的灵巧性和精确度。GR-RL通过离线RL过滤次优数据,增强动作并进行在线RL调整,解决了人类示范中的噪声和不匹配问题。尽管GR-RL在高精度任务中表现出色,但仍面临行为漂移等局限性。

GR-RL——首个让机器人系鞋带的VLA:先离线RL训练一个“分布式价值评估器”以做任务进度预测,后数据增强,最后在线RL

结构之法 算法之道 结构之法 算法之道 · 2025-12-08T06:57:55Z
π∗0.6——RL微调流式VLA π0.6:先基于演示数据做离线RL预训练,再在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)

本文介绍了RECAP框架在π∗0.6模型中的应用,通过结合示范数据和自主经验,提升机器人在复杂任务中的学习能力。该框架采用离线预训练和在线微调,优化决策过程,显著提高了机器人在制作咖啡和折叠衣物等任务中的表现。

π∗0.6——RL微调流式VLA π0.6:先基于演示数据做离线RL预训练,再在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)

结构之法 算法之道 结构之法 算法之道 · 2025-11-18T15:13:09Z
走进全宇宙:开源物理引擎与OpenUSD推动机器人学习

NVIDIA的Newton物理引擎和Isaac GR00T模型通过OpenUSD加速机器人学习,支持人形机器人在复杂环境中高效操作。采用“模拟优先”方法,机器人可在虚拟环境中并行训练,提升技能,优化在工厂和公共场所的应用。

走进全宇宙:开源物理引擎与OpenUSD推动机器人学习

NVIDIA Blog NVIDIA Blog · 2025-09-30T13:00:07Z

美国东北大学与波士顿动力RAI联合提出的HEP框架,通过坐标系转移接口实现机器人高效学习。该框架的分层结构提升了灵活性,自动适应空间变化,显著降低了数据依赖。实验结果显示,HEP在复杂任务中的成功率提升了60%,为未来多模态智能体集成提供了新路径。

机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025

量子位 量子位 · 2025-07-22T09:28:14Z
NVIDIA研究突破推动先进机器人运动

NVIDIA在亚特兰大国际机器人与自动化会议上展示了其在生成AI、仿真和自主操作方面的研究突破。这些创新将推动自主车辆和类人机器人的发展,提升安全性和控制能力,主要研究包括生成4D驾驶场景、实时感知故障监测和人机交互政策调整,旨在改善机器人学习和应用的可靠性。

NVIDIA研究突破推动先进机器人运动

NVIDIA Blog NVIDIA Blog · 2025-05-19T15:00:53Z
迈向机器人领域ImageNet,大牛Pieter Abbeel领衔国内外高校共建RoboVerse,统一仿真平台、数据集和基准

RoboVerse是一个统一的机器人学习平台,解决了数据集和评估体系的碎片化问题。它提供MetaSim接口,支持多种仿真器,构建高质量合成数据集,并实现混合仿真,提升迁移效果。此外,平台支持遥操作和AI自动生成任务,显著提高研究效率与实验规模。

迈向机器人领域ImageNet,大牛Pieter Abbeel领衔国内外高校共建RoboVerse,统一仿真平台、数据集和基准

机器之心 机器之心 · 2025-04-08T10:38:12Z

本研究提出AutoEval系统,旨在全自动化评估机器人学习中的策略,提升评估效率与质量,并与人工评估高度一致,促进广泛应用。

AutoEval: Autonomous Evaluation of General Robot Operating Policies

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-31T00:00:00Z

本研究提出了一种增强时间感知和任务完成感的方法,以应对预训练视觉表征(PVRs)在视觉-运动机器人学习中的挑战,显著提升了在分布外场景中的鲁棒性和机器人学习性能。

When Pre-trained Visual Representations Are Insufficient: Limitations in Visual-Motor Robot Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-05T00:00:00Z
在开源冲刺中为Imagination-to-Real贡献力量!

Imagination-to-Real通过结合生成性AI和经典物理模拟器,提供真实、多样和几何准确的视觉数据,改变了机器人学习方式,帮助机器人训练复杂任务,并鼓励开源贡献。

在开源冲刺中为Imagination-to-Real贡献力量!

DEV Community DEV Community · 2025-01-16T06:35:00Z

「新锐论前沿」第四期线上分享活动将于12月18日举行,普渡大学博士生徐政通将分享机器人学习中的数据高效触觉表征,介绍GelSight的应用,并探讨少量样本学习的可泛化触觉表征。活动还将进行抽奖,参与者有机会获得算力资源。

线上分享| 面向机器人学习的数据高效触觉表征

HyperAI超神经 HyperAI超神经 · 2024-12-17T03:09:29Z

本研究提出了一种自回归预训练方法Moto,旨在解决机器人学习中缺乏标记数据的问题。通过将视频内容转化为潜在运动标记序列,提升机器人在动态环境中的操控性能。

Moto: A Latent Motion Token as the Bridging Language for Robot Manipulation

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-12-05T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码