3万小时触觉数据补齐具身智能“手感”!新智具身&复旦报告三连发

3万小时触觉数据补齐具身智能“手感”!新智具身&复旦报告三连发

💡 原文中文,约2500字,阅读约需6分钟。
📝

内容提要

NeoteAI与复旦大学联合发布N0系列模型,将触觉反馈作为具身智能核心,解决机器人物理交互难题。通过NeoData数据集和NeoForce统一表征,N0-VTLA预测未来触觉提升任务成功率,N0-TWAM将触觉融入世界模型。数据显示插头任务成功率从60%升至85%,长程任务成功率大幅提升,数据和模型均开源。

🔎

延伸解读

触觉数据统一:打破传感器“方言”壁垒

触觉数据规模化应用长期受制于不同传感器输出格式互不兼容,如凝胶形变图、电容矩阵或六维力向量,难以融合。NeoData数据集和NeoForce统一表征模型旨在解决此问题,学习具备迁移能力、时序结构化的触觉表征,实现跨设备数据融合。这为触觉数据的规模化采集和应用提供了基础,是具身智能发展的重要一步。

预测未来触觉:从“后视镜”到“预判雷达”

传统VLA模型直接拼接触觉与视觉信号,但触觉信号仅在接触瞬间高频响应,易被视觉Token淹没,且是滞后反馈。N0-VTLA提出预测未来50步触觉演变,将当前触觉编码为潜在Token,结合视觉上下文预判滑移、受力趋势,从而提前调整动作。实验显示,插插头任务成功率从60%提升至85%,拔钥匙任务从35%提升至99%,显著优于纯视觉方案。

触觉融入世界模型:让机器人在想象中推演

现有世界模型多局限于未来视觉图像生成,缺乏触感信息,导致物理对齐困难。N0-TWAM采用混合专家架构,同时预测未来视频、触觉和动作三个序列,总参数量72亿,仅为全宽方案一半。仿真平均成功率达84.5%,远超基线36%;真机8项任务平均成功率46.3%,优于LingBot-VA的21.9%。消融实验证实,去除未来触觉预测或当前触觉条件均导致性能显著下降,确立触觉在世界模型中的核心地位。

Q&A

N0系列模型主要解决了机器人的什么问题?

N0系列模型主要解决了机器人在物理交互中因缺乏触觉反馈而导致的失败问题,如插头难以插入、抓取力度失控等,通过将触觉作为核心模态,提升机器人在真实世界中的操作能力。

NeoData数据集和NeoForce统一表征模型的作用是什么?

NeoData数据集旨在打破不同触觉设备数据格式不兼容的壁垒,NeoForce统一表征模型则学习具有迁移能力和时序结构化的触觉表征,使不同传感器硬件的数据能够统一融合,为下游策略提供一致的触觉信息。

N0-VTLA模型如何提升机器人任务成功率?

N0-VTLA通过预测未来50步内的触觉演变,结合视觉上下文预判滑移、受力等趋势,指导动作模块提前调整,从而提升任务成功率。例如,插插头任务成功率从60%提升至85%,拔钥匙任务从35%提升至99%。

N0-TWAM模型相比传统世界模型有什么优势?

N0-TWAM同时预测未来的视频、触觉和动作序列,将触觉融入世界模型,解决了传统世界模型仅预测视觉图像而缺乏物理对齐的问题。在仿真中平均成功率达84.5%,远超最强基线36%;真机测试平均成功率46.3%,优于LingBot-VA的21.9%。

N0系列模型在长程任务上的表现如何?

N0-VTLA结合触觉信息和进度评估模型,利用失败数据训练,使机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率分别从50%、35%、20%提升至95%、80%、75%。

N0系列模型的数据和模型是否开源?

是的,N0系列模型的数据和模型均开源,项目链接为https://research.neoteai.com。

N0系列模型对具身智能行业的意义是什么?

N0系列模型将触觉从辅助模态提升为核心基建,验证了触觉的Scaling潜力,证明触觉可接入VLA架构,并确立了触觉在世界模型中的核心地位,推动机器人认知从视觉驱动向视触融合演进。

🏷️

标签

➡️

继续阅读