世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

💡 原文中文,约5200字,阅读约需13分钟。
📝

内容提要

BeingBeyond发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8,将触觉纳入“预测-执行-反馈”链路。模型通过TactoHand从无触觉标注视频中推断接触,通用触觉编码器统一信号,TopoHand对齐动作,并利用超50万小时数据训练,实现包中取物、毛笔写字等精细任务。

🔎

延伸解读

触觉进入世界模型的难点

现有世界模型大多以视觉为核心,难以准确判断接触是否发生、接触位置及受力情况。同时,触觉传感器种类繁多,数据形态不统一,且大规模人类视频和机器人数据集普遍缺少同步的触觉记录。因此,训练具备触觉能力的世界模型面临统一表征和规模化数据获取的双重挑战。Being-H0.8通过隐式触觉表示和数据处理管线,尝试解决这些难题。

隐式触觉预测的优势

Being-H0.8不在像素层面重建未来画面,而是在隐空间中预测与任务相关的交互后果,如是否发生接触及状态变化,并据此调节动作生成。这种隐式预测方式使机器人能从无触觉标注的人类视频中学习接触与受力结果的判断,将触觉纳入“预测-执行-反馈”链路,提升精细操作能力。

数据规模与质量并重

Being-H0.8使用超过50万小时的第一人称视频数据,但原始视频需经过过滤、去重、切分、语言标注和分布再平衡等处理。团队还通过TactoHand从视频中推断接触和邻近度,并加入约55小时的压力手套数据,以补充真实物理信息。数据规模与质量并重,是模型能力提升的关键。

统一表征与动作对齐

为解决触觉数据格式不统一和手部动作差异问题,Being-H0.8设计了通用触觉编码器,将不同来源的触觉信号映射到统一手部拓扑上的触觉金字塔,并引入有效性标记区分“无传感器”和“读数为零”。同时,TopoHand将人手、灵巧手和夹爪的动作统一到相同表示槽位,实现跨本体动作对齐。

Q&A

Being-H0.8是什么?

Being-H0.8是BeingBeyond(智在无界)发布的首个基于人类视频数据的隐式触觉世界动作模型,它将触觉纳入“预测-执行-反馈”链路,使机器人能预判接触并实时调整动作。

Being-H0.8与之前的世界模型有什么不同?

以往世界模型以视觉为核心,难以判断接触和受力;Being-H0.8首次将触觉纳入隐空间表示,在预训练阶段学习接触预判,并在执行中根据触觉反馈调整动作,形成完整的“预测-执行-反馈”闭环。

Being-H0.8如何解决触觉数据缺乏的问题?

通过TactoHand从无触觉标注的人类视频中推断接触和邻近度,生成伪触觉监督;同时加入约55小时真实压力手套数据,两者互补,形成大规模触觉训练数据。

Being-H0.8的通用触觉编码器有什么作用?

通用触觉编码器将不同传感器采集的触觉信号统一为触觉token,建立由粗到细的触觉金字塔,并利用Perceiver结构压缩为固定数量token,解决触觉数据格式不统一的问题。

TopoHand是如何统一人手和机器人动作的?

TopoHand将手部表示拆分为手腕位姿、形态编码、20个规范关节角和夹爪张开量,使语义相近的动作映射到相同表示槽位,从而对齐人手、灵巧手和夹爪的动作空间。

Being-H0.8在真实机器人上完成了哪些任务?

在真实双臂机器人上完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖触觉的高难度精巧任务。

Being-H0.8的训练数据规模有多大?

使用了超过50万小时的第一人称视频数据,并包含约55小时、540万同步帧的压力手套数据。

Being-H0.8的数据处理流程包括哪些步骤?

包括过滤无效片段、切分长视频、语言标注、手部动作恢复(MANO、HMR)、相机参数补齐、机器人数据标准化,以及触觉标注(TactoHand)和表征统一(通用触觉编码器、TopoHand)。

🏷️

标签

➡️

继续阅读