内容提要
Facet-0是一种面向高精度接触操作的机器人基础模型,结合视觉-语言骨干与流匹配动作专家,联合预测动作及未来腕部扭矩,将接触视为可预测结果。基于ManuFacet-1K数据集训练,并通过Action–Wrench Critic评估交互价值,实现策略细化,提升装配可靠性。
延伸解读
接触预测的价值
Facet-0 将接触视为动作的可预测结果,而非事后记录。通过联合预测动作与未来腕部扭矩,模型能显式编码“运动如何改变接触”,从而在亚毫米级装配中区分视觉相似但物理结果不同的动作。这种预测式交互学习,使策略在生成动作时即考虑其物理后果,为高精度操作提供了新的思路。
价值引导的策略细化
仅预测接触还不够,还需评估交互的价值。Facet-0 通过 Action–Wrench Critic 对候选动作及其预期扳动力进行估值,区分“有用交互”与“代价高昂的交互”。即使几何推进相似,干净对齐与卡滞也会被赋予不同价值,并通过接触选择性回传细化策略,从而提升部署可靠性。
数据与架构的支撑
ManuFacet-1K 数据集提供 1000 小时力信息同步的语料,覆盖多种机器人形态,为语义–接触表征学习奠定基础。架构上,PaliGemma 视觉-语言骨干与流匹配动作专家结合,通过结构化掩码隔离不同监督路径,避免目标泄露,同时保持语义广度和接触预测能力。
Q&A
Facet-0是什么?它主要解决什么问题?
Facet-0是一个面向高精度接触操作的机器人基础模型,旨在解决精密装配中最后毫米级的接触问题。它通过联合预测动作和未来腕部扭矩,将接触视为可预测的结果,并利用价值引导的策略细化来提升装配可靠性。
Facet-0如何实现语义与接触的对齐?
Facet-0采用PaliGemma视觉-语言骨干网络与流匹配动作专家相结合,通过多模态语义落地,将多视角图像、语言指令、机器人运动学状态和腕部扭矩历史融合成语义-接触表征,并在此基础上联合生成动作片段和预期的未来腕部扭矩,从而实现语义意图与接触后果的对齐。
ManuFacet-1K数据集有什么特点?
ManuFacet-1K是作者构建的一个时长1000小时、力信息同步的语料库,涵盖三种机器人形态、两个底盘家族以及多个制造单元,用于训练Facet-0,将大规模机器人数据扩展到高精度接触场景。
Facet-0如何评估交互的价值?
Facet-0通过训练一个分布式的Action–Wrench Critic来评估每个候选动作及其预期的扳动力,从而区分有用的交互和代价高昂的交互。即使两种运动在几何上类似,但若一种能干净对齐而另一种卡滞,它们也会被赋予不同的价值,并通过接触选择性回传将价值导向关键交互,用于细化生成式策略。
Facet-0在部署时如何适应部件动力学变化?
当部件动力学特性发生变化时,Facet-0采用有界的局部自适应,利用冻结的表示生成可执行的笛卡尔目标,同时保持对动作-接触耦合关系的预测能力,从而在限制在线更新范围的同时保留行为先验。
Facet-0的预测式交互学习是如何训练的?
训练时,每个示例提供动作和测量扭矩作为目标,通过条件流匹配对目标进行插值并优化速度场,同时使用交叉熵损失训练语义目标(如子任务和下一条指令)。动作和力扭矩预测通过标量进行平衡,并采用交替优化以避免量级差异问题。