REFACTOR-VLA:类型化运动程序的无监督库学习

REFACTOR-VLA:类型化运动程序的无监督库学习

💡 原文英文,约600词,阅读约需3分钟。
📝

内容提要

REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,利用行为等价核聚类动作片段,并生成类型化lambda程序。在LIBERO基准测试中,增大世界模型参数反而降低性能,而加入InfoNCE辅助对比损失显著提升技能聚类质量,各套件NMI值达0.462至0.915。

🔎

延伸解读

世界模型并非越大越好

文章指出,将世界模型参数从1.88亿增至4.3亿,反而导致LIBERO全部四个套件性能下降。这提示在VLA系统中,单纯扩大世界模型规模可能带来过拟合或优化困难,而非预期中的收益。研究者应更关注架构设计与训练目标,而非盲目追求参数量的提升。

对比损失对技能聚类至关重要

在Phase A中加入InfoNCE辅助对比损失,显著提升了Phase C中技能聚类的质量,各套件NMI值从0.462到0.915不等。这表明,通过对比学习使世界模型更好地区分行为差异,有助于后续发现更清晰、可复用的技能,是提升系统整体性能的关键因素。

行为等价判断的新思路

REFACTOR-VLA通过在世界模型中滚动动作结果来定义行为等价核,避免了依赖LLM判断或嵌入聚类的主观性。这种方法更贴合机器人实际动力学,为长时程任务中的技能发现提供了更可靠的依据,可能启发后续研究在技能学习中对行为等价性的更严谨定义。

Q&A

REFACTOR-VLA是什么?

REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,它利用行为等价核聚类动作片段,并生成类型化lambda程序,以提升视觉-语言-动作模型在长时程任务上的表现。

REFACTOR-VLA与现有VLA模型(如OpenVLA、π0)的主要区别是什么?

现有VLA模型是“单体式”的,直接生成原始动作,缺乏可复用的抽象;而REFACTOR-VLA通过“唤醒/睡眠”架构学习可复用的技能库,并生成类型化lambda程序,从而更好地处理长时程任务并提高可解释性。

REFACTOR-VLA中的“唤醒/睡眠”架构是如何工作的?

在睡眠阶段,系统使用行为等价核(BEK)对动作片段进行聚类,BEK基于在潜在世界模型中的动作结果;在唤醒阶段,系统生成类型化lambda项,并由库条件化的整流流动作解码器生成动作。只有通过最小描述长度(MDL)和返回保持门控的抽象才被接受为技能。

REFACTOR-VLA的训练分为哪几个阶段?

训练分为三个阶段:阶段A(世界模型预热)训练潜在世界模型Mφ;阶段B(唤醒阶段策略优化)优化使用技能库的策略;阶段C(睡眠阶段技能发现)将动作片段聚类为可复用技能。

在LIBERO基准测试中,增大世界模型参数对性能有何影响?

在LIBERO基准测试中,将世界模型参数从1.88亿增加到4.3亿,反而导致4个套件的性能均下降,表明单纯增大世界模型并不总是有益。

加入InfoNCE辅助对比损失对技能聚类质量有何影响?

加入InfoNCE辅助对比损失显著提升了技能聚类的质量,在LIBERO各套件上NMI值达到0.462至0.915,表明对比损失有助于学习更好的动作表示。

REFACTOR-VLA在LIBERO各套件上的NMI值是多少?

在n=3多次播种下,Object套件NMI为0.462±0.021,Spatial套件为0.867±0.025,Goal套件为0.915±0.013,LIBERO-10套件为0.754±0.010。

🏷️

标签

➡️

继续阅读