内容提要
REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,利用行为等价核聚类动作片段,并生成类型化lambda程序。在LIBERO基准测试中,增大世界模型参数反而降低性能,而加入InfoNCE辅助对比损失显著提升技能聚类质量,各套件NMI值达0.462至0.915。
延伸解读
世界模型并非越大越好
文章指出,将世界模型参数从1.88亿增至4.3亿,反而导致LIBERO全部四个套件性能下降。这提示在VLA系统中,单纯扩大世界模型规模可能带来过拟合或优化困难,而非预期中的收益。研究者应更关注架构设计与训练目标,而非盲目追求参数量的提升。
对比损失对技能聚类至关重要
在Phase A中加入InfoNCE辅助对比损失,显著提升了Phase C中技能聚类的质量,各套件NMI值从0.462到0.915不等。这表明,通过对比学习使世界模型更好地区分行为差异,有助于后续发现更清晰、可复用的技能,是提升系统整体性能的关键因素。
行为等价判断的新思路
REFACTOR-VLA通过在世界模型中滚动动作结果来定义行为等价核,避免了依赖LLM判断或嵌入聚类的主观性。这种方法更贴合机器人实际动力学,为长时程任务中的技能发现提供了更可靠的依据,可能启发后续研究在技能学习中对行为等价性的更严谨定义。
Q&A
REFACTOR-VLA是什么?
REFACTOR-VLA是一种通过“唤醒/睡眠”架构学习可复用技能的系统,它利用行为等价核聚类动作片段,并生成类型化lambda程序,以提升视觉-语言-动作模型在长时程任务上的表现。
REFACTOR-VLA与现有VLA模型(如OpenVLA、π0)的主要区别是什么?
现有VLA模型是“单体式”的,直接生成原始动作,缺乏可复用的抽象;而REFACTOR-VLA通过“唤醒/睡眠”架构学习可复用的技能库,并生成类型化lambda程序,从而更好地处理长时程任务并提高可解释性。
REFACTOR-VLA中的“唤醒/睡眠”架构是如何工作的?
在睡眠阶段,系统使用行为等价核(BEK)对动作片段进行聚类,BEK基于在潜在世界模型中的动作结果;在唤醒阶段,系统生成类型化lambda项,并由库条件化的整流流动作解码器生成动作。只有通过最小描述长度(MDL)和返回保持门控的抽象才被接受为技能。
REFACTOR-VLA的训练分为哪几个阶段?
训练分为三个阶段:阶段A(世界模型预热)训练潜在世界模型Mφ;阶段B(唤醒阶段策略优化)优化使用技能库的策略;阶段C(睡眠阶段技能发现)将动作片段聚类为可复用技能。
在LIBERO基准测试中,增大世界模型参数对性能有何影响?
在LIBERO基准测试中,将世界模型参数从1.88亿增加到4.3亿,反而导致4个套件的性能均下降,表明单纯增大世界模型并不总是有益。
加入InfoNCE辅助对比损失对技能聚类质量有何影响?
加入InfoNCE辅助对比损失显著提升了技能聚类的质量,在LIBERO各套件上NMI值达到0.462至0.915,表明对比损失有助于学习更好的动作表示。
REFACTOR-VLA在LIBERO各套件上的NMI值是多少?
在n=3多次播种下,Object套件NMI为0.462±0.021,Spatial套件为0.867±0.025,Goal套件为0.915±0.013,LIBERO-10套件为0.754±0.010。