内容提要
τ0-VLA是一种分层机器人基础模型,将高层子任务生成视为可扩展的推理问题。它通过世界模型预测候选子任务的视觉结果,并用价值模型评估,结合束搜索和反思模型选择最优子任务。低层策略在统一动作空间上执行,支持多种机器人形态。实验表明,这种测试时计算显著提升任务成功率和子任务预测准确率。
延伸解读
测试时计算:从语言模型到机器人决策
文章借鉴了语言模型中测试时计算的思想,将机器人高层子任务生成视为可扩展的推理问题。传统分层VLA模型每次前向传播固定推理预算,而τ0-VLA通过置信度触发额外推理,利用束搜索和反思模型,使计算量随决策难度动态调整。这种思路将计算资源集中在困难或高风险的选择上,可能提升长时程任务的鲁棒性。
世界模型在决策中的角色转变
与π0.7等模型不同,τ0-VLA中的世界模型并非用于细化已生成子任务的执行,而是在执行前预测候选子任务的视觉结果,供价值模型评估。这种“先预测后选择”的机制,使得高层决策能够基于预期的物理后果进行比较,而非仅依赖语言推理。文章强调,子任务作为推理单元,兼具稀疏性和时间延展性,适合进行这种基于预测的评估。
执行记忆的可纠正性设计
τ0-VLA的训练中,作者对演示记忆进行扰动,训练高层策略修复错误记录,无需额外标注。这一机制旨在让记忆更准确地反映真实进度,避免因记忆偏差导致后续决策失误。在长时程任务中,记忆的准确性直接影响子任务生成的质量,这种自纠正能力可能对实际部署中的鲁棒性有重要意义。
Q&A
τ0-VLA是什么?
τ0-VLA是一种分层机器人基础模型,它将高层子任务生成视为可扩展的推理问题,通过世界模型引导的测试时计算来生成和评估子任务,并由低层策略执行。
τ0-VLA如何利用世界模型进行测试时计算?
τ0-VLA在测试时通过“提案-预测-评估”循环进行推理:提案模型生成候选子任务,世界模型预测每个候选子任务的视觉结果,价值模型评估这些结果,然后通过束搜索和反思模型选择最优子任务。
τ0-VLA的高层策略如何决定是否进行额外推理?
当高层策略足够自信时,直接采用其生成的子任务提案;否则,由token级置信度统计触发额外的推理过程。
τ0-VLA的低层策略如何支持多种机器人形态?
低层策略在统一的40维状态与动作空间上运行,覆盖末端执行器、机械臂关节、夹爪、腰部以及移动底座,从而支持固定基座操作、双臂协同以及移动全身控制。
τ0-VLA的训练数据规模是多少?
τ0-VLA的低层策略在大约40,000小时、来源异构的机器人数据上进行训练,并结合多模态协同训练数据。
τ0-VLA与π0.7在世界模型的使用上有何不同?
在π0.7中,世界模型为高层策略已经生成的子任务生成子目标图像,视觉预测决定了已生成子任务将如何被执行;而在τ0-VLA中,视觉预测用于在多个候选子任务之间进行比较,以决定应执行哪一个子任务。
τ0-VLA的实验结果如何?
实验证明,τ0-VLA的分层测试时推理大幅提升了任务成功率,并提高了下一子任务预测的准确率。