τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估

τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估

💡 原文中文,约4900字,阅读约需12分钟。
📝

内容提要

τ0-VLA是一种分层机器人基础模型,将高层子任务生成视为可扩展的推理问题。它通过世界模型预测候选子任务的视觉结果,并用价值模型评估,结合束搜索和反思模型选择最优子任务。低层策略在统一动作空间上执行,支持多种机器人形态。实验表明,这种测试时计算显著提升任务成功率和子任务预测准确率。

🔎

延伸解读

测试时计算:从语言模型到机器人决策

文章借鉴了语言模型中测试时计算的思想,将机器人高层子任务生成视为可扩展的推理问题。传统分层VLA模型每次前向传播固定推理预算,而τ0-VLA通过置信度触发额外推理,利用束搜索和反思模型,使计算量随决策难度动态调整。这种思路将计算资源集中在困难或高风险的选择上,可能提升长时程任务的鲁棒性。

世界模型在决策中的角色转变

与π0.7等模型不同,τ0-VLA中的世界模型并非用于细化已生成子任务的执行,而是在执行前预测候选子任务的视觉结果,供价值模型评估。这种“先预测后选择”的机制,使得高层决策能够基于预期的物理后果进行比较,而非仅依赖语言推理。文章强调,子任务作为推理单元,兼具稀疏性和时间延展性,适合进行这种基于预测的评估。

执行记忆的可纠正性设计

τ0-VLA的训练中,作者对演示记忆进行扰动,训练高层策略修复错误记录,无需额外标注。这一机制旨在让记忆更准确地反映真实进度,避免因记忆偏差导致后续决策失误。在长时程任务中,记忆的准确性直接影响子任务生成的质量,这种自纠正能力可能对实际部署中的鲁棒性有重要意义。

Q&A

τ0-VLA是什么?

τ0-VLA是一种分层机器人基础模型,它将高层子任务生成视为可扩展的推理问题,通过世界模型引导的测试时计算来生成和评估子任务,并由低层策略执行。

τ0-VLA如何利用世界模型进行测试时计算?

τ0-VLA在测试时通过“提案-预测-评估”循环进行推理:提案模型生成候选子任务,世界模型预测每个候选子任务的视觉结果,价值模型评估这些结果,然后通过束搜索和反思模型选择最优子任务。

τ0-VLA的高层策略如何决定是否进行额外推理?

当高层策略足够自信时,直接采用其生成的子任务提案;否则,由token级置信度统计触发额外的推理过程。

τ0-VLA的低层策略如何支持多种机器人形态?

低层策略在统一的40维状态与动作空间上运行,覆盖末端执行器、机械臂关节、夹爪、腰部以及移动底座,从而支持固定基座操作、双臂协同以及移动全身控制。

τ0-VLA的训练数据规模是多少?

τ0-VLA的低层策略在大约40,000小时、来源异构的机器人数据上进行训练,并结合多模态协同训练数据。

τ0-VLA与π0.7在世界模型的使用上有何不同?

在π0.7中,世界模型为高层策略已经生成的子任务生成子目标图像,视觉预测决定了已生成子任务将如何被执行;而在τ0-VLA中,视觉预测用于在多个候选子任务之间进行比较,以决定应执行哪一个子任务。

τ0-VLA的实验结果如何?

实验证明,τ0-VLA的分层测试时推理大幅提升了任务成功率,并提高了下一子任务预测的准确率。

🏷️

标签

➡️

继续阅读