内容提要
论文提出VLA-Precision框架,以解决真实世界VLA在线强化学习中的算法稳定性与系统效率瓶颈。算法层面提出ACoB,结合快速行为学习与渐进价值校准以抑制策略漂移;系统层面提出ACoB-Stream,通过经验上下文生成、持久化、访问与策略同步四阶段闭环,降低端到端开销,支持大规模VLA高效持续在线训练。
延伸解读
真实世界VLA在线RL的两大瓶颈
文章指出,真实世界VLA在线强化学习面临算法稳定性与系统效率两大瓶颈。算法上,不可靠的价值估计易导致策略漂移;系统上,大规模VLA的计算开销限制训练吞吐量。现有方法通过行为克隆约束缓解漂移,但对价值估计改善有限;依赖重放的优化过程在大规模VLA下成本显著增加。这凸显了开发更可靠RL算法与更高效训练系统的必要性。
ACoB如何抑制策略漂移
ACoB采用非对称协同自举,结合快速行为学习与渐进价值校准。快速行为学习基于干预引导,吸收成功的人类动作,加速策略改进;同时,随着自主交互经验累积,整体回报传播与局部偏好排序持续校准价值估计。相对动作优势用于指导基于参考正则化的策略改进,在保留任务能力的同时抑制策略漂移。这种跨时间尺度的协同自举闭环,使行为学习与价值估计相互促进。
ACoB-Stream的系统优化四阶段
ACoB-Stream通过四阶段闭环管理经验上下文与策略状态的生命周期:经验上下文生成保留冻结的VLM上下文,减少策略更新中的冗余计算;持久化通过去重和滑动窗口采样降低存储与随机访问开销;访问通过与目标对齐的检索提升数据访问效率;策略状态同步通过可训练子空间的策略发布降低同步开销。四阶段共同构成闭环“经验–策略”流,在受限算力和内存下降低端到端系统开销。
与现有真实世界RL方法的对比
文章对比了现有真实世界RL方法:HIL-SERL在1-2.5小时内达到近乎完美成功率,但任务内泛化有限;ConRFT在45-90分钟内达到96.3%平均成功率,但Q最大化牺牲先验性能并导致策略漂移;RL-100收敛缓慢,每任务平均需12.1小时真实机器人回合。大规模预训练VLA方法如π*0.6每任务需超过1,000次真实机器人回合,反馈效率低。ACoB建立在大规模预训练VLA之上,结合快速行为学习与渐进价值校准,并开发ACoB-Stream构建高效连续在线RL闭环。
Q&A
VLA-Precision 主要解决真实世界 VLA 在线强化学习中的哪些瓶颈?
主要解决两个瓶颈:算法稳定性方面,不可靠的价值估计可能导致策略漂移;系统效率方面,大规模 VLA 带来的计算开销限制训练吞吐量,降低整体在线 RL 效率。
ACoB 算法是如何抑制策略漂移的?
ACoB 将快速的行为学习与跨时间尺度的渐进式价值校准相结合。在较快时间尺度上,基于干预引导的行为学习快速吸收成功的人类动作;同时随着自主交互经验累积,整体回报传播与局部偏好排序持续校准价值估计,由此得到的相对动作优势用于指导基于参考正则化的策略改进,从而在保留已学任务能力的前提下抑制策略漂移。
ACoB-Stream 包含哪四个阶段?
ACoB-Stream 包含四个阶段:经验上下文生成、经验上下文持久化、经验上下文访问、策略状态同步。这四个阶段共同构成闭环的“经验–策略”流,降低真实世界在线强化学习的端到端系统开销。
VLA-Precision 的两阶段后训练流水线分别是什么?
阶段 I 在任务示范上执行全参数模仿学习,获得任务特定的策略先验;阶段 II 从该先验初始化真实世界的在线 RL,并在异步执行者-学习者系统中改进行为专家。
真实世界 VLA-RL 与基于仿真的 RL 相比有什么优势?
真实世界 RL 通过与物理环境直接交互来优化 VLA,使策略能够适应真实世界的动力学特性及传感器噪声,从而将预训练的 VLA 能力转化为精确、可靠的执行,避免仿真到现实的差距限制迁移可靠性。
ACoB-Stream 的设计原则是什么?
ACoB-Stream 以不变状态解耦和按需流式传输为核心设计原则,围绕状态生命周期组织闭环的“经验–策略”架构,以支持对大规模 VLA 在真实世界中进行高效、连续的在线强化学习。