内容提要
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、开箱等任务中,成功率显著提升,动作更平滑,展示了在线后训练对修正基础策略偏差的价值。
延伸解读
异步执行下的在线强化学习挑战
真实机器人部署中,模型推理速度跟不上执行速度,常采用异步方式:机器人执行当前动作时,模型在后台计算下一段动作。这导致模型生成的动作序列与实际执行的动作不一致。传统在线强化学习假设模型生成什么就执行什么,但在异步场景下,若将整段动作用于学习,未执行或未完全执行的动作可能被错误归因于任务成败,影响策略更新。SmoothRL通过区分动作区域,只对真正执行的部分进行学习,以解决这一错位问题。
训练与部署一致性:Reinforce in Deployment
SmoothRL强调训练与部署应遵循相同的时间节奏,即在训练rollout中直接运行异步推理,使模型计算与机器人执行并行发生,replay buffer记录真实时间关系下的轨迹。这一原则避免了先在同步环境训练再切换到异步部署带来的差异,确保优化目标与真实运行过程一致,从而提升策略在真实场景中的表现。
真实任务中的显著提升与学习曲线波动
在动态投掷、给笔戴帽、快递开箱三项真机任务中,SmoothRL将成功率分别从39%提升至94%、从8%提升至83%、从30%提升至90%。值得注意的是,开箱任务的学习曲线并非单调上升,中途曾出现成功率下降,表明真实在线探索存在波动。此外,在线RL后动作平滑性显著改善,加速度均方根下降52%,急动度下降47%,显示策略不仅更准确,也更平稳。
SmoothRL的边界与未来方向
SmoothRL当前依赖预设的推理延迟预算,且轻量残差策略的表达能力受限于冻结的基础策略。若基础策略与目标行为差距过大,局部修正可能无法弥补。论文使用稀疏的成功/失败奖励,并允许操作员介入,因此并非完全自主进化。未来计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略的端到端优化结合。
Q&A
SmoothRL 框架主要解决什么问题?
SmoothRL 解决的是在真实机器人异步执行场景下,在线强化学习应该从哪些动作中学习的问题。传统在线 RL 假设模型生成的动作与机器人执行的动作一致,但异步执行中,模型生成的动作只有一部分被真正执行,如果对整段动作进行学习,会导致未执行的动作被错误地归因于成功或失败。SmoothRL 只对真正执行的动作进行强化学习,并保持训练与部署的节奏一致。
SmoothRL 如何划分 action chunk 并决定学习哪些动作?
SmoothRL 将 action chunk 按执行状态划分为三个区域:Committed(已提交)、Execution(正在执行)、Discarded(被丢弃)。训练时只让梯度穿过 Execution 区域,即只对机器人真正执行的动作进行强化学习,避免未执行动作被错误归因。
SmoothRL 在真实机器人上取得了哪些成果?
SmoothRL 在星尘智能 S1 机器人上测试了三项任务:动态投掷成功率从 39% 提升到 94%,给笔戴帽从 8% 提升到 83%,快递开箱从 30% 提升到 90%。同时,动作平滑性显著改善,投掷任务中加速度均方根下降 52%,急动度下降 47%。
为什么真实机器人需要异步推理?
因为 VLA 等模型生成动作序列的推理时间较长,机器人不能每隔几百毫秒就停下来等待模型推理。尤其在投掷等动态任务中,停顿会导致速度下降,任务失败。因此,真实部署中采用异步推理:机器人继续执行当前动作,模型在后台计算下一段动作。
SmoothRL 的训练原则是什么?
SmoothRL 的训练原则是“Reinforce in Deployment”,即在训练 rollout 中直接运行异步推理,让模型计算和机器人执行并行发生,使训练和部署遵守同一套时间节奏。这样模型从训练开始就面对真实执行动态,而不是先在同步世界训练再部署。
SmoothRL 的局限性有哪些?
SmoothRL 的局限性包括:要求每次 chunk-level inference 在预设延迟预算内完成;轻量 residual policy 的表达能力受冻结基础策略限制,如果基础策略本身离目标行为太远,局部修正无法弥补。
SmoothRL 与星尘智能的模型布局有什么关系?
SmoothRL 是星尘智能模型布局中 RL 后训练的一部分,其布局包括前端 Agent、中间基座模型和 RL 后训练。基座模型提供通用操作能力,RL 从真实执行中修正策略,实现持续进化。SmoothRL 体现了星尘对动作作为“第一公民模态”的长期判断。