内容提要
小米公开MiMo-V2.6的Flash和Pro两款模型强化学习训练直播,实时展示花费、奖励曲线与显卡故障。训练36小时花费超108万美元。小米提出RL扩展三方向:训练计算量、环境与执行框架、评分计算量,并采用完全异步流水线及信用分配机制,以提升Agent任务能力。
延伸解读
直播训练:透明化背后的成本与风险
小米公开MiMo-V2.6强化学习训练直播,实时展示花费、奖励曲线和显卡故障。36小时花费超108万美元,平均每小时3万美元。这种透明化让外界直观看到大规模RL的高昂成本和硬件不稳定性,但也可能暴露训练细节。对于读者,这既是技术展示,也是风险提示:RL训练不仅烧钱,还面临节点故障等工程挑战。
RL扩展三方向:算力仍是核心瓶颈
小米提出RL扩展的三个方向:训练计算量、环境与执行框架、评分计算量。每个训练Step处理约20亿Token,采用完全异步流水线,支持多任务混合训练。但正如ViT大佬所言,三件事背后都是算力。这意味着RL scaling不仅需要算法创新,更依赖大规模计算资源,可能加剧行业算力竞赛。
信用分配:Agent任务中的关键难题
在Agent任务中,模型可能执行40步才完成任务,但最终只获得一个成功信号。如何判断哪些步骤真正贡献了成功?小米提到Agentic In-group Credit Assignment,利用同一Prompt的16条Rollout获得更细粒度信号。这反映了RL在复杂任务中的核心挑战:奖励稀疏且延迟,需要更精细的信用分配机制,否则学习效率低下。
模型进展:Flash快速追近,Pro小幅领先
训练初期,Pro的dynsam/avg@n从0.565提升至0.614,Flash从0.514提升至0.603。在DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77,但对比DeepSeek-Flash v1.1的74.2%仍有差距。Flash起点低但追近快,Pro因每步训练更慢,最新评分未出。这表明RL训练中不同模型规模的学习动态差异,也提示评测结果需结合训练进度看待。
Q&A
小米MiMo-V2.6强化学习训练直播公开了哪些信息?
直播页面公开了训练花费、训练步数、奖励曲线以及显卡故障情况。从Pro模型开始训练算起36小时,两款模型已花费超过108万美元,平均每小时3万美元。
小米提出的强化学习扩展有哪三个方向?
小米提出沿三个维度扩展强化学习:训练计算量、环境与执行框架、评分计算量。
MiMo-V2.6的Flash和Pro模型在强化学习训练中表现如何?
Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash从约0.514提升至0.603;在DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77。Flash从更低起点快速追近,Pro目前只保持小幅领先。
什么是完全异步流水线?在MiMo训练中如何应用?
完全异步流水线指不同任务可以同时处于不同阶段:有的Agent还在环境中执行任务,有的已完成等待判分,有的正在计算Reward,还有新任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成持续运转的异步流水线。
信用分配在Agent强化学习中为什么重要?
信用分配重要是因为复杂Agent任务中,仅告诉模型最终成功或失败(Reward=1)的学习信号非常粗糙,模型不知道哪些动作真正帮助了成功、哪些步骤毫无必要、哪次修改扭转了任务。MiMo采用Agentic In-group Credit Assignment,利用同组多条轨迹获得更细致的强化学习信号。
MiMo-V2.6训练中每个Step处理多少数据?
每个训练Step大约处理20亿Token,配置为1568个Prompt × 每个Prompt 16条Rollout,一轮可能产生超过2.5万条Rollout。对于Agent任务,一条Rollout可能经历几十轮思考、工具调用、环境反馈和再次行动,因此一个Step的Token数可达数十亿级别。