小米公开MiMo-V2.6的Flash和Pro两款模型强化学习训练直播,实时展示花费、奖励曲线与显卡故障。训练36小时花费超108万美元。小米提出RL扩展三方向:训练计算量、环境与执行框架、评分计算量,并采用完全异步流水线及信用分配机制,以提升Agent任务能力。
完成下面两步后,将自动完成登录并继续当前操作。