内容提要
小米发布开源模型MiMo-V2.6,旗舰版为万亿参数,支持百万级上下文与多模态。其亮点是训练透明度:直播五天强化学习过程,公开约350万美元成本,并承诺以MIT许可开源超7000个RL任务环境、训练框架及模型权重。业界认为公开RL环境对推动开源前沿极具价值,也凸显“开放权重”与“开源”的区别。
延伸解读
开放权重与开源:小米的实践差异
文章指出,业界常将“开放权重”与“开源”混为一谈,但两者并不等同。许多所谓开放模型仅提供可下载的权重,训练过程仍不公开。小米MiMo-V2.6不仅以MIT许可发布权重,还承诺开源超7000个RL任务环境、训练框架等,更接近真正开源。Meta的Llama虽常被称为开源,却附带显著限制,引发开源倡导者批评。小米此举在开放程度上走得更远。
公开RL成本:透明度与可比性
小米直播了五天强化学习过程,公开成本:Flash模型约85.4万美元,Pro模型约262万美元,合计约350万美元。文章提醒,这仅覆盖RL阶段,未包含预训练费用。此前MiniMax-M1的RL阶段GPU租赁成本为53.47万美元,DeepSeek R1为29.4万美元。但直接比较有限,因为MiMo-V2.6-Pro规模更大,RL任务更侧重长周期智能体任务。
RL环境开源:为何被视为关键推动
Hugging Face联合创始人Thomas Wolf认为,在RLVR(可验证奖励强化学习)范式下,环境本身成为训练的关键要素,发布高质量开源RL环境是当前推动开源前沿最有影响力的事,相当于新范式下的高质量预训练数据。小米承诺开源超7000个任务环境,覆盖软件工程、漏洞复现、知识工作与网页开发等。但截至文章撰写时,Hugging Face链接仅包含三个模型发布,环境等资源尚未出现。
Q&A
小米MiMo-V2.6-Pro有哪些核心规格?
MiMo-V2.6-Pro是万亿参数模型,每次激活420亿参数,支持100万token上下文窗口,并支持文本、图像、音频和视频。
小米如何公开MiMo-V2.6的强化学习训练过程?
小米从9月15日起通过公共仪表盘直播强化学习训练,实时暴露生产RL运行指标,持续五天,并公开了成本:Flash模型854,044美元,Pro模型2,620,670美元,合计约350万美元。
MiMo-V2.6在开源方面发布了哪些资源?
小米以MIT许可证发布了模型权重、技术报告和基于Qwen的90亿参数模型,并承诺完全开源超过7000个RL任务环境、端到端训练框架和轻量级智能体工具。
为什么公开RL环境对开源前沿很重要?
因为模型开发转向可验证奖励的强化学习(RLVR),环境成为训练的关键成分。Hugging Face联合创始人Thomas Wolf认为,发布高质量开源RL环境是当前推动开源前沿最有影响力的事情,相当于在RLVR范式下共享高质量预训练数据。
MiMo-V2.6-Pro在独立评测中表现如何?
Artificial Analysis给MiMo-V2.6-Pro的智能指数评分为46,在其追踪的114个大型开放权重模型中排名第一。
“开放权重”和“开源”有什么区别?MiMo-V2.6如何体现?
“开放权重”通常只提供可下载的模型权重,而训练过程大多不公开;“开源”则要求公开更多资源。MiMo-V2.6不仅以MIT许可证发布权重,还承诺开源RL环境、训练框架等,比多数开放权重模型更接近真正的开源。