“令人印象深刻的开放程度”:小米凭借MiMo-V2.6远超常规开放权重套路

“令人印象深刻的开放程度”:小米凭借MiMo-V2.6远超常规开放权重套路

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

小米发布开源模型MiMo-V2.6,旗舰版为万亿参数,支持百万级上下文与多模态。其亮点是训练透明度:直播五天强化学习过程,公开约350万美元成本,并承诺以MIT许可开源超7000个RL任务环境、训练框架及模型权重。业界认为公开RL环境对推动开源前沿极具价值,也凸显“开放权重”与“开源”的区别。

🔎

延伸解读

开放权重与开源:小米的实践差异

文章指出,业界常将“开放权重”与“开源”混为一谈,但两者并不等同。许多所谓开放模型仅提供可下载的权重,训练过程仍不公开。小米MiMo-V2.6不仅以MIT许可发布权重,还承诺开源超7000个RL任务环境、训练框架等,更接近真正开源。Meta的Llama虽常被称为开源,却附带显著限制,引发开源倡导者批评。小米此举在开放程度上走得更远。

公开RL成本:透明度与可比性

小米直播了五天强化学习过程,公开成本:Flash模型约85.4万美元,Pro模型约262万美元,合计约350万美元。文章提醒,这仅覆盖RL阶段,未包含预训练费用。此前MiniMax-M1的RL阶段GPU租赁成本为53.47万美元,DeepSeek R1为29.4万美元。但直接比较有限,因为MiMo-V2.6-Pro规模更大,RL任务更侧重长周期智能体任务。

RL环境开源:为何被视为关键推动

Hugging Face联合创始人Thomas Wolf认为,在RLVR(可验证奖励强化学习)范式下,环境本身成为训练的关键要素,发布高质量开源RL环境是当前推动开源前沿最有影响力的事,相当于新范式下的高质量预训练数据。小米承诺开源超7000个任务环境,覆盖软件工程、漏洞复现、知识工作与网页开发等。但截至文章撰写时,Hugging Face链接仅包含三个模型发布,环境等资源尚未出现。

❓

Q&A

小米MiMo-V2.6-Pro有哪些核心规格?

MiMo-V2.6-Pro是万亿参数模型,每次激活420亿参数,支持100万token上下文窗口,并支持文本、图像、音频和视频。

小米如何公开MiMo-V2.6的强化学习训练过程?

小米从9月15日起通过公共仪表盘直播强化学习训练,实时暴露生产RL运行指标,持续五天,并公开了成本:Flash模型854,044美元,Pro模型2,620,670美元,合计约350万美元。

MiMo-V2.6在开源方面发布了哪些资源?

小米以MIT许可证发布了模型权重、技术报告和基于Qwen的90亿参数模型,并承诺完全开源超过7000个RL任务环境、端到端训练框架和轻量级智能体工具。

为什么公开RL环境对开源前沿很重要?

因为模型开发转向可验证奖励的强化学习(RLVR),环境成为训练的关键成分。Hugging Face联合创始人Thomas Wolf认为,发布高质量开源RL环境是当前推动开源前沿最有影响力的事情,相当于在RLVR范式下共享高质量预训练数据。

MiMo-V2.6-Pro在独立评测中表现如何?

Artificial Analysis给MiMo-V2.6-Pro的智能指数评分为46,在其追踪的114个大型开放权重模型中排名第一。

“开放权重”和“开源”有什么区别?MiMo-V2.6如何体现?

“开放权重”通常只提供可下载的模型权重,而训练过程大多不公开;“开源”则要求公开更多资源。MiMo-V2.6不仅以MIT许可证发布权重,还承诺开源RL环境、训练框架等,比多数开放权重模型更接近真正的开源。

🏷️

标签

➡️

继续阅读