内容提要
JetBrains 发布开源模型 Mellum 2.1,采用 12B 混合专家架构,激活参数 2.5B,Apache 2.0 许可。升级重点在后训练,通过大规模强化学习使模型能在真实代码库中探索、编辑文件并自查改动,并新增数学、竞赛编程、科学、工具调用等 RL 任务,自建数千环境和数百万沙箱。评测显示其智能体编程提升最大、速度最快,支持本地私有部署。
延伸解读
后训练成为升级核心
Mellum 2.1 的架构与 2.0 版本保持一致,仍为 12B 混合专家模型、激活参数 2.5B,但几乎全部改进来自后训练阶段。JetBrains 将强化学习从训练末期的短阶段提升为主要训练部分,并为此构建了数千个内部 RL 环境和数百万个沙箱。这意味着模型能力的提升主要依赖训练方法与数据质量的优化,而非参数规模扩张。
智能体编程能力提升最明显
在相同评测设置下,Mellum 2.1 相比 2.0 在智能体编程任务上进步最大,同时编码、竞赛编程、数学、工具调用和通用知识等维度也有全面提升。模型现在能够探索代码库、编辑文件并自查改动,这使其更适合作为编程智能体中的执行单元,而不仅是代码补全工具。
速度优势与部署灵活性
由于后训练未改动架构,Mellum 2.1 保持了与 2.0 相同的速度,并借助多令牌预测(MTP)进一步加速。在高负载下,它是同组模型中最快的,服务吞吐量约为 Qwen3.5-9B 的两倍;单请求场景下 MTP 带来约 1.6 倍加速。模型以 Apache 2.0 许可开源,支持本地或自有基础设施私有部署,适合对代码和数据控制有要求的团队。
数据过滤与生态支持
JetBrains 指出,开放 RL 数据集常存在测试损坏、答案不可验证或任务过难过易等问题,因此所有数据源在进入训练前都经过过滤。Mellum 2.1 已在 Hugging Face 发布,面向 llama.cpp、Ollama 和 LM Studio 的 GGUF 构建以及用于 vLLM 推测解码的 MTP 头即将推出,便于开发者在不同推理环境中集成。
Q&A
Mellum 2.1 是什么?
Mellum 2.1 是 JetBrains 发布的开源模型,采用 12B 混合专家架构,激活参数 2.5B,Apache 2.0 许可,专为编程智能体设计,可在自有硬件上运行。
Mellum 2.1 相比上一版主要升级了什么?
升级重点在后训练,通过大规模强化学习使模型能在真实代码库中探索、编辑文件并自查改动,并新增数学、竞赛编程、科学、工具调用等 RL 任务。
Mellum 2.1 的强化学习是如何训练的?
RL 从短期的最后阶段变成训练的主要部分,自建数千环境和数百万沙箱,结合开源 RL 数据集和自建任务,并对数据严格过滤。
Mellum 2.1 在性能评测中表现如何?
与 Mellum2、Qwen3.5-9B 和 Gemma 4 E4B 对比,Mellum2.1 在智能体编程上提升最大,并在编码、竞赛编程、数学、工具调用和通用知识上均有进步。
Mellum 2.1 的速度怎么样?
后训练未改变架构,因此与 Mellum2 一样快,多令牌预测(MTP)使其更快。重负载下是组内最快模型,吞吐量几乎是 Qwen3.5-9B 的两倍;单请求下 MTP 提速约 1.6 倍。
Mellum 2.1 有哪些主要使用场景?
可作为智能体系统中的高效工作者,处理从定位失败测试根因到起草和检查修复等任务;也能作为通用助手处理日常问题、数学和推理;支持本地或自有基础设施私有部署。