内容提要
Modular 发布 26.6 版本。Mojo 1.1 开放编译器外部贡献,内部问题迁至 GitHub 公开。MAX 26.6 新增音频生成,支持 MiniMax-Music3 文本生成音乐,并支持 Inkling 等新模型架构及投机解码。性能提升:NVIDIA B200 上 Gemma 4 解码注意力快 4.8 倍,MoE 路由快 7.9 倍;AMD MI355 解码注意力投影快 6.6 倍。modular 包已弃用,改用 max["all"] 等安装。
延伸解读
从开源到开放贡献:Mojo 生态的协作转向
Mojo 1.1 开始接受外部对编译器的贡献,并将内部问题迁移至公开 GitHub。这意味着开发者不再只是使用者,而能直接参与编译器演进。对依赖 Mojo 的团队来说,公开问题追踪有助于提前了解修复与特性进度,也降低了反馈路径的不确定性。不过,贡献仍需遵循官方指南,且核心方向仍由 Modular 团队主导。
音频生成落地:MAX 的多模态边界再扩展
MAX 26.6 新增 audio_generation 管线,首个支持模型为 MiniMax-Music3,可根据风格提示和歌词生成 44.1 kHz 立体声音频。该能力通过 /v1/audio/speech 和 /v1/responses 接口暴露,并提供时长、去噪步数、引导尺度等控制参数。这使 MAX 从文本、视觉、图像进一步覆盖音频输出,但当前仅明确支持这一款音乐生成模型。
性能提升的硬件差异:B200 与 MI355 各有侧重
官方基准显示,NVIDIA B200 上 Gemma 4 解码注意力提升最高 4.8 倍,MoE 路由提升 7.9 倍,低批量 NVFP4 量化提升 16 倍;AMD MI355 上解码注意力投影提升 6.6 倍,MXFP8 QKV 投影提升 4.8 倍。这些数字来自代表性负载,实际收益会随模型、批量与精度配置变化,选型时需结合自身工作负载验证。
安装方式变更:modular 包退役后的迁移注意
26.6 正式弃用 modular 包,改为按需安装 max["all"]、max["serve"] 或 max["benchmark"],conda 用户对应使用 max-serve 或 max-benchmark。若现有脚本或 CI 仍依赖 modular 包,升级时需同步调整安装命令与依赖声明,否则可能因包缺失导致部署或基准测试中断。
Q&A
Modular 26.6 版本在 Mojo 编译器方面有什么重要更新?
Mojo 1.1 开放了编译器外部贡献,并将内部问题迁移到公开的 GitHub 仓库,方便社区跟踪进展和协作。
MAX 26.6 新增了哪些音频生成功能?
MAX 26.6 新增音频生成支持,推出 audio_generation 管道,支持 MiniMax-Music3 文本生成音乐模型,可从风格提示和歌词生成 44.1 kHz 立体声音频,并通过 /v1/audio/speech 和 /v1/responses API 端点使用,支持时长、去噪步数、引导比例和输出格式等控制。
MAX 26.6 支持哪些新的模型架构?
MAX 26.6 新增对 Thinking Machines 的 Inkling(InklingForConditionalGeneration)架构的支持,并改进了 Kimi、Qwen、Gemma 和 GLM 系列模型,同时支持 DFlash 和 DSpark 等投机解码技术,以及改进的工具调用和数据类型支持。
MAX 26.6 在 NVIDIA B200 和 AMD MI355 上有哪些性能提升?
在 NVIDIA B200 上,Gemma 4 解码注意力提升高达 4.8 倍,MoE 路由提升高达 7.9 倍,低批量 NVFP4 量化提升高达 16 倍。在 AMD MI355 上,解码注意力投影性能提升高达 6.6 倍,MXFP8 QKV 投影比上一版本快 4.8 倍。
Modular 26.6 中安装方式有什么变化?
modular 包已弃用,改用 max["all"] 安装全部功能,或 max["serve"] 仅需端点,或 max["benchmark"] 仅需基准测试(使用 conda 时用 max-serve 或 max-benchmark)。
如何参与 Mojo 编译器的贡献或获取帮助?
可以查看贡献指南和公开的 GitHub 问题列表来开始贡献。如果遇到 26.6 版本的问题,可以在 GitHub 上提交。有关发布的问题,最好在 Modular 论坛提问,实时交流可加入 Discord 服务器。