“谷歌仅领先几小时”:Muse Spark 1.3 超越 Gemini,Meta 宣称其最大编码飞跃

“谷歌仅领先几小时”:Muse Spark 1.3 超越 Gemini,Meta 宣称其最大编码飞跃

💡 原文英文,约1500词,阅读约需6分钟。
📝

内容提要

Meta发布Muse Spark 1.3推理模型,宣称在编码和智能体任务上进步最大,性能接近前沿且成本极低。该模型在基准测试中超越GPT-5.6和Claude Opus 5,独立测试显示其性价比最高。Meta还推出Muse Code编码代理及订阅计划,并预告开放权重版本及下一代模型Watermelon。

🔎

延伸解读

基准测试的局限

Meta 公布的对比数据并非独立测试,其自家模型通过 API 运行,而第三方结果来自不同来源,且测试条件不一。Spark 1.3 的“max”推理级别仍处于有限预览,公开可用的“xhigh”版本得分略低。因此,这些数字应谨慎解读,实际性能可能因任务而异。

性价比之争

独立测试显示,Spark 1.3 xhigh 在智能指数上得分 61,与 GPT-5.6 Sol max 和 Grok 4.6 high 持平,但每任务成本仅 0.55 美元,远低于后两者的 0.95 美元左右。尽管比 Spark 1.2 贵,但性价比依然突出,这可能是 Meta 吸引开发者的关键卖点。

竞争节奏加快

谷歌 Gemini 3.8 Flash 仅领先数小时就被 Spark 1.3 超越,凸显了 AI 模型竞争的激烈程度。Meta 在不到五个月内推出四个版本,并计划发布开放权重版本,这可能进一步加剧竞争。然而,有评论指出,这种互相较劲可能只是“小打小闹”,真正的竞争在于更广泛的 AI 生态。

Q&A

Meta发布的Muse Spark 1.3是什么?

Muse Spark 1.3是Meta于2026年9月发布的最新低成本推理模型,是Muse Spark系列的最新版本,主要提升在编码和智能体任务上的性能。

Muse Spark 1.3在基准测试中的表现如何?

Meta宣称Muse Spark 1.3在DeepSWE编码基准上得分75.4%,在MRCR长上下文测试(512K-1M)上得分98.1%,超越了GPT-5.6 Sol和Claude Opus 5。但需注意这些是Meta自行汇编的结果,并非独立测试。

Muse Spark 1.3的性价比如何?

根据Artificial Analysis的独立测试,Muse Spark 1.3 xhigh版本在智能指数上得分为61,每任务成本约0.55美元,是同等智能水平下最具成本效益的模型,比GPT-5.6 Sol max和Grok 4.6 high(均为0.95美元左右)更便宜。

Muse Spark 1.3与Gemini 3.8 Flash相比如何?

在Artificial Analysis的测试中,Muse Spark 1.3 xhigh在智能指数上得分61,高于Gemini 3.8 Flash的59,且每任务成本更低(0.55美元 vs 0.58美元),因此将Gemini 3.8 Flash挤出了帕累托前沿。

Muse Spark 1.3的开放权重版本何时发布?

Meta CEO马克·扎克伯格表示,Muse Spark的开放权重版本将“很快”发布,但具体许可条款尚未公布,因此开发者能否自由使用尚不确定。

Muse Code是什么?

Muse Code是Meta推出的终端编码代理,于2026年8月与Spark 1.2一起进入测试版,9月正式发布,并提供订阅计划,起价每月5美元。

Meta的下一代模型Watermelon有什么信息?

Watermelon是Meta正在开发的下一代模型,预计比Spark更大,截至2026年7月仍在训练中,具体发布时间未定,但扎克伯格暗示不会太久。

🏷️

标签

➡️

继续阅读