内容提要
Meta发布AI模型Muse Spark 1.3,编程能力超越GPT-5.6 Sol,价格低21倍。其“贡献者版”以数据换低价,引发隐私争议。模型在基准测试中登顶,但最强模式未上线,且训练数据来源不明。Meta五个月更新四版,急于证明实力,但开源承诺成疑,开发者成测试对象。
延伸解读
价格差背后的数据交易
Muse Spark 1.3的“贡献者版”比标准版便宜21倍,但代价是用户数据可能被用于训练。这种模式并非Meta首创,但Meta将其明码标价,让用户自行选择。对于开发者而言,低价意味着更低的实验成本,但同时也意味着他们可能成为模型迭代的“测试员”。这种数据换低价的模式,实际上是一种隐性的数据交易,用户需要权衡成本与隐私。
基准测试的局限性
Muse Spark 1.3在DeepSWE v1.1上登顶,但在其他基准测试中与竞品互有胜负,且最强模式“max推理”尚未上线。这提醒我们,基准测试分数并不能完全代表实际体验。此前1.2版本被曝出低级错误,说明高分与真实使用之间可能存在鸿沟。开发者不应仅依赖基准分数,而应进行实际测试。
快速迭代背后的压力
Meta在五个月内发布了四个版本的Muse Spark,这种节奏在AI行业并不常见。背后原因包括扎克伯格对AI战略的调整、巨额投资带来的回报压力,以及Llama 4失利后急于证明自己的心态。快速迭代虽然能加速产品改进,但也可能导致安全测试不足和模型稳定性问题。
开源承诺的倒退
Meta曾是开源AI的旗手,但Muse Spark系列至今未决定是否公开权重,仅“计划”发布1.2版本。这种从开源到闭源的转变,反映了AI研发的高昂成本。然而,Meta一边限制模型开放,一边通过“贡献者版”获取用户数据,这种不对等的交换可能引发开发者信任危机。
Q&A
Muse Spark 1.3的编程能力相比GPT-5.6 Sol如何?
根据官方数据,Muse Spark 1.3在DeepSWE v1.1编程基准上得分75.4,超过GPT-5.6 Sol的73.0,登顶第一。
Muse Spark 1.3的贡献者版和标准版价格差多少?为什么?
贡献者版输入每百万tokens 0.1美元,输出0.2美元;标准版输入1.25美元,输出4.25美元,差价最高21倍。区别在于贡献者版允许Meta使用用户数据训练模型,而标准版承诺不使用。
Muse Spark 1.3的max推理模式为什么没有上线?
Meta表示max推理模式还在进行额外的安全测试,因此发布当天未上线。
Meta为什么在五个月内频繁更新Muse Spark?
原因包括:扎克伯格调整AI战略,新任负责人Alexandr Wang带来快速迭代风格;Meta在AI上投入巨大,需要展示成果;Llama 4失败后,Meta急于证明自身实力。
Muse Spark的训练数据来源存在哪些问题?
Meta未公布完整训练数据清单,来源不明;被曝使用Scale AI雇佣的零工爬取社交媒体数据,授权链条不清;法院文件显示内部代号为'Avocado'和'Watermelon',但具体数据未知。
Meta在Muse Spark上的开源承诺有何变化?
Meta尚未决定是否公开1.3权重,仅计划发布1.2权重,且是'计划'而非'承诺',从开源标兵转向闭源,引发争议。
Muse Spark 1.3在代理能力测试中的表现如何?
在GDPVal-AA v2上得分1754,低于Claude Opus 5的1824;在OSWorld 2.0上66.9分,低于Opus 5的68.3;在AutomationBench上49.4分,低于Opus 5的50.3;但在DeepSWE上75.4分,高于Opus 5的74.0。