内容提要
马斯克宣布SpaceX将按任务选用最佳后端模型,包括竞品API。企业正普遍采用模型分流:用廉价小模型处理海量请求,昂贵前沿模型只做关键任务以控制成本。OpenRouter数据显示廉价“Flash”模型占据用量榜,但Claude Opus 5.5增长最快。测试表明廉价模型性能接近,切换前需充分评估。
延伸解读
模型分流成为企业控制成本的主流做法
文章指出,企业正普遍采用模型分流:用廉价小模型处理海量请求,昂贵前沿模型只做关键任务。在AI活动上,22位公司领导者中至少10人描述了按任务选模型的习惯。一家安全公司先通过规则引擎过滤,再将剩余数据交给小模型,大模型只处理最后部分。有高管表示,即使小模型,处理1PB数据也要数百万美元。成本是主要驱动力,有公司从无限AI预算转向追问token的实际价值。
切换模型有风险,评估测试不可跳过
文章强调,切换模型并非没有代价。一位工程负责人分享,团队在重要客户演示前三天换用新模型,因为基准测试显示更便宜且同样好,但工作流崩溃,团队周末回滚。他的教训是评估(evals)——一套本可提前发现问题的测试。类似地,Anthropic让Opus 5.5比Opus 5便宜20%,却破坏了代理依赖的四项功能。因此,切换前应充分测试,遵循“永远在切换”的ABS规则。
廉价模型承担用量,前沿模型增长最快
OpenRouter数据显示,截至10月7日当周,其十大最常用模型中四个是廉价“Flash”模型。Anthropic新推出的Haiku 5.5输入价格降至每百万token 0.10美元,针对10万token以下请求降价90%,适合分类和路由等高容量任务。但前沿模型也在增长:Claude Opus 5.5按用量排第九,周环比增长74%,为前十中最快,并在OpenRouter智能指数上排名第一。这显示昂贵模型正获得更多工作,但用量仍远低于廉价模型。
廉价模型性能接近,但需注意测试条件
TNS的测试表明,廉价模型性能可接近前沿模型。Claude Sonnet 5.5在15次编码运行中全部通过,成本比Opus 5.5低42%,而Opus 5.5通过13次;不过Sonnet有四次运行是在提高输出token限制后才通过。前一天,GPT-6.1 Sol以GPT-6 Astra 18%的成本达到相同准确率。这些结果支持分流策略,但也提醒读者:廉价模型可能需要调整参数才能发挥最佳效果,且模型迭代迅速,如DeepSeek V4.1 Flash一个月内从无到成为OpenRouter最热模型。
Q&A
马斯克宣布SpaceX将如何选择AI模型?
SpaceX将根据任务选择最佳后端模型,包括使用Claude Opus 5.5、MidJourney、Suno等竞品API,以获取最佳结果。
企业为什么采用模型分流策略?
主要为了控制成本。企业用廉价小模型处理海量请求,昂贵前沿模型只做关键任务,避免在非必要任务上花费过多。
OpenRouter数据显示了哪些模型使用趋势?
廉价“Flash”模型占据用量榜多数,但Claude Opus 5.5增长最快,一周增长74%,且在智能指数上排名第一。
切换AI模型时需要注意什么风险?
切换模型可能导致工作流中断,需提前进行充分评估(evals),测试新模型是否真的更优,避免因基准测试误导而失败。
企业常见的模型分流具体如何操作?
常见做法是漏斗式:先用规则引擎过滤,再交给小模型处理,只有剩余部分才用大模型;或用廉价模型先理解用户意图,再让昂贵模型执行。
廉价模型在性能上能否替代昂贵模型?
测试表明廉价模型性能接近。例如Claude Sonnet 5.5通过所有15项编码测试,成本比Opus 5.5低42%;GPT-6.1 Sol以18%的成本达到GPT-6 Astra的准确率。