内容提要
企业常为简单任务过度使用前沿AI模型,成本高但效果未提升。任务有智能门槛,超过后多余思考无价值。实验室鼓励烧Token,企业需控制成本,应通过路由器、混合负载和优化平台,将复杂任务交给大模型,简单任务用便宜方案,实现“少用智能”的高效运营。
延伸解读
智能门槛:过了及格线,再聪明也是浪费
文章提出每个任务都有“智能门槛”,低于门槛模型做不了,但一旦跨过,多余思考的边际价值归零。例如密码重置这类简单任务,身份验证后直接重置即可,不需要长篇解释。企业应识别任务的真实复杂度,避免为简单任务支付前沿模型的溢价。
实验室与企业的目标冲突
模型实验室的商业模式鼓励消耗更多Token,而企业追求成本效率。文章指出OpenAI企业客户推理Token消耗一年增长320倍,但56%的CEO未看到显著财务回报。这种矛盾意味着企业不能依赖模型提供商来优化成本,必须自己掌握路由和负载分配的控制权。
路由与混合负载:未来的成本控制关键
文章预测未来会出现大量“路由器”和混合工作负载,将简单任务留在本地或小模型,复杂任务才调用前沿模型。Minions项目显示,用5.7分之一的成本可保留97.9%的准确率。核心洞察是昂贵智能应主要用于“判断什么工作需要做”,而非亲自执行每个单元。
简单任务上的降本效果仍待验证
文章提醒,Minions实验是在金融、医疗、科学的长文档推理任务上验证的,对于密码重置、库存盘点等简单场景,小模型的失败模式可能不同。是否会出现“1%成本拿下99.9%效果”的配置,目前尚无定论,企业需谨慎测试。
Q&A
为什么说用前沿AI模型处理简单任务是一种浪费?
因为每个任务都有智能门槛,一旦模型能力超过这个门槛,额外的思考不会带来价值提升。前沿模型处理简单任务时,生成的Token数量是实际需求的7到10倍,成本可能增加300倍,但效果没有改善。例如,密码重置这类任务,模型写再多解释也不会让结果更好。
什么是智能阈值?它对任务处理有什么影响?
智能阈值是指每个任务都有一个所需的最低智能水平。低于这个水平,模型无法完成任务;接近阈值时,增加智能会带来巨大价值;但一旦超过阈值,额外的智能不再增加价值,瓶颈转移到其他方面。例如,退货政策、发票核对等任务的复杂度不会因AI变强而增加,因此用前沿模型处理这些任务就是浪费。
前沿模型在哪些场景下才值得使用?
前沿模型值得用于解决未知问题或高价值发现,例如证明数学猜想、挖掘高危漏洞、发现新药靶点或套利结构。这些任务的结果价值极高,可能带来数百万美元的收益。但这类工作在美国就业人口中占比不到1%,大多数企业日常任务并不需要这种级别的智能。
为什么AI实验室和企业目标不一致?
AI实验室的成功指标是Token消耗量、会话时长等,它们通过鼓励用户多烧Token来增加收入;而企业的目标是降低每次任务成本、提高效率。实验室没有动力帮助企业节省调用或推荐更便宜的模型,导致企业Token消耗量一年增长320倍,但56%的CEO表示没有看到显著财务回报。
企业如何实现少用智能的高效运营?
企业可以通过三层架构实现:第一,部署路由器,判断每个任务该用哪种模型或规则引擎;第二,采用混合负载,将简单、重复、私密的任务留在本地,只有复杂任务才调用云端前沿模型;第三,使用优化平台如AC2,持续训练、评估和替换模型,让工作负载流向最便宜且能完成任务的系统。
Minions研究项目证明了什么?
Minions项目证明,用前沿模型拆解任务,将子任务分配给多个小模型,可以用5.7分之一的成本获得97.9%的准确率,或用30.4分之一的成本获得87.9%的准确率。这说明了昂贵的智能应主要用于判断需要做什么,而不是亲自执行每个工作单元。
未来AI在企业中会以什么形式渗透?
未来AI会通过两类工具渗透:通用主动助手(如Instinct)能主动观察并发现机会,专用执行工具(如Maximor和PlayerZero)将企业意图转化为可靠执行。在这两层之下,还有改善层(如AC2)用于持续优化模型,最终形成主动助手聚拢需求、应用工具执行、平台优化的系统。