伯克利实验揭开智能体降本真相:Claude Code比开源壳贵两倍

伯克利实验揭开智能体降本真相:Claude Code比开源壳贵两倍

💡 原文中文,约4700字,阅读约需12分钟。
📝

内容提要

伯克利团队测试发现,同一AI模型换用不同调度壳时,编程成功率几乎不变,但成本最高相差五倍。Claude Code首轮上下文超七万token,极简壳Pi不到两千,多出的开销被称为“调度壳税”。Pi仅提供读写、编辑、执行四个工具,却常居成本-成功率前沿。实验还显示原生配对未必最优,跨壳混搭常更便宜。建议精简工具定义、对比不同壳成本,并按任务难度动态选择调度壳。

🔎

延伸解读

调度壳税:多花的钱买到了什么

实验显示,同一模型换用不同调度壳,编程成功率几乎不变,但成本最高差五倍。Claude Code首轮上下文超七万token,Pi不到两千,多出的开销被称为“调度壳税”。这笔钱主要花在重复发送的系统指令和工具定义上,而非模型推理本身。对用户而言,这意味着选择调度壳时,不能只看成功率,还要拆开账单看每轮token消耗,否则可能为几乎不存在的性能提升持续付费。

极简工具为何能追平重型壳

Pi只提供读、写、编辑、执行命令行四个工具,却常居成本-成功率前沿。实验表明,模型靠基础工具就能完成多数编程任务,多出的专用工具并未显著提高成功率,反而因占用上下文推高成本。这挑战了“工具越多越好”的直觉。不过,研究也谨慎指出,丰富工具可能在跨仓库搜索、外部文档访问等极端场景下有用,日常任务中则更像过度包装。

原生配对未必最优,跨壳混搭更省钱

行业常假设自家模型配自家调度壳最好,但实验在十二组比较中有九组显示,跨公司混搭表现更优。例如Claude Sonnet 4.6在Codex CLI中成功率高于自家Claude Code,GPT-5.6 Sol在Pi中表现也优于Codex CLI,且成本更低。这说明模型能力通用性强,调度壳限制有限。用户不必被品牌绑定,可尝试不同壳组合,把省下的钱用于更多次尝试。

如何在实际工作中砍掉隐形税

研究建议三个方向:一是检查调度壳首轮上下文大小,若工具定义超一万字符,可尝试精简到四个核心工具;二是同一模型至少对比两个调度壳,算清每次尝试的token单价,而非只看成功率;三是按任务难度动态选择调度壳,日常改bug用极简壳,复杂重构再启用重型壳。研究还发现同一壳在不同任务上token消耗波动可达十倍,暗示自适应调度壳可能是未来方向。

Q&A

什么是调度壳税(Harness Tax)?

调度壳税是指同一个AI模型搭配不同调度壳时,因调度壳塞入的上下文(如系统指令、工具定义)过多,导致每轮token消耗增加,从而多付的费用。实验显示,同一模型换壳后成功率几乎不变,但成本最高可差五倍,多出的开销就是调度壳税。

为什么Claude Code比极简壳Pi贵那么多?

Claude Code在首轮调用时平均塞入超过七万token的上下文,而Pi不到两千token,相差三十多倍。这些上下文包括系统指令、工具定义等,且每轮对话都会重复发送,导致累积成本远高于Pi。

Pi调度壳为什么能用四个工具就达到高成功率?

Pi只提供读文件、写文件、编辑文件、执行命令行四个核心工具,初始上下文不到两千token。实验表明,模型靠这四个基础工具就能完成绝大多数编程任务,多出的工具并未显著提高成功率,反而因占用上下文推高成本。

原生配对(如Claude模型配Claude Code)是否一定最优?

不一定。实验对比了十二组原生与跨壳搭配,其中九组表现最好的并非原生配对,而是跨公司混搭。例如Claude Sonnet 4.6在Codex CLI中成功率高于自家Claude Code,GPT-5.6 Sol在Pi中表现优于自家Codex CLI。

如何在实际工作中降低调度壳税?

可以采取三步:1. 检查调度壳首轮上下文大小,精简工具定义至读写、编辑、执行四个核心操作;2. 同一模型至少对比两个调度壳,计算每次尝试的token成本,而非只看成功率;3. 根据任务难度动态选择调度壳,日常任务用极简壳,复杂任务再用重型壳。

这项研究的结论有哪些局限性?

研究基于SWE-bench Lite和Terminal-Bench 2.0两个公开基准测试,题目开源,模型可能在训练中见过类似题目。在真实的私有代码库上,复杂调度壳的附加工具可能发挥更大作用,因此结论适用范围目前有限。

🏷️

标签

➡️

继续阅读