内容提要
AI编码代理的护栏与模型同样关键。基准测试显示,护栏的启动开销和缓存命中率显著影响成本,差距可达数倍,而任务成功率仅差几个百分点。企业应关注每次验证结果的成本,而非单纯比较令牌数。护栏选择对成本影响巨大,值得与模型同等重视。
延伸解读
成本差异的根源:启动开销与缓存命中率
基准测试显示,不同编码代理的令牌消耗差异巨大,主要源于两个机制:一是启动开销,即系统提示和工具描述等固定令牌,Aider约700令牌,而OpenClaw约26,000令牌,且每轮都会重复发送;二是缓存命中率,Claude Code仅1.5%的输入令牌来自缓存,而Codex约70%,缓存输入成本仅为非缓存的五分之一。因此,令牌数相近时,实际费用可能相差数倍。
成本与成功率:不同量级的权衡
尽管成本差异显著,但任务成功率差距较小。Composio测试中,八种代理的成功率在46.7%至66.7%之间,相差20个百分点,而成本差距可达数倍。例如,Claude Code与DeepAgents成功率相同,但前者每次成功成本是后者的四倍以上。这表明,选择代理时,应优先关注成本与成功率的综合性价比,而非单纯追求最低令牌数或最高成功率。
警惕静默截断:隐藏的风险
在注入100,000令牌噪声的测试中,Kilo和Opencode丢弃了83%-89%的输入却仍报告成功,这种静默截断极具危险性,因为它看起来与正常成功无异,但可能遗漏关键信息。相比之下,OpenClaw拒绝运行,Kimi Code崩溃,Claude Code虽完整发送但表现不佳。企业在选择代理时,应验证其处理长上下文的能力,避免因静默截断导致任务质量下降。
Q&A
为什么AI编码代理的护栏(harness)对成本影响如此之大?
因为护栏的启动开销(系统提示词、工具描述等)和缓存命中率显著影响成本。启动开销大的护栏在多次交互中会重复发送大量令牌,而缓存命中率低则导致更多输入按全价计费,两者叠加可使成本相差数倍。
在AI编码代理的基准测试中,令牌使用量最大差距是多少?
在六月的基准测试中,令牌使用量从Aider架构模式的约3,500个令牌到OpenClaw的292,000个令牌,差距约70倍。
为什么Claude Code的令牌消耗与竞争对手相当,但成本却更高?
因为Claude Code的缓存命中率极低,只有1.5%的输入令牌来自缓存,而竞争对手如Codex和OMP的缓存命中率分别约为70%和57%。未缓存的输入成本约为缓存输入的5倍,因此尽管令牌总数相近,Claude Code的账单却更高。
在AI编码代理中,护栏的选择对任务成功率有多大影响?
护栏的选择对任务成功率的影响相对较小,通常只有几个百分点的差距。例如,Composio的测试中,通过率从OpenCode的46.7%到Pi Agent的66.7%,相差20个百分点,但成本差异却可达数倍。
企业采购AI编码代理时,应该关注哪些指标?
企业应关注每次验证结果的成本(cost per verified outcome),而不是单纯比较令牌数。因为令牌数相同的情况下,缓存命中率等因素会导致实际成本差异巨大。
什么是“启动税”(startup tax)?它如何影响AI编码代理的成本?
启动税是指护栏在每次交互开始时发送的系统提示词、工具描述和环境设置等固定令牌开销。例如,Aider架构模式的启动开销约为700个令牌,而OpenClaw约为26,000个令牌。如果交互轮次多,启动税会成倍增加总令牌消耗,从而推高成本。
在AI编码代理中,缓存命中率受哪些因素影响?
缓存命中率受端点方言、网关和提供商路由的影响。例如,Claude Code通过Anthropic风格的消息端点与OpenRouter通信,导致缓存命中率降低,而使用OpenAI风格端点则可能获得更高的缓存命中率。
AI编码代理的护栏选择对成本的影响有多大?
护栏选择对成本的影响巨大,甚至可能超过模型本身。在测试中,不同护栏的成本差异可达数倍,例如Composio测试中,每个成功任务的成本从Pi Agent的$0.028到Claude Code的$0.195,相差近7倍。