内容提要
本文介绍如何在不牺牲性能的前提下降低Claude API使用成本。核心方法包括:最大化提示缓存命中率(通过稳定前缀、避免动态内容)、移除过时提示反模式(如验证仪式、过度强调)、校准任务努力程度。使用Claude Code的claude-api技能可自动审计和优化,实测可降低成本14.6%-73%,同时保持或提升准确率。
延伸解读
提示缓存命中率是降本关键
文章指出,提示缓存命中率直接影响成本。缓存读取价格远低于完整输入处理,但缓存要求前缀字节完全一致、模型固定且TTL有限。实际中,动态时间戳、工具定义重排、同步工具调用超时等都会破坏缓存。建议将稳定内容前置、动态内容后置,并利用自动缓存断点、预热缓存等技巧,可显著降低输入成本。
迁移到前沿模型需清理提示反模式
旧模型时代的提示词可能包含验证仪式、强调词、强制步骤等反模式,这些在新模型上会浪费token甚至降低准确率。文章实测,通过prompt-audit清理后,成本降低14.6%,准确率提升5.3%。迁移模型时,应审查并移除这些过时指令,让模型发挥原生能力。
努力程度需按任务校准
模型努力程度并非越高越好。高努力可能过度思考,增加成本且不一定提升质量;低努力则可能证据不足。文章建议测试更强模型在低努力下的表现,可能比弱模型高努力更便宜且效果相当。例如Fable 5.1低努力匹配Fable 5高努力,成本仅三分之一。理解任务形状,通过评估找到成本与性能的平衡点。
Q&A
如何在不牺牲性能的情况下降低Claude API的使用成本?
可以通过三个主要方法降低成本:最大化提示缓存命中率、移除过时的提示反模式、校准任务努力程度。这些方法已集成到claude-api技能中,实测可降低成本14.6%-73%,同时保持或提升准确率。
什么是提示缓存?如何提高提示缓存的命中率?
提示缓存是保存Claude处理输入时的内部状态(KV缓存),当请求前缀相同时,可以直接读取缓存而无需重新计算,缓存读取价格远低于完整输入价格。要提高命中率,需注意:保持前缀稳定,避免动态内容(如时间戳、ID)出现在前缀中;避免修改工具定义;避免在对话中更改effort或thinking设置(除非使用Claude Opus 5或Fable 5.1);避免同步工具调用或子代理导致缓存过期;监控缓存命中率并使用诊断工具。
常见的提示反模式有哪些?如何修复它们?
常见的反模式包括:验证仪式(如“double-check your work”)、强调词(如“be maximally thorough”)、强制步骤或思维模板、过时的示例、矛盾规则、过时的配置。修复方法是使用/claude-api prompt-audit命令自动审计并移除这些反模式。实测中,移除反模式后成本降低14.6%,准确率提升5.3%。
如何校准任务的努力程度(effort)以平衡成本和性能?
校准努力程度的方法包括:测试更强模型在低努力下的表现(可能比弱模型高努力更便宜且性能相当);理解任务形状,通过在不同努力水平下运行评估来观察性能变化;使用/claude-api hillclimb自动搜索最佳配置。例如,在CursorBench 3.2上,Fable 5.1低努力匹配Fable 5高努力性能,成本仅为三分之一。
Claude Code中的claude-api技能提供了哪些命令来优化成本和性能?
claude-api技能提供了三个主要命令:/claude-api prompt-audit用于审计并移除提示反模式;/claude-api cost-optimize用于全面成本审计,包括提示缓存、批处理、输出限制等;/claude-api hillclimb用于迭代搜索最佳配置,包括模型选择、努力程度和提示优化。
在模型迁移(如从Opus 4.8到Opus 5)时,提示反模式如何影响成本和性能?
在迁移到前沿模型时,旧提示中的反模式可能导致成本增加和性能下降。例如,验证仪式导致重复工具调用,强调词导致大量不必要的知识库搜索,矛盾规则导致错误拒绝退款,手动思维模板与内置思考冲突。使用prompt-audit移除这些反模式后,成本降低14.6%,准确率提升5.3%。
如何通过提示缓存和批处理降低API成本?
通过实现提示缓存(如设置显式缓存断点、使用自动缓存)和批处理非实时任务,可以显著降低成本。例如,在LegalBench上,通过缓存共享前缀、设置低努力和使用Batch API,成本降低约58%;在OfficeQA Pro上,通过批处理和文档缓存,成本从$136.20降至$64.87。