内容提要
该文指出,AI编程中节省Token的关键不是优化提示或换模型,而是将Skill中的确定性操作(如浏览器导航、点击、提取)改用Python代码实现,仅保留需智能判断的环节调用大模型。通过Playwright和Claude Agent SDK,可将费用从10美元降至0.004美元,时间从12分钟缩至17秒,强调用.py文件替代纯Skill流程。
延伸解读
Token消耗的真相:工具调用上下文膨胀
文章指出,工具调用密集型Skill的Token消耗主要来自每次调用都携带完整上下文,包括系统提示词、工具定义、对话历史和页面快照。随着调用轮次增加,上下文不断膨胀,导致费用飙升。理解这一点有助于开发者避免盲目优化提示词或更换模型,而是从减少不必要的工具调用入手。
确定性操作与智能判断的分离原则
核心方法论是将任务拆分为确定性操作(如网页导航、点击、提取)和需要智能判断的环节(如理解价格格式)。确定性操作用代码实现,智能判断才调用大模型。这种分离不仅大幅降低成本和时间,还提高了效率。开发者应审视现有Skill,识别哪些步骤其实不需要大模型参与。
订阅额度与API成本的权衡
文章对比了使用API和Claude订阅(通过Agent SDK)的成本差异。对于有订阅的用户,将智能判断环节接入订阅额度可进一步将费用降至零,同时减少心理负担,允许更频繁地调用模型。这提示开发者根据自身资源选择最优方案,充分利用已有订阅价值。
避免误区:代码片段不等于独立脚本
作者强调,在Skill中嵌入代码片段仍属于Skill,大模型仍需逐步执行并携带上下文,Token消耗不会减少。真正的解决方案是编写独立的.py文件,由Python解释器直接运行,仅在必要时通过SDK调用模型。这避免了主对话上下文的叠加,进一步节省Token。
Q&A
如何正确节省大模型Token?
正确节省Token的关键不是优化提示词或换模型,而是将Skill中的确定性操作(如浏览器导航、点击、提取)改用Python代码实现,仅保留需要智能判断的环节调用大模型。
为什么纯Skill实现会消耗大量Token?
因为大模型每做一次工具调用都需要携带完整上下文,包括系统提示词、工具定义、对话历史等,多轮调用导致上下文不断膨胀,消耗大量Token。
代码+大模型混合实现相比纯Skill有哪些优势?
运行时间从12分钟降至17秒,API调用次数从几十次降至1次,费用从约10美元降至0.004美元,节省超过99%。
在代码+大模型混合实现中,哪些环节用代码实现,哪些环节用大模型?
确定性操作如打开网页、输入文字、点击按钮、提取文本用代码实现;需要智能判断的环节如理解价格格式、判断最便宜商品用大模型。
Claude Agent SDK如何帮助节省Token和费用?
Claude Agent SDK可以直接调用本地Claude Code,走订阅额度,无需额外API费用。在脚本中调用时,它是一次独立会话,不会叠加到主对话上下文,从而节省Token。
为什么在Skill中嵌入代码片段不能节省Token?
因为嵌入代码片段本质上还是Skill,大模型仍需逐步调用工具执行代码并读取输出,每一步都携带完整上下文,Token消耗不会减少。
如何将现有Skill改造成Python脚本?
可以第一次让大模型操作浏览器走完全程并生成Playwright代码,之后所有操作通过代码进行。对于固定流程的Skill,直接编写Python脚本,仅保留需要智能判断的环节调用大模型。