一日一技:如何正确节省九成的大模型Token

一日一技:如何正确节省九成的大模型Token

💡 原文中文,约8800字,阅读约需21分钟。
📝

内容提要

该文指出,AI编程中节省Token的关键不是优化提示或换模型,而是将Skill中的确定性操作(如浏览器导航、点击、提取)改用Python代码实现,仅保留需智能判断的环节调用大模型。通过Playwright和Claude Agent SDK,可将费用从10美元降至0.004美元,时间从12分钟缩至17秒,强调用.py文件替代纯Skill流程。

🔎

延伸解读

Token消耗的真相:工具调用上下文膨胀

文章指出,工具调用密集型Skill的Token消耗主要来自每次调用都携带完整上下文,包括系统提示词、工具定义、对话历史和页面快照。随着调用轮次增加,上下文不断膨胀,导致费用飙升。理解这一点有助于开发者避免盲目优化提示词或更换模型,而是从减少不必要的工具调用入手。

确定性操作与智能判断的分离原则

核心方法论是将任务拆分为确定性操作(如网页导航、点击、提取)和需要智能判断的环节(如理解价格格式)。确定性操作用代码实现,智能判断才调用大模型。这种分离不仅大幅降低成本和时间,还提高了效率。开发者应审视现有Skill,识别哪些步骤其实不需要大模型参与。

订阅额度与API成本的权衡

文章对比了使用API和Claude订阅(通过Agent SDK)的成本差异。对于有订阅的用户,将智能判断环节接入订阅额度可进一步将费用降至零,同时减少心理负担,允许更频繁地调用模型。这提示开发者根据自身资源选择最优方案,充分利用已有订阅价值。

避免误区:代码片段不等于独立脚本

作者强调,在Skill中嵌入代码片段仍属于Skill,大模型仍需逐步执行并携带上下文,Token消耗不会减少。真正的解决方案是编写独立的.py文件,由Python解释器直接运行,仅在必要时通过SDK调用模型。这避免了主对话上下文的叠加,进一步节省Token。

Q&A

如何正确节省大模型Token?

正确节省Token的关键不是优化提示词或换模型,而是将Skill中的确定性操作(如浏览器导航、点击、提取)改用Python代码实现,仅保留需要智能判断的环节调用大模型。

为什么纯Skill实现会消耗大量Token?

因为大模型每做一次工具调用都需要携带完整上下文,包括系统提示词、工具定义、对话历史等,多轮调用导致上下文不断膨胀,消耗大量Token。

代码+大模型混合实现相比纯Skill有哪些优势?

运行时间从12分钟降至17秒,API调用次数从几十次降至1次,费用从约10美元降至0.004美元,节省超过99%。

在代码+大模型混合实现中,哪些环节用代码实现,哪些环节用大模型?

确定性操作如打开网页、输入文字、点击按钮、提取文本用代码实现;需要智能判断的环节如理解价格格式、判断最便宜商品用大模型。

Claude Agent SDK如何帮助节省Token和费用?

Claude Agent SDK可以直接调用本地Claude Code,走订阅额度,无需额外API费用。在脚本中调用时,它是一次独立会话,不会叠加到主对话上下文,从而节省Token。

为什么在Skill中嵌入代码片段不能节省Token?

因为嵌入代码片段本质上还是Skill,大模型仍需逐步调用工具执行代码并读取输出,每一步都携带完整上下文,Token消耗不会减少。

如何将现有Skill改造成Python脚本?

可以第一次让大模型操作浏览器走完全程并生成Playwright代码,之后所有操作通过代码进行。对于固定流程的Skill,直接编写Python脚本,仅保留需要智能判断的环节调用大模型。

🏷️

标签

➡️

继续阅读