内容提要
本文介绍如何节省Claude Code的token用量。核心是理解token计费机制:输入便宜、输出贵5倍,AI思考也算输出。6个技巧包括:中文任务用国产模型、把需求说清楚减少返工、固定内容放前面利用缓存、长对话用/compact压缩、设定规则禁止AI废话、按需加载工具。另有一个作息技巧:早上先启动第一个5小时窗口,午休时重启第二个,让下午和晚上各有满额额度可用。
延伸解读
理解 token 计费机制是省钱的前提
文章指出,token 计费并非按语义理解,而是按“查表”切分:常见词打包成一个 token,生僻词则逐字拆分,导致 token 数增加。同时,输出 token 的价格约为输入的 5 倍,且 AI 的思考过程也计入输出。因此,省钱的核心在于减少 AI 的“想”和“说”,而非单纯减少输入。理解这一机制,才能理解后续技巧的逻辑。
缓存与 /compact 的适用边界
缓存机制依赖前缀匹配,固定内容前置可享受 10% 价格,但仅当开头完全一致时生效。而 /compact 通过压缩历史对话减少 token,但会丢失细节,适合在阶段结束时使用。两者各有代价:缓存要求内容顺序稳定,/compact 则牺牲信息完整性。用户需根据对话场景权衡,避免因过度压缩导致 AI 遗忘关键信息。
国产模型与工具加载的取舍
文章建议中文任务优先使用国产模型,因其对中文的 token 切分更高效,且单价更低。但需注意,这并非“更懂中文”,而是训练数据导致的打包效率差异。此外,工具按需加载可减少输入 token,但需确认新版本是否已默认支持,否则需手动配置。用户应根据任务语言和工具使用频率,灵活调整模型与工具加载策略。
5 小时窗口的作息技巧需结合个人习惯
通过早上提前启动窗口、午休时重启,可让下午和晚上各有一个满额窗口,但该技巧依赖个人作息。若上午任务繁重,或午休时间不固定,则可能无法有效利用。文章也提到不同套餐的额度规则有差异,Max 有每周上限,因此用户需根据自身套餐和实际使用模式,调整窗口启动时间,避免额度浪费或不足。
Q&A
Claude Code 的 token 计费机制是怎样的?为什么输出 token 更贵?
Claude Code 按 token 计费,输入 token 便宜,输出 token 贵,大约是输入的 5 倍。而且 AI 在给出最终答案前的内部思考也算作输出 token,即使不显示也会收费。因此,省钱的核心是让 AI 少想、少说、少返工。
为什么说中文任务用国产大模型更省 token?
因为 token 切分是基于常用词打包表,国产模型用大量中文训练,常见词打包得好,切中文更省 token;而英文模型遇到中文只能一个字一个字拆,token 消耗更多。此外,国产模型单价通常更低。
为什么把需求说清楚反而更省 token?
因为说得含糊会让 AI 反复猜测和返工,消耗大量昂贵的输出 token;而说得清楚,AI 一步到位,虽然多花一点便宜的输入 token,但省下了昂贵的思考和返工成本。
如何利用缓存机制降低 token 费用?
将固定不变的内容(如长文档、固定规则)放在请求最前面,经常变化的内容放最后。这样每次请求的前缀都能命中缓存,只按原价的 10% 收费。正常聊天时,只要不改前面说过的话,对话历史会自动命中缓存。
对话太长时,使用 /compact 有什么好处和代价?
/compact 会将长对话压缩成摘要,减小体积,后续对话更省 token。代价是丢失部分细节,所以适合在一个阶段告一段落时使用。
在 CLAUDE.md 中设置哪些规则可以避免 AI 说废话?
可以设置:默认中文回复;代码、命令等保持英文;结论先行,简洁直接;不客套,不夸“好问题”,不以“当然可以”开头;有问题直接指出,有更好做法主动说。这些规则能减少无意义的输出 token。
为什么工具要按需加载,而不是全部开启?
因为每个工具的说明书都会作为输入 token 计入费用,全部开启会浪费大量 token。按需加载,用到哪个才加载哪个,可以节省输入 token。新版本很多工具已支持按需加载。
如何利用 5 小时窗口机制让额度在下午和晚上更充足?
早上先启动第一个 5 小时窗口(比如 7 点),覆盖上午;午休时(12 点)重启第二个窗口,覆盖下午和晚上。这样下午和晚上各有一个满额窗口,相当于最忙时段有两倍额度。