GPT 6 省 token Tips
内容提要
GPT-6 使用成本较高,文章建议通过以下方式节省 token:清理冗余 skill 与 AGENTS.md;任务不跨天,用简短 handoff 文件接续;同一窗口不切换模型;将上下文控制在 272K 以内;简单任务交给更便宜的模型。文章还介绍了 Jev 模型,其特点是输出结构化决策、速度快且成本低,可用于电脑操作、上下文压缩、模型路由和自动审核,并可利用 ChatGPT 网页版 GPT-6 Pro 额度。
延伸解读
清理 Skill 与 AGENTS.md 的实际操作
文章建议用一段提示词让 Codex 扫描全局配置、AGENTS.md 和已加载的 Skill,找出为老模型写的陈旧规则,并重新理清执行边界。重点在于:只读检索、本地草稿和常规测试允许自主推进,仅在不可逆修改时等待确认;同时收拢 Skill 描述,只保留触发场景,避免无关任务过早全量塞入上下文。
跨天任务与模型切换的缓存代价
同一窗口跨天继续使用,会因 current_date 变化导致后续 prefix 无法匹配,缓存失效后成本上升。文章建议当天结束时将任务状态、已确认事实、剩余问题和关键文件写入简短 handoff 文件,第二天新开窗口只读摘要。同样,同一窗口内更换模型也可能使旧缓存无法在新模型命名空间复用,最好在任务开始前决定模型,或先压缩状态再开新窗口。
上下文窗口与任务分层策略
文章指出上下文并非越大越好,过长会引入干扰,且 Long context 的 output 费用较高。建议通过配置限制 ctx 窗口大小,例如在 ~/.codex/config.toml 中设置 model_context_window 和 model_auto_compact_token_limit。同时按任务难度分层:搜索、解释、格式化等低难度任务交给便宜模型;局部实现、补测试用中档模型;架构设计、跨模块重构等再使用 GPT 6。
Jev 模型的定位与潜在应用
Jev 不生成文本,而是输出结构化决策结果并附带置信度分数,响应速度 70 到 500 毫秒,输入 Token 价格 0.042 美元/百万,输出免费。社区关注的应用包括 computer use 操作判断、上下文压缩、模型路由和自动审核。文章提到可通过官网申请,并认为 OpenAI 或 Anthropic 可能很快跟进类似技术。
Q&A
GPT-6 使用成本高,有哪些省 token 的实用技巧?
文章整理了 7 个省 token 技巧:1. 清理不必要的 skill 和 AGENTS.md,减少固定上下文;2. 同一窗口任务不要跨天,用简短 handoff 文件接续;3. 同一窗口不要更换模型,避免缓存失效;4. 控制上下文不超过 272K;5. 简单任务交给便宜模型;6. 使用 Jev 模型处理特定任务;7. 利用 ChatGPT 网页版 GPT-6 Pro 的独立额度。
为什么同一个窗口处理任务不要跨天?
旧窗口积累了大量历史消息、工具输出和失败尝试,即使当前问题简单,模型仍需携带这些内容推理。而且 Codex prompt 携带 current_date 信息,跨天后 cache miss 的 prefix 较长,导致费用增加。建议当天结束时将任务状态、已确认事实、剩余问题和关键文件写入简短 handoff 文件,第二天新开窗口只读取摘要和所需文件。
在同一个窗口更换模型会有什么影响?
在同一个任务窗口中更换模型,可能导致旧模型留下的缓存无法在新模型的命名空间里复用,后续请求需要重新计算上下文,从而丢失之前积累的缓存优势,反而增加成本。建议任务开始前决定模型,一个窗口内保持模型稳定;如需换模型,先将当前状态压缩成摘要,再开新窗口。
如何控制上下文大小以节省 token?
上下文窗口越大,模型需要检索的内容越多,旧信息容易互相干扰。对 coding agent 来说,真正有价值的是当前任务、相关文件、错误日志和最近几轮决策。建议将上下文控制在 272K 以内,可通过配置 ~/.codex/config.toml 中的 model_context_window 和 model_auto_compact_token_limit 来限制。
Jev 模型有什么特点?可以用于哪些场景?
Jev 模型响应速度 70 到 500 毫秒,比主流前沿大模型快一到两个数量级;输入 Token 价格 0.042 美元/百万 Token,输出 Token 免费。它不能生成文本,而是输出事先定义好结构的决策结果,每个回答附带置信度分数。可用于 computer use(操作判断层)、上下文压缩、模型路由、自动审核等场景。
如何利用 ChatGPT 网页版节省 token?
ChatGPT 网页版有超强模型 GPT-6 Pro,其额度与 Codex 分开,不消耗 Codex 额度。200 美元的 Pro 会员一周有 200 次 Pro 对话额度。但 GPT-6 Pro 无法看到真实业务数据和场景,可以通过插件链接 Github(需使用 Github),或自己写 MCP 连接来弥补。