内容提要
RTK工具宣称可减少Claude Code 60-90%的token消耗,但实测显示在低推理成本下费用反增7.6%,高成本下无差异。其压缩仅触及约20%工具输出,且自报节省基于错误假设。质量未受影响,但实际无节省,建议评估压缩工具应测量实际账单而非工具自报数据。
延伸解读
压缩工具的真实收益可能远低于宣传
rtk宣称能减少60-90%的token消耗,但实测显示在低推理成本下费用反而增加7.6%,高成本下无差异。原因在于rtk只能压缩约20%的工具输出,而大部分上下文来自缓存重读,其计费仅为原始价格的十分之一。因此,即使压缩效果显著,对总成本的影响也微乎其微。
自报节省数据可能误导评估
rtk自带的统计报告显示节省了9620万token,但实际账单却上升。这是因为其计算基于错误的假设:将完整原始输出作为反事实,且未考虑Claude Code的截断机制和缓存计费。评估压缩工具时,应直接测量实际账单,而非依赖工具自报的节省数据。
压缩可能带来隐性成本
尽管rtk压缩输出未显著影响任务质量,但在低推理成本下,使用rtk的代理平均多花费7.6%的成本,并多出13.8%的轮次和14.3%的缓存读取。这主要源于压缩导致的额外重读和偶尔的改写错误。高推理成本下这些差异消失,但压缩并未带来节省。
Q&A
rtk工具真的能减少Claude Code 60-90%的token消耗吗?
根据实测,rtk工具宣称能减少60-90%的token消耗,但在实际测试中,低推理成本下费用反而增加了7.6%,高推理成本下无差异。因此,其宣称的节省效果并未实现。
rtk工具是如何工作的?
rtk是一个CLI代理,通过拦截git status等命令,执行真实命令后将输出压缩后返回给模型。它通过Claude Code的PreToolUse钩子透明地重写符合条件的shell命令,从而减少模型接收的token数量。
为什么rtk工具实际没有节省token?
原因有三:一是rtk只能触及约20%的工具输出,因为Claude Code的Read/Grep工具绕过Bash钩子;二是Claude Code本身会截断超长输出,rtk的压缩对象有限;三是会话中大部分输入成本来自缓存重读,而rtk无法压缩这些。
rtk工具对任务质量有影响吗?
测试显示,rtk对任务质量没有显著影响。在低推理成本下,任务得分5更好、4更差、71平局;高推理成本下为5更好、4更差、62平局,统计上无显著差异。
rtk工具自报的节省数据可靠吗?
不可靠。rtk自报节省了9600万token,但实际账单却增加了。其自报数据基于错误假设:将完整原始输出作为反事实,且未考虑缓存重读和截断,因此其节省数据不反映真实账单。
如何正确评估token压缩工具的效果?
应该测量实际账单,而不是工具自报的节省数据。建议使用配对A/B测试,比较同一任务在有无工具下的实际成本,并注意排除异常值,使用统计检验。