AI路由放网关还是Harness,实测成本差两倍

AI路由放网关还是Harness,实测成本差两倍

💡 原文中文,约4700字,阅读约需12分钟。
📝

内容提要

企业架构中,模型路由应置于Harness层而非网关。实测表明,网关路由导致成本增加237%、延迟增加65%,而Harness路由节省58%成本,91%的会话成本减半。网关缺乏任务上下文和缓存信息,无法优化决策;Harness能感知会话状态、失败信号和缓存代价,实现高效路由,同时保持质量不降。

🔎

延伸解读

路由位置的本质:谁拥有决策信息

文章指出,模型路由放在网关还是Harness,本质是对“谁拥有决策信息”的判断。网关只看到单次请求,缺乏会话上下文、缓存状态和任务进度;而Harness能感知整个任务演化过程,包括失败信号、工具结果和缓存代价。因此,路由决策应放在信息更完整的Harness层,而非网关。

缓存切换的隐藏成本

切换模型并非简单换管道,不同模型接口不兼容,且推理缓存会失效。文章实测显示,无视缓存的网关路由在长会话中成本可飙升至基线的2.37倍,而缓存感知的Harness路由成本仅为基线的0.19到0.28倍。这提醒我们,模型标价低不等于实际成本低,缓存状态是路由决策的关键变量。

质量与成本的平衡:零节省也是正确选择

文章强调,路由并非一味追求省钱。在Prisma配置案例中,Harness判断全程使用最强模型,节省0%,但这是基于任务无安全降级机会的正确决策。路由的价值在于根据任务状态灵活选择,而非盲目切换。实测中,路由在八个生产指标上与始终用最强模型持平,说明质量未受损。

子Agent与任务归因:Harness的独特优势

Agent任务常涉及子Agent和子任务,网关无法识别这些关联,而Harness能为每个子任务独立选模型,并利用完成条件进行归因。例如,Factory Mission中,Harness为十个子会话分别选模型,节省37.8%成本。这种细粒度路由和归因能力,是网关无法实现的。

Q&A

AI模型路由放在网关层和Harness层有什么区别?

网关层只看到单次请求,缺乏任务上下文和缓存信息,无法做出优化决策;而Harness层能感知会话状态、失败信号和缓存代价,实现高效路由。实测表明,网关路由导致成本增加237%、延迟增加65%,而Harness路由节省58%成本,91%的会话成本减半。

为什么网关路由会导致成本增加237%?

网关路由无视缓存状态,切换模型时缓存作废,需按新鲜输入收费,导致成本飙升。实测显示,完全无视缓存的网关路由策略,成本在第151到200轮时飙到基线的2.37倍,即增加237%。

Harness路由如何实现成本节省58%?

Harness路由能感知会话缓存、任务状态和失败信号,做出缓存感知的模型选择,避免不必要的切换,从而节省成本。生产环境实测两个月,总成本降低58%,中位数会话节省76%,超过九成会话至少节省一半。

模型切换的隐藏成本是什么?

模型切换的隐藏成本主要是推理缓存失效。每次模型调用会缓存会话前缀,换模型后缓存作废,需按新鲜输入收费,价格翻五到十倍。此外,不同模型接口不兼容,需要重新组装指令和工具定义。

网关路由为什么无法保证任务质量?

网关只看到单次请求,不知道任务是否成功,缺乏失败信号和任务上下文,无法判断模型切换是否影响后续任务,因此无法保证质量。而Harness能监控任务完成率、测试失败率等指标,确保质量不降。

Harness如何处理子Agent的模型路由?

Harness为子Agent单独选择模型,子Agent不继承父任务缓存,但只接收精简任务说明书。父任务可保留原模型和热缓存,子任务用其他模型执行,各算各的缓存账。网关无法感知子Agent的存在。

路由方案在基准测试上的表现如何?

在Terminal-Bench 2上,路由达到最强模型通过率的99%;在Legacy-Bench上达到96%,同时每成功完成一个任务的成本比基线低约20%。虽然略低于100%,但换来20%成本降低和65%延迟缩短。

为什么说网关路由是闭着眼睛做决策?

因为网关只看到孤立的请求,没有任务上下文、历史轨迹和反馈信号,无法知道模型切换后的任务完成情况,也无法感知缓存代价,因此决策是盲目的。

🏷️

标签

➡️

继续阅读