openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗

💡 原文中文,约9900字,阅读约需24分钟。
📝

内容提要

openJiuwen推出开源智能路由,在Agent与模型之间增加决策层,按任务复杂度动态选择模型。其三层能力包括模型画像、多目标决策和反馈自演进。实测PinchBench得分接近全云基线,成本降低44.6%;Terminal-Bench成功率达Opus的95.2%,成本降低51.4%。

🔎

延伸解读

智能路由如何实现成本与质量平衡

文章通过PinchBench实测显示,x-router静态路由相比全云基线成本降低25.7%,得分仅下降5.1%;开启Bandit自演进后,成本再降25.3%,得分反升4.4%,最终成本降低44.6%,得分几乎持平。这表明动态路由能在不明显牺牲质量的前提下显著削减成本,尤其适合多轮次、高Token消耗的Agent场景。

自演进机制的关键设计:状态解耦

openJiuwen将路由算法设计为纯函数,所有跨请求记忆外置到独立状态层。这样状态丢失只会降级为冷路由,不会导致请求失败;算法升级或更换学习模型时,无需改动状态层和宿主。这种解耦让系统能持续演进,避免策略过时,是路由成为长期基础设施而非一次性工程的核心。

多目标权衡:路由的真正难点

路由需在成本、时延、质量、上下文/工具兼容性之间实时权衡,没有万能最优解。openJiuwen的解法是将权衡本身系统化:业务可配置偏好,决策依据真实反馈,策略随数据积累演进。例如Terminal-Bench测试中,cost focused模式降成本51.4%,成功率达Opus的95.2%;quality focused模式降成本15.7%,成功率达98.6%,体现了可配置的灵活性。

从选模型到编排协同的扩展空间

三层能力之上,路由可调度多模型协同(如MoA),通过语义去重、质量筛选、冲突消解聚合更优答案;还能将模型、Skill/Tool、SubAgent统一编排,粒度从选模型升级为编排整个执行策略。这为复杂任务提供了更智能的解决路径,但需注意协同的额外开销,关键在于聪明地聚合而非简单堆叠模型。

❓

Q&A

openJiuwen智能路由是什么?它主要解决什么问题?

openJiuwen智能路由是在Agent与模型之间增加的一层面向请求的智能决策能力,专门负责根据任务复杂度动态选择最合适的模型。它解决的是“一个模型包打天下”带来的成本浪费和效果不稳定问题,让简单任务用轻量模型、复杂任务用强模型,实现成本-效果综合最优。

openJiuwen智能路由的三层能力分别是什么?

三层能力包括:第一层精准画像,基于历史数据离线刻画并在线动态刷新每个模型的能力画像;第二层决策,结合请求轨迹和系统状态(如KV缓存亲和、实时负载、目标可用性)进行多目标优化选择模型;第三层演进,通过状态解耦和反馈闭环让路由策略越用越准,并能跟随模型生态持续升级。

openJiuwen智能路由在PinchBench上的实测效果如何?

在PinchBench全量147个任务上,x-router Bandit自演进模式得分70.70%,接近全云基线71.36%,仅低0.66个百分点;而模型调用成本从$11.11降至$6.16,降低约44.6%。相比静态路由,自演进后成本再降25.3%,得分反升4.4%。

在Terminal-Bench/LLMRouterBench上,智能路由的表现如何?

在Terminal-Bench/LLMRouterBench上,使用Opus4.8/Qwen3.5-122B/Qwen3.5-35B三档位模型池测试:cost focused模式下,成本降低51.4%,成功率达Opus的95.2%;quality focused模式下,成本降低15.7%,成功率达Opus的98.6%。

openJiuwen智能路由如何实现自演进?

通过状态解耦实现:算法是纯函数,状态外置为可丢弃的提示,反馈闭环将每次调用的结果(成功、时延、成本等)写回状态层,成为下一轮决策的输入。演进模块检索相似经验,权衡质量与成本,应用于下一次决策。样本不足或优势不明显时保留原判定。

openJiuwen智能路由支持哪些部署形态?

支持四种部署形态:端侧形态(单进程、内存态、零外部依赖)、云侧形态(状态层外置,全局视图)、企业私有化形态(有限模型清单内最优搭配,数据本地)、端云混合形态(端侧处理简单任务,复杂任务交云端)。同一套决策逻辑,换部署拓扑不换判断逻辑。

如何快速上手使用openJiuwen智能路由?

安装:克隆仓库后执行cargo build,然后pip install maturin,maturin develop;如需x-router算法,执行maturin develop --extras x-router。配置:通过TOML文件设置算法、模型池和分类器。调用:使用Router.from_config加载配置,调用route方法获取决策,宿主执行后通过report反馈结果。

🏷️

标签

➡️

继续阅读