AI Agent成本优化指南:用Jev替代大模型做路由和分类决策

AI Agent成本优化指南:用Jev替代大模型做路由和分类决策

💡 原文中文,约5800字,阅读约需14分钟。
📝

内容提要

Jev Engineering 提出将 Agent 中“做选择”的决策从大模型剥离,交由专门的 Jev 分类模型处理,大模型仅负责推理与生成。Jev 支持 Choice、Score、Noul 三种输出,用于路由、排序和门控,并通过漏斗筛选、批量决策、置信度阈值和上下文打分压缩来降本增效。实测成本约 42 美分对 44 美元,相差百倍,但准确率仍有差距,需按场景验证。

🔎

延伸解读

决策与生成分离:成本优化的核心思路

文章指出,Agent中大量调用大模型仅为了做选择,而非生成文字。将这类决策剥离给Jev分类模型,大模型只负责推理与生成,可大幅降低成本。实测中,一万次决策全部走Jev成本约42美分,而走GPT-5.6 Terra约44美元,相差百倍。但需注意,Jev准确率仍有差距,并非所有场景都适用。

Jev的三种输出与漏斗式应用

Jev支持Choice、Score、Noul三种输出,分别用于路由、排序和门控。通过漏斗筛选,可先用规则粗筛,再用Score排序,最后用Choice精选,每层成本极低。这种模式适合从大列表中选一个的场景,如选工具、选路由。但需确保每层决策有证据支撑,且状态设计清晰,否则Jev输出也会模糊。

置信度阈值与风险分层

Jev返回类型化值和置信度分数,代码可据此分支。文章建议设置置信度阈值,高风险决策要求高置信度,低风险可容忍更多不确定性。例如语音银行中,意图判断低于0.6转人工,但查余额0.6即可。阈值需根据业务场景用历史数据校准,不能拍脑袋决定。

稳定性与准确率差距的警示

Jev并非确定性模型,同一输入多次运行可能结果不同。独立测试显示,732个决策跑三遍仅24%完全一致。此外,Jev在49个任务中仅6个统计上清晰领先,其余差距在误差范围内。因此,接入生产前需在具体场景验证稳定性和准确率,并警惕长决策链中小错误累积放大的风险。

Q&A

Jev是什么?它在AI Agent中扮演什么角色?

Jev是一个专门用于做决策的分类模型,负责Agent中的路由、排序和门控等选择任务,而大模型只负责推理和生成。它支持Choice、Score、Noul三种输出格式,分别用于从选项中选择、评分和返回概率值。

如何将Agent中的大模型调用替换为Jev?

首先将模型调用分为生成文字和做选择两类,做选择的部分交给Jev;然后设计包含目标、已完成工作、可用资源、约束和缺口的结构化状态对象;接着在Playground中测试Jev的决策,调整状态而非模型;最后将Jev接入生产,并设置置信度阈值和批量决策。

Jev的三种输出类型分别适用于什么场景?

Choice用于路由,如选择哪个工人或工具;Score用于排序,如评估相关度或匹配度;Noul用于门控,如判断是否批准或需要人工介入。它们覆盖了Agent中90%的判断。

使用Jev能节省多少成本?

根据文章中的计算,每天一万次决策,全部使用Jev的成本约为0.42美元,而使用GPT-5.6 Terra的成本约为44美元,相差约105倍。

Jev在准确率方面表现如何?有哪些局限性?

Jev在推理、知识和重排序任务上领先,但在计数和大规模选项分类上落后。独立测试显示,Jev在49个任务中只有6个统计上清晰领先,其余差距在误差范围内。此外,Jev的准确率仍有约30%的差距,且非确定性,同一输入多次运行可能结果不同。

如何用Jev压缩上下文?效果如何?

Jev通过给每条历史记录打相关性分数,然后丢弃低分记录来压缩上下文,而不是让大模型写摘要。实测上下文减少75%到82%,压缩几乎瞬时完成,例如将近百万Token压缩到86K仅需约一秒。

🏷️

标签

➡️

继续阅读