内容提要
TypeSafe AI创始人Diogo Almeida发布Jev Harness白皮书,提出十步蓝图重构编码智能体:将决策、生成、执行三权分立,由专用决策模型Jev负责路由、评分与拦截,大模型专注写代码。方案涵盖上下文压缩、工具分层、条件规则注入、双维度路由、检索复用及语义级命令拦截,目标提速两百倍、降本四百倍。
延伸解读
三权分立:决策与生成分离的架构价值
Jev Harness 的核心是将编码智能体的决策、生成、执行三种角色彻底切开。大模型只负责写代码和深度推理,Harness 负责工具调用等确定性动作,Jev 则专管路由、评分与拦截。这种分离让决策动作不再消耗昂贵的大模型推理,因为判断“下一步走哪条路”并不需要文本生成能力。文章指出,让前沿大模型回答简单选择题,本质上是资源错配。
成本优化的反直觉发现:模型切换与 token 分布
文章用实测数据推翻了两个常见假设。其一,大小模型交替使用反而更贵:Opus 与 Sonnet 切换的总账单为 6.19 美元,而全程使用 Opus 仅需 4.15 美元,因为跨模型移交会导致上下文重算,KV 缓存全部作废。其二,token 消耗大头不在写代码,读文件和搜索检索占据了 56.2% 的工具调用轮次和 46.5% 的 token,写代码占比不到 10%。因此优化重点应是检索过滤,而非生成速度。
上下文与工具管理的工程技巧
Jev Harness 在上下文压缩上采用“先提问后压缩”的顺序,等用户提出具体问题后,再由 Jev 对代码块动态打分,归入隐藏、短摘要、长摘要或完整保留四种粒度,确保 token 花在相关处。工具库则通过三层渐进式暴露:常驻单行描述、按需拉取完整 Schema、执行时临时注入详细文档,避免工具描述挤占上下文。规则也改为条件触发式注入,由 Harness 动态挂载,绕过压缩机制,防止被误删。
安全与效率的平衡:双维度路由与语义拦截
模型路由不再只看任务复杂度,还引入信任等级:涉及 API 密钥或生产环境修改的任务强制路由到第一方前沿大模型,零风险任务才走轻量模型。命令安全拦截则从黑白名单升级为语义级检查,由 Jev 逐行读取脚本内容,判断是否触碰生产数据库、删除关键目录或外发数据,再决定放行、追问或拒绝。整个过程零生成 token 消耗,毫秒级完成,堵住了命令名黑白名单无法覆盖的语义漏洞。
Q&A
Jev Harness 是什么?它和普通编码智能体有什么区别?
Jev Harness 是 TypeSafe AI 创始人 Diogo Almeida 提出的编码智能体决策架构外壳,围绕专用决策模型 Jev 搭建。普通编码智能体让一个大模型包揽读文件、想计划、选工具、写代码、判断风险等全部工作;Jev Harness 则把决策、生成、执行三权分立:大模型只负责生成代码和深度推理,Harness 负责工具调用等确定性执行,Jev 负责路由、评分和拦截等决策。
为什么编码智能体里大小模型来回切换反而更烧钱?
因为跨模型移交任务时,下游模型必须把完整上下文重新处理一遍,KV 缓存全部作废,前一次的 token 计算成本相当于被扔掉。实测数据显示,Opus 走到一半切到 Sonnet 再切回 Opus,一轮任务总账单是 6.19 美元;从头到尾只用 Opus 反而只要 4.15 美元,切换路由比不切还贵将近 50%。
编码智能体的 token 主要消耗在哪里?
主要消耗在检索和读取环节,而不是写代码。追踪数据显示,读文件和搜索检索占据了 56.2% 的工具调用轮次,吃掉了 46.5% 的 token 消耗;而真正的写代码动作,token 消耗占比不到 10%。因此优化效率的核心战场是检索过滤,即决定哪些文件值得读、哪些代码块值得保留、哪些搜索结果直接扔掉。
Jev Harness 如何解决工具库膨胀导致的上下文占用问题?
采用三层渐进式暴露:第一层常驻索引,在系统提示词里只放几百个工具的单行极简描述;第二层按需解析,当 Jev 判断某个工具可能用到时,才动态拉取完整 JSON Schema 注入上下文;第三层单次文档,只在执行复杂调用时临时拉入详细使用文档,用完就走。这样工具库可以又大又全,但上下文代价不再线性增长。
Jev Harness 如何保证开发规范在长对话中不被上下文压缩误删?
通过条件触发式注入。规则不再常驻系统提示词,而是根据当前动作动态挂载,例如打开 tsx 文件自动挂载前端组件规范,进入 billing 目录自动挂载支付系统风险规则。这些规则由 Harness 根据状态动态注入,绕过了智能体自身的上下文压缩机制,只要触发条件成立,规则就一直挂在上下文里,永远不会被意外抹掉。
Jev Harness 的命令安全拦截和传统黑白名单有什么不同?
传统黑白名单只拦命令名,攻击者写一个名字无害的 shell 脚本、里面藏 rm -rf / 就能穿透。Jev Harness 构建可编程的 Allow / Ask / Deny 三档策略门禁,在任何命令执行前由 Jev 逐行读取完整脚本内容,理解实际语义,判断是否会碰生产数据库、删除关键目录或外发数据,再决定放行、追问或拒绝。整个过程零生成 token 消耗,毫秒级完成,堵住了语义漏洞。