Hermes Jev Skills实测:377个技能挑选压到2.8秒 账单直降

Hermes Jev Skills实测:377个技能挑选压到2.8秒 账单直降

💡 原文中文,约7800字,阅读约需19分钟。
📝

内容提要

Hermes Jev Skills 是开源工具集,将决策模型 Jev 嵌入智能体,负责模型路由、记忆过滤、上下文压缩、技能挑选等七类小决策,让前沿模型专注重活。Jev 每次决策仅需 0.4 秒、约 0.00006 美元,并附带置信度。它不上传截图和网页正文,密钥对智能体不可见,还设有六层兜底与 shadow 模式。0.10.0 版修复了模型池维度被丢弃的静默 bug。

🔎

延伸解读

决策外包的成本优势与适用边界

Jev 将模型路由、记忆过滤等七类小决策从昂贵的前沿模型剥离,单次决策仅 0.4 秒、约 0.00006 美元,并附带置信度。这适合高频、低复杂度的选择题场景,但文章也指出,Jev 的判断准确率与业务领域相关,且技能描述需控制在 200 字符以内,否则可能因信息截断导致误判。因此,它并非万能,需在输入约束和领域适配下使用。

隐私保护机制与本地化设计

Hermes Jev Skills 在浏览器和电脑操作中只上传动作 id 和短标签,不发送截图、网页正文或输入框内容;模型路由仅上传脱敏后的当前语句,历史对话和文件内容一律不发。密钥通过本地临时网页写入系统密钥库,智能体不可见。这种设计降低了数据外泄风险,但脱敏规则曾出现误伤快递单号或漏脱敏电话号的反复,说明隐私功能需双向测试。

静默故障的教训与诊断工具

0.10.0 版本修复了一个静默数月的 bug:suggest_tiers() 只输出 general 和 vision,导致 Jev 对 coding 等类别的判断被丢弃,模型池回退到 general,用户花钱问 Jev 却未影响路由。为此新增 route.dead_axis() 检测、jev doctor 诊断和 dashboard 可视化。这提醒用户,二维模型池虽灵活,但需定期检查各维度是否为空,避免决策买而不用。

渐进启用与兜底策略

路由功能提供 off、shadow、on 三档,推荐先跑 shadow 模式,让 Jev 照常判断但不实际切换模型,用户可对比建议与实际效果后再切到 on。同时,系统设有六层兜底:Jev 超时、低置信度、无密钥、格式异常或宕机时均走 fail-open 路径,不阻塞对话。风险词对话不会被路由到最便宜档位,长对话中途不降级,这些硬安全线降低了决策失误的代价。

Q&A

Hermes Jev Skills 是什么?它主要解决什么问题?

Hermes Jev Skills 是一套开源工具集,将 TypeSafe 公司的决策模型 Jev 嵌入到 Hermes、Claude Code、Codex 等智能体中,专门处理模型路由、记忆过滤、上下文压缩、技能挑选、消息分诊、电脑操作、浏览器操作这七类小决策,让昂贵的前沿模型只专注于真正需要思考和写作的重活。

Jev 做一次决策的成本和速度是多少?

Jev 处理一次模型路由决策平均耗时 0.4 秒,花费约 0.00006 美元(万分之六美分),并且返回结果中带有置信度数值。相比之下,让 Claude Opus 回答同样的问题通常需要 3 到 8 秒,费用少说也要几美分。

Hermes Jev Skills 如何保护用户隐私,避免上传截图和网页正文?

在浏览器操作场景中,开发者先在本地写好动作表,每个动作有 id。运行时本地程序识别页面可用动作,只把动作 id 列表和简短标签发给 Jev,Jev 返回一个 id 供本地执行。屏幕截图、网页正文、输入框内容都不发送。如果操作目标或标签出现敏感词,本地程序会在发送前直接拒绝调用 Jev。

Hermes Jev Skills 的 API 密钥管理流程是怎样的?

用户运行 jev setup-key 命令,本机启动临时网页服务,生成一次性 URL。用户在浏览器中粘贴密钥,密钥直接写入操作系统密钥库(macOS 用 Keychain,Linux 用 secret-tool,兜底为权限 0600 的本地文件)和 Hermes 的 .env 文件。智能体只看到“密钥已存储,已验证,成功”的反馈,看不到密钥本身。无头服务器可用 jev setup-key --tty 在终端隐藏输入。

技能挑选场景中,为什么每个技能描述被限制在 200 字符以内?

因为 Jev 的判断准确率与输入信息密度直接相关。超过 200 字符的描述会被截断,导致 Jev 看到的信息不完整,两个功能相近的技能可能被压缩成完全一样的描述,Jev 就无法区分。0.10.0 版本修复了八个技能描述超长导致两个任务委派技能无法区分的 bug,现在强制所有技能描述在 200 字符以内。

Hermes Jev Skills 的 shadow 模式是什么?推荐如何使用?

shadow 模式是路由功能的三档开关之一(off、shadow、on)。在 shadow 模式下,Jev 照常做判断并记录日志,但不会真的切换模型,用户继续使用当前模型。推荐先跑 shadow 模式,对比 Jev 建议派给便宜或贵模型的对话在实际业务中的质量表现,跑够样本后再切到 on 模式,让 Jev 真正影响模型选择。

如果 Jev 宕机或返回低置信度,Hermes Jev Skills 如何兜底?

采用“完全失败开放(fail-open)”策略:Jev 超时或低置信度时,路由继续用当前模型,记忆过滤返回原始列表,压缩不丢弃任何一轮,技能挑选不推荐任何技能,电脑操作返回 reobserve。没有 API 密钥时所有 Jev 功能自动禁用。Jev 整体宕机最多损失 2.5 秒时间预算,绝不阻塞对话。此外还有硬安全线,如风险词对话不会路由到最便宜模型。

0.10.0 版本修复的静默 bug 是什么?造成了什么后果?

内部函数 suggest_tiers() 在某次改版后只会输出 general 和 vision 两种结果,其他三种专长(coding、writing、research)被悄悄砍掉。后果是 Jev 每次判断“这是编程问题”后,suggest_tiers() 找不到编程模型池,就默默回退到 general 池,导致每一轮对话都花钱问 Jev 但答案从未真正影响模型选择。该 bug 静默存在至少几个月。0.10.0 版本增加了 route.dead_axis() 检测、jev doctor 诊断命令和升级版 dashboard 来补救。

🏷️

标签

➡️

继续阅读