你的AI智能体正在为无需言语的选择消耗token

你的AI智能体正在为无需言语的选择消耗token

💡 原文英文,约900词,阅读约需3分钟。
📝

内容提要

Kev是Jared Palmer基于Qwen 3.5推出的开源决策模型系列(0.8B、4B、9B),采用仅预填充架构,跳过文本生成,通过指针头直接输出决策概率,支持Noul、Choice、Score三类决策,兼容TypeSafe的System One API。最大模型Kev-9B在域外测试达83.7%准确率,但概率校准可能漂移,微调后通用知识与算术能力下降。模型以Apache 2.0开源,权重、训练代码和评估工具均可获取。

🔎

延伸解读

决策层与生成层分离的实用价值

Kev将路由、安全检查和排序等决策从生成模型中剥离,由专用决策模型处理。这能减少不必要的token消耗,因为决策不需要生成文本。对于频繁做出有界决策的智能体循环,这种分离可能降低开销,但文章指出,如果应用只做少量决策,在现有模型上使用约束解码可能更简单。

概率校准漂移带来的风险

Kev返回的概率并不总是反映真实置信度。Palmer发现温度校准在未见过的源分布上可能漂移,这对依赖概率阈值来决定执行或升级的智能体是个问题,因为高概率选择仍可能错误。开发者需注意校准问题,不能盲目信任输出概率。

微调对通用能力的削弱

微调Kev会改变从基础模型继承的能力。评估显示,通用知识和算术测试成绩下降,小模型尤其明显。这符合Kev作为专用决策模型的定位,它更适合与通用模型配合使用,而非独立承担开放推理任务。

开源与闭源对比的局限性

Kev以Apache 2.0开源,提供权重、训练代码和评估工具,而TypeSafe的Jev权重和训练数据不公开。这使得直接性能对比困难,因为差异无法归因于架构、规模或训练。开发者选择时需考虑开源带来的自主训练和部署灵活性,但也要接受缺乏与闭源方案直接比较的基准。

Q&A

Kev是什么?它和普通生成式模型有什么不同?

Kev是Jared Palmer基于Qwen 3.5推出的开源决策模型系列,包含0.8B、4B、9B参数版本。它采用仅预填充架构,跳过文本生成,通过指针头直接输出决策概率,而普通生成式模型需要自回归解码生成文本。

Kev支持哪些类型的决策?具体怎么用?

Kev支持三种决策类型:Noul用于是/否判断,Choice用于从候选中选择,Score用于有序等级评分。开发者提供状态和问题,指针头返回各候选的概率,例如工具路由输出search: 0.82、database: 0.13、calculator: 0.05。

Kev-9B的准确率如何?有哪些已知限制?

Kev-9B在项目锁定的域外测试中达到83.7%准确率(开发者报告)。限制包括:概率校准可能漂移,温度校准在未见过的源分布上会漂移,影响基于概率阈值的决策;微调后通用知识和算术能力下降,小模型尤其明显。

Kev和TypeSafe的Jev有什么关系?

TypeSafe本月早些时候推出了Jev,作为其System One平台的一部分,使用相同的Noul、Choice和Score原语。Kev实现了其/v1/systemone请求和响应格式,因此基于该API构建的应用可以指向本地Kev服务器。最大区别是Kev以Apache 2.0开源,权重、训练代码和评估工具均可获取,而Jev的权重和训练数据不公开。

Kev能处理多个决策吗?性能如何?

可以。多个决策可以在单次前向传播中对同一状态进行,使用块因果注意力掩码隔离问题,指针头独立评分每组候选。Palmer的文档显示4B模型在M5上以bf16处理三个问题耗时277毫秒,但缺乏与Qwen生成等效答案的受控对比,无法确定实际加速程度。

Kev适合哪些应用场景?什么时候不适合用?

适合代理循环中频繁的决策,如路由、排序、安全检查、工具选择和升级,这些步骤只需选择或概率,无需生成文本。不适合需要开放式推理和最终响应的任务,这些仍由更大的生成模型处理。对于只做少量有界决策的应用,在已有模型上使用约束解码可能比增加另一个模型更简单。

🏷️

标签

➡️

继续阅读