24 天估值暴涨 37 倍,这就是 AI 圈年度爽文

24 天估值暴涨 37 倍,这就是 AI 圈年度爽文

💡 原文中文,约3500字,阅读约需9分钟。
📝

内容提要

Jev获a16z领投8.7亿美元融资,估值24天内增长37倍至75亿美元。其决策模型不聊天、不写代码,仅对给定选项输出校准概率,用于Agent中大量分支判断,兼顾低成本与低延迟。微软、OpenAI、vLLM相继入局,多基于千问模型。Jev不取代大模型,而是成为Agent基础设施,让微小判断也值得调用AI。

🔎

延伸解读

决策模型为何此时爆发

决策模型的兴起与Agent实际落地紧密相关。Agent任务中常包含数十次分支判断,如路由模型、工具调用放行等,这些判断答案空间有限、调用量大且位于关键路径。若每次都用前沿大模型,延迟和成本会快速累积。决策模型专为这类场景设计,以低成本、低延迟输出校准概率,使大量微小判断变得经济可行。

校准概率:决策模型的核心价值

决策模型的关键优势在于输出校准概率,即模型声称有90%把握时,实际准确率也接近90%。这使得应用可以设置置信度阈值:高于阈值自动执行,低于阈值则转人工或升级大模型。这种机制让自动化决策更可靠,尤其适合需要权衡风险与效率的Agent工作流。

与通用大模型的关系:互补而非取代

决策模型不会聊天、写代码或总结文档,它只针对给定选项输出概率,因此不会取代通用大模型。相反,它更像Agent基础设施的一层:大模型负责提出方案和生成内容,决策模型负责检查条件是否满足、回复能否交付。两者分工协作,共同支撑复杂Agent任务。

行业格局:千问基座与多元玩家

当前决策模型领域已有多家玩家入局,包括微软的Decision-1、OpenAI的Decisions API以及vLLM开源的6款模型。值得注意的是,多数决策模型基于不同版本的千问模型进行后训练,仅OpenAI的Decisions API和Jev本身例外。这反映出千问在决策模型生态中已成为重要基座,而竞争正围绕准确率、时延和成本展开。

❓

Q&A

Jev 是什么?它和普通大模型有什么区别?

Jev 是一种决策模型,不会聊天、写代码或总结文档。它接收一段上下文和一组预先定义好的候选答案,在短时间内返回每个选项的校准概率。与普通大模型逐步生成文本不同,Jev 单次前向直接输出概率,结果供程序使用而非给人看。

为什么决策模型现在火起来了?

根本原因是 Agent 真正跑起来了。一个 Agent 任务里有几十次小的分支判断,如路由到哪个模型、工具调用是否放行、继续还是停止。这些判断答案空间有限、调用量大、全在关键路径上。用前沿 LLM 做每次判断会导致延迟按秒叠加、成本按 token 不断增加,因此需要低成本低延迟的决策模型。

Jev 的融资和估值情况如何?

Jev 获得了由 a16z 领投的 8.7 亿美元融资,公司 TypeSafe 估值达到 75 亿美元。在 9 月 15 日发布时,种子轮仅 4000 万美元、估值约 2 亿;24 天内估值翻了 37 倍。模型推出三周,单日处理数万亿 Token,约三分之一财富 500 强在使用。

决策模型主要应用在哪些场景?

决策模型适用于请求分类、模型路由、搜索结果相关性判断、给 AI 回复或 Agent 动作打分、安全拦截、数据校验、工单分流、从固定动作中选择下一步、大规模文本标注等。例如在 Agent 准备调用外部工具时,可在「继续执行」「重试」「换工具」「转人工」之间给出概率,应用根据阈值决定下一步。

微软的 Decision-1 模型有什么特点?

Microsoft-Decision-1 输入为一段证据、一个问题和一组固定选项,单次前向输出每个选项的概率。支持 yes/no、多选、评分、分类,一次调用最多处理 32K token,不生成解释或推理过程。以 Qwen3.5-9B 为基座继续训练。在 36 个测试集、近 15 万道题中取得最高准确率,速度比 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。其杀手锏是校准概率,即模型说 90% 把握时真的对 90%。

决策模型会取代普通大模型吗?

不会。决策模型更像一个评分器,大模型负责提出方案,决策模型负责检查方案是否满足条件;大模型负责写出回复,决策模型负责判断回复能不能交付。这类决策模型大概率会作为 Agent 基础设施的一层留下来,但不会取代普通大模型。

🏷️

标签

➡️

继续阅读