内容提要
2026年10月,AWS发布基于阿里Qwen3.5的开源决策模型Strands Decider 2B,接口与TypeSafe AI的Jev相同。该模型接收应用状态和类型化问题,返回带概率的结构化答案,不生成文本,充当AI应用的判断层。TypeSafe的System One模式正成为行业标准,AWS、Upstage、Ollama等纷纷兼容。但研究显示Jev决策可被对抗性上下文误导,且OpenAI可能推出竞争性模式。
延伸解读
决策模型与LLM的分工
决策模型不生成文本,而是接收应用状态和类型化问题,返回带概率的结构化答案,充当AI应用的判断层。LLM负责规划、写作和调用工具,决策模型则处理代理在步骤之间做出的许多小判断。例如,在客服退款场景中,LLM起草回复,决策模型则选择队列、评估客户沮丧程度并判断退款政策是否适用。这种分工使决策模型成为AI应用中的“if语句”,以概率形式提供分支依据。
接口标准化与可移植性
TypeSafe的System One模式正成为行业标准,AWS、Upstage、Ollama等纷纷兼容。其API将决策简化为三种问题类型:选择、评分和是/否,并返回置信度。这种标准化带来了代码级可移植性:开发者只需更改基础URL,就能将应用从托管的Jev切换到本地的Strands Decider,而无需重写决策逻辑。然而,不同服务器在选项限制、置信度计算和答案质量上仍有差异,切换时仍需测试。
对抗性风险与置信度解读
研究显示,Jev的决策可被对抗性上下文误导。南加州大学的研究人员发现,优化器可以通过添加简短、自然的上下文,将61.4%的初始正确决策重定向到错误答案。基于Qwen的开源模型在同一研究中翻转率高达72.6%,表明这是类别性弱点。此外,Jev返回的置信度衡量的是概率分布的集中程度,而非答案正确的概率。团队应基于自身数据设置阈值,并将置信度视为多种控制手段之一,尤其是在应用状态包含用户提供文本时。
成本优势与企业治理
决策模型在成本上具有显著优势。OpenRouter上Jev每百万输入令牌收费0.042美元,且输出不收费;Perplexity的托管v1.1模型每百万输入令牌收费0.02美元。这使得路由或策略检查远比等效的LLM调用便宜。自托管的开源权重模型则以基础设施和运营成本替代按令牌计费,适合每小时做出数千次决策的管道。对企业而言,共享契约还带来治理和采购上的好处:可以批准一种集成模式,然后根据准确性、价格和数据驻留要求更换后端,从而获得更强的谈判地位。
Q&A
什么是决策模型?它和普通大语言模型有什么区别?
决策模型接收应用状态和一组类型化问题,返回带概率的结构化答案,不生成文本、代码或推理说明。它充当AI应用的判断层,而LLM负责规划、写作和调用工具。决策模型能快速给出可分支的概率,而LLM生成token且确定性报告较松散。
System One API 支持哪些问题类型?
System One API 将决策简化为三种问题类型:choice(从列表中选择一个选项)、score(将输入置于有序评分标准上)、noul(是/否问题,返回条件成立的概率)。开发者可以在一个请求中混合使用这三种类型。
目前有哪些公司或项目采用了 System One 模式?
采用者分为两类:第一类直接实现TypeSafe的端点,包括Upstage(Solar Decide)、Ollama(0.35版添加/v1/systemone)、Strands Decider、Kev、Open-Jev以及Ollaya、SGLang等本地运行时;第二类保留语义但更改地址,如OpenRouter的Decisions API、Venice的测试端点、Perplexity的Decisions API。OpenAI尚未加入,其Decisions API基于GPT-6 Luna且处于有限预览。
决策模型存在哪些安全风险?
南加州大学研究者发现,优化器可以通过添加简短、自然的上下文,将61.4%的508个初始正确的Jev决策重定向为错误答案。同一研究中,基于Qwen的开源模型翻转率达72.6%,表明弱点在于类别而非单一供应商。平台团队应将置信度阈值作为多种控制手段之一,尤其当应用状态包含用户提供的文本时。
决策模型的定价和成本如何?
在OpenRouter上,Jev每百万输入token收费0.042美元,输出不收费。Perplexity的托管v1.1模型每百万输入token收费0.02美元。自托管开源权重模型则以基础设施和运营成本替代按token计费,适合每小时做出数千次决策的流水线。
System One 和 OpenAI 的 Chat Completions API 有什么相似之处?
两者都是接口标准化的案例。Chat Completions API 因众多提供商克隆而成为LLM默认接口,OpenAI后来推出基于Responses API的Open Responses开放规范。System One 正在经历类似过程:语义形状先于正式治理传播,定义形状的公司最终不得不开放它,否则生态系统会漂移出兼容变体。