微软跳过OpenAI的决策模型,基于阿里Qwen自研决策模型

微软跳过OpenAI的决策模型,基于阿里Qwen自研决策模型

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

微软发布Decision-1决策模型,基于阿里Qwen3.5-9B训练,定价与TypeSafe的Jev相同,速度比GPT-6快14倍,已用于Xbox、Copilot等内部团队。但研究显示Jev类模型易受误导性输入影响,且Decision-1不支持图像,兼容性存疑。

🔎

延伸解读

微软自研决策模型的战略意图

微软基于阿里Qwen3.5-9B训练Decision-1,而非采用合作伙伴OpenAI的模型,这反映出微软在决策模型领域寻求技术自主。同时,微软计划未来将模型迁移至自研MAI和OpenAI模型,表明其长期战略是减少对外部模型的依赖,并整合内部资源。这一举措可能影响微软与OpenAI的合作关系,并加剧决策模型市场的竞争。

定价策略与商业考量

Decision-1的定价与TypeSafe的Jev完全相同,均为每百万输入token 0.042美元,且输出免费。这种定价策略可能旨在快速吸引开发者,但单次决策调用的收入微薄。微软的真正机会在于通过Foundry平台留住代理流量,包括围绕每次决策的生成调用,从而带动整体云服务消费。OpenRouter上的列表也可能吸引非Azure开发者加入微软生态。

技术局限与兼容性风险

Decision-1不支持图像输入,而OpenAI的Decisions API和Cloudflare的Clef均支持视觉编码器,这限制了其在多模态场景的应用。此外,微软未明确Decision-1是否完全兼容TypeSafe的System One API,尽管Foundry示例代码调用了/systemone端点。兼容性存疑可能影响开发者的迁移成本,并阻碍其融入现有决策模型生态。

校准置信度的潜在脆弱性

微软声称Decision-1的概率经过校准,但针对Jev的研究显示,误导性输入可导致置信度严重偏离。在JevOut预印本中,短小自然的上下文添加翻转了Jev 508个正确决策中的312个,其中229次错误答案的置信度超过70%。微软虽用八种扰动测试Decision-1,平均仅改变1.3%的答案,但未针对类似攻击进行测试,因此其置信度在实际对抗环境中的可靠性仍待验证。

❓

Q&A

微软Decision-1决策模型是基于什么训练的?

微软Decision-1是基于阿里Qwen3.5-9B进行后训练(post-trained)的,而不是基于其合作伙伴OpenAI的模型。微软计划很快将其重新基于自己的MAI模型以及OpenAI的模型。

Decision-1的定价和速度表现如何?

Decision-1的定价为每百万输入token 0.042美元,输出免费,与TypeSafe的Jev价格相同。在Xbox场景下,其速度比GPT-6 Sol快14倍以上,在Discovery场景下一致性高46倍。

微软内部哪些团队已经在使用Decision-1?

Xbox Research用它整理了超过10,000条玩家反馈;Copilot团队用它评估聊天和代理响应;on-call工程师在实时事件中用它提取上下文;Microsoft Discovery用它为实验打分,以便代理重新规划。

Decision-1与竞品相比有哪些不足?

Decision-1不支持图像输入,而OpenAI的Decisions API和Cloudflare的Clef支持;微软尚未宣布开放权重,而Cloudflare的Clef采用Apache 2.0许可;此外,微软未确认Decision-1是否完全兼容TypeSafe的System One API,尽管其Foundry示例代码调用了/systemone端点。

Jev类模型在对抗性输入下表现如何?

根据JevOut预印本研究,短小、自然的上下文添加可以翻转Jev的508个初始正确决策中的312个,其中229个案例中Jev对错误答案赋予了至少70%的概率。其他三个评分系统在相同测试下的翻转率在64.9%到73.2%之间。

微软对Decision-1的校准和兼容性有何说明?

微软称Decision-1的概率是经过校准的,即90%的预测在代表性案例中应有约90%的正确率,但建议客户在自己的数据上验证校准。关于兼容性,微软未确认Decision-1是否完全支持竞品采用的System One API,其Foundry示例代码调用了/systemone端点,但互操作性仍存疑。

🏷️

标签

➡️

继续阅读