Databricks 如何在首日向 14,000 名员工推出前沿模型

Databricks 如何在首日向 14,000 名员工推出前沿模型

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

Databricks 通过 Unity Gateway 和 CLI,让超万名员工在新模型(如 Opus 5.5、GPT-6 Sol)发布首日即可试用,并标记为实验性。三天内依据基准测试、用户反馈和成本追踪确认性价比,随后转为正式模型。Opus 5.5 每会话成本降低 29%,将设为 Claude Code 默认;GPT-6 Sol 成本降低 48%,将纳入智能路由。

🔎

延伸解读

实验性标签与快速评估机制

Databricks 将新模型标记为“实验性”,让员工在首日即可试用,同时明确其可能非最佳或不会长期保留。通过 Unity Gateway 和 CLI,公司能集中推送配置并收集使用数据。三天内,结合基准测试、用户反馈和成本追踪,团队确认模型是否处于效率前沿,从而决定是否移除实验标签。这种机制平衡了快速访问与风险控制,使评估周期大幅缩短。

成本追踪中的偏差校正方法

早期采用者多为重度用户,且会尝试更难的任务,直接比较每会话成本会产生误导。Databricks 保持同一用户群,并将会话按单轮/多轮、是否编辑文件分层,再重新加权分布。这样得出的成本变化更真实:Opus 5.5 每会话成本降低 29%,GPT-6 Sol 降低 48%。该方法为评估新模型的实际开销提供了可靠参考。

从实验到默认:模型部署决策

基于评估结果,Opus 5.5 因质量提升且成本更低,将被设为 Claude Code 的默认模型;GPT-6 Sol 虽成本优势明显,但质量偶尔不及 GPT-5.6 Sol,因此不会取代 Codex 默认,而是纳入智能路由工具包。这体现了按场景差异化部署的策略:默认模型追求综合最优,路由则利用成本优势处理合适任务。

❓

Q&A

Databricks 是如何让超过一万名员工在模型发布首日就能试用新模型的?

Databricks 通过 Unity Gateway 和 Unity Gateway CLI(UG CLI)实现。Unity Gateway 作为中心枢纽,用于 AI 治理、成本管理和可观测性,员工可通过它访问新模型。UG CLI 已通过移动设备管理部署在员工笔记本电脑上,当员工启动 Claude Code、Codex 或 Omnigent 时,UG CLI 会检查新模型、工具和技能,并更新本地 harness 的配置。

Databricks 如何评估新模型是否值得长期使用?

Databricks 依赖三个信号:基准测试(如 OfficeQA Pro V2)、用户反馈和成本追踪。通过比较早期采用者与同一群体一周前的使用情况,并将成本归一化为每会话成本,同时根据会话类型(单轮/多轮、是否编辑文件)进行分层和重新加权,以确定模型是否处于效率前沿。

Opus 5.5 和 GPT-6 Sol 在成本上相比旧模型降低了多少?

根据 Databricks 的成本追踪,Opus 5.5 相比 Opus 4.8 每会话成本从 $5.94 降至 $4.23,降低了 29%;GPT-6 Sol 相比 GPT-5.6 Sol 每会话成本从 $4.52 降至 $2.34,降低了 48%。

Databricks 在模型发布后多久决定将其转为正式模型?依据是什么?

Databricks 在模型发布后三天内收集足够数据,确认模型处于效率前沿后,便将其从实验性预算移出,转为正式可用模型。依据包括基准测试、用户反馈和成本追踪三个信号的一致性。

Opus 5.5 和 GPT-6 Sol 在 Databricks 内部将如何被进一步采用?

Opus 5.5 将被设为 Claude Code 的默认模型,因其质量更高且成本更低。GPT-6 Sol 不会取代 GPT-5.6 Sol 成为 Codex 的默认模型,但会被纳入智能路由的工具包中,以利用其成本优势。

Databricks 如何管理员工使用新模型的预算?

Databricks 为每位用户定义了四个主要预算,并将新模型(如 Opus 5.5 和 GPT-6 Sol)在发布首日标记为实验性预算,供员工试用。通过 Unity Gateway 集中管理预算,并收集使用数据以评估模型表现。

🏷️

标签

➡️

继续阅读