在 Databricks 上通过 SQL 运行 open-Jev

在 Databricks 上通过 SQL 运行 open-Jev

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

Databricks 推出新方案,支持在无服务器 GPU 上部署开源决策模型,并通过 ai_query 对受治理数据直接运行。用户无需管理 GPU 基础设施,即可从 SQL 控制台或生产作业调用模型,对酒店评论等数据分类并返回结构化结果与概率。该模式支持自定义模型 API,便于大规模应用和企业场景微调。

🔎

延伸解读

决策模型与通用大模型有何不同

文章指出,Jev 等“System One”决策模型能从离散选项中产生校准良好的决策,通常速度极快且成本低廉。这与通用大模型追求开放生成不同,决策模型更专注于在有限选项间做选择,适合大规模数据上的分类或决策任务。开源社区已推出 Smelf-open-jev、Laya、Kev 等开放权重版本,降低了实验门槛。

无需管理 GPU 基础设施的部署方式

Databricks 通过 AI Runtime 提供无服务器、按需的 GPU 计算,用户无需自行搭建或管理 GPU 基础设施。文章中的示例将开源分类器部署为托管端点,并可直接从 SQL 控制台或 Lakeflow 生产作业中通过 ai_query 调用。这降低了从实验到生产部署的运维负担,使团队能更专注于数据与决策逻辑。

自定义模型 API 带来的灵活性

一个关键点是端点不必暴露标准的聊天补全接口。Databricks ai_query 支持任意自定义模型 API,因此可以直接从 SQL 发送 SemIf 的结构化请求格式。这意味着用户能沿用模型原有的输入输出约定,并将分类结果和选项概率以结构化列的形式返回,便于后续在 SQL 中直接处理和分析。

从酒店评论分类看实际应用路径

文章以将酒店评论分类为好评或差评作为示例,并提供了可导入的 Databricks Notebook。用户只需导入 Notebook、选择 Serverless GPU 并点击 Run All 即可开始。之后可以将其应用到自己的数据,替换决策标准,探索该模式在客服记录分析等场景中的适用性。这为评估决策模型在受治理数据上的效果提供了低门槛的起点。

❓

Q&A

如何在 Databricks 上部署开源决策模型?

使用 Databricks AI Runtime 在无服务器 GPU 上部署开源决策模型,无需管理 GPU 基础设施。

ai_query 如何对受治理数据运行决策模型?

通过 ai_query 可以直接从 SQL 控制台或生产作业调用模型,对受治理数据应用结构化决策。

开源决策模型有哪些典型应用场景?

可用于分析客户支持记录、大规模应用复杂决策,例如对酒店评论进行分类。

Databricks 如何支持自定义模型 API?

ai_query 支持任意自定义模型 API,可以直接从 SQL 发送结构化请求格式。

如何对酒店评论进行好坏分类?

使用 SemIf-OpenJev 模型,通过 ai_query 对酒店评论进行分类,返回分类结果和选项概率。

如何开始使用 Databricks 上的决策模型?

导入 Databricks Notebook,选择 Serverless GPU,点击 Run All 即可开始。

🏷️

标签

➡️

继续阅读