使用任意* LLM 与 @mux/ai

使用任意* LLM 与 @mux/ai

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

Mux的@mux/ai工具现已支持开源模型,新增Baseten和OpenAI兼容端点提供商,允许用户自带本地或自托管模型。该工具要求视觉能力和结构化输出,部分模型需base64模式,并附验证脚本。开源模型存在可靠性问题,已通过重试机制解决。用户还可微调模型,集成更便捷。

🔎

延伸解读

自带端点:两种提供商的区别

新增的 baseten 提供商和 openai-compatible 提供商都基于 OpenAI 协议,但前者是后者的预设,专门针对 Baseten 的 URL 形状进行校验,配置错误时会立即报错。通用提供商则适用于任何兼容 OpenAI 协议的端点,如 vLLM、Ollama 等。选择时需注意:若使用 Baseten 部署,建议用 baseten 提供商以获得更明确的错误提示;若使用其他兼容服务,则用通用提供商。

视觉与结构化输出的门槛

@mux/ai 的工作流对模型有较高要求:涉及视频帧或故事板的四个工作流需要视觉能力,且默认通过 URL 传递图像,若端点不支持远程获取(如 Ollama),需设置 imageSubmissionMode 为 base64。所有工作流都要求结构化输出(json_schema),不支持该功能的端点会直接失败。文本类工作流(如生成章节)则对模型要求较低,几乎任何支持结构化输出的模型都可胜任。

开源模型的可靠性问题与重试机制

测试中发现,开源模型(如 Inkling)存在约十二分之一的概率出现输出被截断、导致 schema 验证失败的问题,且该问题非确定性,重试几乎总能成功。因此,@mux/ai 已将无输出响应视为可重试,并集成到 withRetry 机制中。但内容政策拒绝不会被重试。使用开源模型时,建议启用重试并留意输出质量,必要时运行验证脚本检查模型兼容性。

微调模型的集成与评估限制

用户可微调自己的模型(如 LoRA 微调 Mistral Small 3.1)并直接接入 baseten 提供商,无需再 fork SDK。但需注意:这些提供商不参与官方评估,成本估算为零,因为 Mux 无法获知你的 GPU 账单或推理速度。验证脚本只能确认模型能否运行工作流,实际效果需自行评估。微调模型可能产生更简洁、有观点的摘要,但质量取决于你的数据和训练。

Q&A

@mux/ai 新增了哪些 LLM 提供商支持?

@mux/ai 新增了 Baseten 提供商和通用的 OpenAI 兼容端点提供商,允许用户连接本地或自托管的模型,如 Ollama、vLLM 等。

为什么 @mux/ai 要支持更广泛的 LLM?

因为开源模型(尤其是多模态)性能大幅提升,且部署更简单,如 Baseten 提供 OpenAI 兼容端点,vLLM 等也支持该协议,所以 @mux/ai 扩展支持以覆盖更多使用场景。

使用 @mux/ai 的 OpenAI 兼容提供商时,如何指定模型?

没有默认模型,用户必须在代码中或通过环境变量(如 BASETEN_MODEL 或 OPENAI_COMPATIBLE_MODEL)指定模型。

@mux/ai 对视觉模型有什么要求?

处理视频帧或故事板的四个工作流(如 getSummaryAndTags)需要视觉能力。默认通过 URL 传递图像,若端点不支持远程 URL,可设置 imageSubmissionMode: "base64" 来内联图像。

开源模型在 @mux/ai 中可能遇到什么问题?

开源模型可能存在可靠性问题,例如 Inkling 模型约 1/12 的请求会输出截断,导致 schema 验证失败。但重试通常成功,因此 withRetry 机制已更新为将无输出视为可重试。

@mux/ai 如何验证模型是否兼容?

官方提供了验证脚本,可检查模型是否支持视觉和结构化输出,并建议参考 VISION-MODELS.md 文档。

用户能否微调模型并用于 @mux/ai?

可以。Joshua 的博客展示了如何使用 Baseten 训练 LoRA 微调 Mistral Small 3.1,并部署到专用端点,现在可直接接入 @mux/ai 的 baseten 提供商。

🏷️

标签

➡️

继续阅读