OmniRoute 本地模型代理快速入门指南

OmniRoute 本地模型代理快速入门指南

💡 原文中文,约2600字,阅读约需7分钟。
📝

内容提要

OmniRoute 是一个本地免费 AI 网关,支持通过 npm 或 Docker 在五分钟内完成部署。它可连接 OpenCode Free、Z.AI、NVIDIA NIM、Mistral 等免费提供商,并配置 Claude Code、Cursor 等工具,支持 19 种路由策略与压缩,每月提供约 1.37B 免费 tokens。

🔎

延伸解读

部署方式选择:npm 与 Docker 的适用场景

文章提供了 npm 全局安装和 Docker 容器两种部署方式。npm 方式适合本地开发环境,安装后直接运行 omniroute 命令即可启动,操作更轻量。Docker 方式则通过端口映射和卷挂载运行,适合希望隔离环境或需要持久化数据的场景。两者均将服务暴露在本地 20128 端口,Dashboard 和 API 端点共用该端口,读者可根据自身对环境隔离和持久化的需求选择。

免费提供商的额度差异与使用策略

文章列出了多个免费提供商及其额度:Mistral 约 1B tokens/月,Nara 约 210M,LLM7 约 150M,Z.AI 提供永久免费的 Flash 系列模型并附注册奖励,NVIDIA NIM 则限制约 40 RPM。这些额度在类型和限制上差异明显,有的按月总量,有的按速率。文章建议注册多个账号分散使用,并提醒部分提供商需要实名认证,读者应据此规划账号和路由策略。

路由策略与压缩功能如何影响实际使用

OmniRoute 支持 19 种路由策略,包括 auto/coding、auto/fast、auto/cheap、auto/smart 以及 fusion、pipeline 等组合方式,可实现负载均衡和故障回退。此外,内置 RTK 和 Caveman 压缩引擎可节省 15–95% tokens。这些功能意味着用户可以根据任务类型选择策略,并通过压缩进一步降低 token 消耗。文章未展开各策略的具体算法,读者可在 Dashboard 的 Combos 和 Context & Cache 中自行配置和观察效果。

验证与日常维护的要点

文章给出了验证安装的 curl 命令,通过请求 /v1/models 并携带 API Key 来确认服务是否正常返回模型列表。日常维护方面,提供了 omniroute providers、combos、doctor、setup 等命令,分别用于查看提供商、组合配置、诊断健康状态和重置配置。这些命令有助于排查连接问题和调整路由设置,读者应熟悉这些基础操作以便在出现异常时快速定位。

❓

Q&A

OmniRoute 是什么?它主要解决什么问题?

OmniRoute 是一个本地免费 AI 网关,支持通过 npm 或 Docker 在五分钟内完成部署。它可连接 OpenCode Free、Z.AI、NVIDIA NIM、Mistral 等免费提供商,并配置 Claude Code、Cursor 等工具,支持 19 种路由策略与压缩,每月提供约 1.37B 免费 tokens。

如何安装和启动 OmniRoute?

有两种方式:方式 A(推荐)使用 npm:全局安装 `npm install -g omniroute`,然后运行 `omniroute` 启动服务。方式 B 使用 Docker:运行 `docker run -d --name omniroute -p 127.0.0.1:20128:20128 -v omniroute-data:/app/data diegosouzapw/omniroute:latest`。启动后访问 Dashboard(http://localhost:20128)或 API 端点(http://localhost:20128/v1)。

OmniRoute 支持哪些免费 AI 提供商?每月免费额度是多少?

OmniRoute 支持 OpenCode Free(无需认证)、Z.AI / Zhipu (glm-cn)(GLM-4-Flash / 4.5-Flash / 4.7-Flash 永久免费 + 20M 注册奖励)、NVIDIA NIM(GLM, MiniMax ~40 RPM 免费)、Mistral(~1B tokens/月)等。免费层级概览显示:Mistral ~1B tokens/月,Nara ~210M tokens/月,LLM7 ~150M tokens/月,Z.AI 永久免费 + 20M,NVIDIA NIM ~40 RPM,总计约 1.37B 每月免费 tokens(不含注册奖励)。

如何在 Claude Code 或 Cursor 中配置 OmniRoute?

在 Claude Code、Codex、Cursor、OpenCode 等工具中配置 OmniRoute:Base URL 设置为 http://localhost:20128/v1,API Key 从 Dashboard → Endpoints 复制,Model 选择 auto(智能路由)或指定提供商模型。例如在 Claude Code 配置文件中设置:export ANTHROPIC_BASE_URL="http://localhost:20128/v1" 和 export ANTHROPIC_API_KEY="YOUR_OMNIROUTE_API_KEY"。

OmniRoute 的 Combos 多提供商组合是什么?有哪些路由策略?

OmniRoute 支持 19 种路由策略,自动实现负载均衡和故障回退。常见策略包括:auto/coding(智能编码路由,默认)、auto/fast(优先快速响应)、auto/cheap(优先低成本模型)、auto/smart(综合智能路由)、fusion(并行调用多个模型,通过 judge 综合答案)、pipeline(模型链式调用)。配置路径:Dashboard → Combos → 创建新 Combo。

OmniRoute 的压缩功能如何启用?能节省多少 tokens?

OmniRoute 内置 RTK + Caveman 压缩引擎,可节省 15–95% tokens。启用方法:访问 Dashboard → Context & Cache,启用 Caveman 或 RTK 压缩,并设置压缩组合(如 rtk → caveman)。

🏷️

标签

➡️

继续阅读