内容提要
role-model是一个开源AI模型路由协议,支持本地与云端混合路由,根据任务类型、成本、延迟自动选择模型。DeepSeek Harness插件生态通过“一切皆插件”架构集成,但需手动配置。通过llm-adaptive等插件实现复杂度路由,缓存命中率可达99%,降低推理成本。未来官方插件将统一配置,实现更细粒度路由。
延伸解读
路由决策的可解释性
role-model将路由决策拆分为请求描述、端点描述、路由策略和可观测性记录四个模块,每一步都有据可查。这种设计让开发者能清晰理解为何选择某个模型,便于调试和优化。相比黑盒路由,可解释性降低了维护成本,也增强了系统的可信度。
缓存命中率与路由粒度的关系
文章指出,高缓存命中率并非偶然,而是路由决策稳定且可重复的结果。通过细粒度的任务分类,同类请求会聚集到同一端点,从而提升前缀缓存命中率。这解释了为何缓存命中率能达99%以上,也说明路由粒度越细,成本优化效果越明显。
过渡方案的局限
在官方插件发布前,社区提供了llm-adaptive和dsh-model-router等过渡方案。但手动配置pool.json或自定义端点仍需要人工干预,无法实现完全自动化的任务感知路由。这些方案只能作为临时措施,官方插件将统一配置,简化路由层的搭建。
Q&A
role-model是什么?它主要解决什么问题?
role-model是一个开源的AI模型路由协议及参考实现,旨在为每个任务自动分配合适的模型,解决开发者面临的“该用哪个模型处理这个请求”的问题。它支持本地与云端混合路由,根据任务类型、成本、延迟等因素做出可解释、可移植的路由决策。
role-model支持哪些混合路由场景?
role-model支持三种混合路由场景:Local/Local(在本地模型之间路由,基于角色、任务和能力)、Local/Cloud(在本地和云端模型之间路由,基于成本、延迟和任务难度)、Cloud/Cloud(在多个云服务商之间路由,基于能力和成本考量)。
如何安装role-model?
macOS和Linux用户可运行一行命令:`curl -fsSL https://raw.githubusercontent.com/try-works/role-model/main/scripts/install.sh | sh`,安装后启动器位于`~/.local/bin/role-model`。Windows用户运行PowerShell命令:`irm https://raw.githubusercontent.com/try-works/role-model/main/scripts/install.ps1 | iex`,安装后位于`%LOCALAPPDATA%\Programs\role-model\`。也可以从GitHub Releases下载对应平台的压缩包。
role-model默认运行在哪个端口?
role-model默认运行在http://127.0.0.1:3456。
llm-adaptive插件如何实现复杂度路由?
llm-adaptive插件为DSH的模型选择器添加了adaptive选项。选择后,每次LLM请求先通过一个flash分类器判断复杂度(low、medium、high、critical四个档位),然后按配置好的链路由到对应的后端模型。分类结果有120秒的决策缓存,避免重复判断。安装命令为`dsh plugin add llm-adaptive`,配置在`~/.dsh/tools/cc-switch-sync/pool.json`中。
如何将role-model作为DSH的自定义模型端点?
在DSH的设置界面中,进入“模型高级配置”页面,新增一个端点,URL填role-model的地址`http://127.0.0.1:3456`,模型名称填role-model中配置的端点标识。保存后,DSH的模型选择器会出现该自定义端点。但此方案只能配置单个端点,无法实现自动路由,需要手动切换模型。
为什么缓存命中率能达到99%?
缓存命中率高是因为路由决策本身被变成了稳定、可重复的信号。role-model的路由决策是可解释、可记录的,每次决策都基于任务类型、成本、延迟等,形成稳定的上下文。dsh-model-router插件进一步通过zero-prefix flash judge快速判断简单问题,直接在廉价模型上处理,避免污染主会话的缓存。这样复杂任务的缓存命中率自然提高。
DSH插件生态的核心理念是什么?
DSH(DeepSeek Harness)的核心理念是“一切皆插件”,模型适配器、工具注册、Agent主循环、沙箱、审批策略、UI等都可以作为插件替换。它于2026年8月13日开源,采用MIT协议。
role-model与llm-adaptive在路由决策上有什么不同?
role-model做的是“任务感知”路由,根据请求的任务类型、所需能力、模态、工具需求等做决策;而llm-adaptive做的是“复杂度感知”路由,按复杂度档位(low、medium、high、critical)来分。两者理念有重合但不完全相同。