使用 AI Gateway 的 Auto Router 降低 AI 支出
内容提要
Cloudflare在AI Gateway推出Auto Router公开测试版,用户可将模型设为cloudflare/auto,系统自动按任务难度选择足够胜任的模型,无需手动挑选。内部测试显示,相比只用前沿模型,成本最多降低30%,性能接近Opus等顶级模型。其流程为先筛选可用模型,再用分类器判断任务类型与复杂度,结合价格和缓存成本评分,选出性价比最高者。
延伸解读
成本节省的适用场景
Auto Router 在广泛的知识工作任务中效果最佳,如邮件、日历、Slack、文件和财务等。内部测试显示,相比仅使用前沿模型,成本最多降低30%,且性能接近顶级模型。但节省幅度取决于非前沿工作的比例,任务越多样,节省越明显。
路由决策的透明性与调整
Auto Router 采用两阶段架构:先通过分类器预测任务类别和复杂度,再结合评分矩阵选择模型。这种设计使路由决策可解释,用户能查看每个任务的预测类别和复杂度。新增模型时只需添加基准权重,无需重新训练。
模型切换的隐藏成本
在长会话中,成本主要受缓存读写影响。切换模型会丢弃缓存,迫使新模型重写整个上下文。Auto Router 会考虑缓存成本,在同一轮内避免切换,跨轮时根据上下文长度施加切换惩罚,确保切换带来的收益能覆盖重写成本。
未来发展方向
Auto Router 目前为免费测试版,未来计划扩展模型池、纳入零数据保留要求、考虑提供商容量、为每个请求选择推理级别,并支持 Responses API 和 WebSockets。此外,还将推出 cloudflare/auto-best 等不同路由配置。
Q&A
Cloudflare Auto Router 是什么?它有什么作用?
Cloudflare Auto Router 是 AI Gateway 新推出的公开测试版功能。用户将模型设置为 cloudflare/auto 后,系统会自动将每个请求路由到足够胜任该任务的模型,无需手动选择模型,从而降低 AI 使用成本。
Auto Router 能节省多少成本?
根据 Cloudflare 内部测试,使用 Auto Router 相比仅使用前沿模型(如 OpenAI Sol 和 Anthropic Claude Opus)可节省高达 30% 的成本。在内部基准测试中,cloudflare/auto 的成本仅为 Sol 的 80%、Opus 的 35%。
Auto Router 是如何选择模型的?
Auto Router 首先筛选出能实际服务请求的模型池,排除不支持请求格式、执行模式或受凭据、计费、访问控制、支出限制影响的模型,并过滤不健康的上游。然后,它分析对话的最近消息,通过运行在 Workers AI 上的多头部分类模型判断任务类别(14 种)和四个维度(复杂度、模糊性、风险、对上下文的依赖),再结合模型基准结果和价格,计算每个模型的预期质量和自适应成本惩罚,选择效用最高的模型。
Auto Router 在模型切换时如何处理缓存成本?
Auto Router 会考虑缓存读写成本。在一个回合内,缓存是热的,切换模型很少划算,因此倾向于保持同一模型。跨回合时,它会施加一个随上下文令牌数增长的切换惩罚。仍持有活跃缓存的模型按更便宜的缓存读取费率计价,其他候选模型则按重写上下文的全部成本计价。对话越深,切换模型需要赚回的成本就越高。
Auto Router 目前有哪些局限性或未来计划?
目前 Auto Router 处于公开测试阶段,免费使用。未来计划包括:扩展 cloudflare/auto 提供的模型、在筛选模型时考虑零数据保留要求、考虑提供商容量、为每个请求选择合适的推理级别、全面支持 Responses API 和 WebSockets,以及探索结构化决策模型作为第一遍分类器。
Auto Router 与直接使用前沿模型相比性能如何?
在 Cloudflare 内部通用知识工作基准测试中,cloudflare/auto 的成功率为 86.6%,与 Anthropic Claude Opus 5.5 的 96.6% 和 OpenAI GPT-6 Sol 的 84.2% 相比,性能接近,但成本显著更低。对于编码任务,其表现与前沿模型相当。