AI Gateway现已支持服务分层

AI Gateway现已支持服务分层

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

AI Gateway新增服务分层功能,支持默认、优先和灵活三种层级,分别优化延迟、吞吐和成本。用户可通过providerOptions指定层级,适用于OpenAI和Gemini模型,支持多种API格式。计费按实际使用层级自动调整,优先请求降级时按默认费率计费。

🔎

延伸解读

服务分层如何影响成本与性能

AI Gateway 的服务分层提供了三种选择:默认、优先和灵活。优先层约为基础价格的1.8-2倍,适合交互式工作负载,以减少排队并提高吞吐量;灵活层约为基础价格的0.5倍,适合可容忍更高延迟的后台任务。这种设计让用户可以根据具体场景在延迟、吞吐和成本之间做出权衡。

降级机制与计费透明度

服务分层采用尽力而为的机制:如果请求无法使用指定层级,会自动回退到默认层级,并按默认费率计费,而不是优先层费率。同时,实际使用的层级会通过 providerMetadata 返回,方便用户确认请求是否被降级,以及对比不同层级的实际延迟。这有助于用户了解服务表现并优化成本。

跨提供商与API格式的兼容性

服务分层目前支持 OpenAI 和 Gemini 模型,并适用于 AI Gateway 的所有 API 格式,包括 AI SDK、Chat Completions、Anthropic Messages、OpenAI Responses 和 OpenResponses。用户可以在 providerOptions.gateway 下统一设置 serviceTier,无需针对不同提供商调整代码。若模型由多个提供商服务,也可在特定提供商的命名空间下单独配置层级,实现更精细的控制。

Q&A

AI Gateway的服务分层功能是什么?

AI Gateway新增了服务分层功能,提供默认、优先和灵活三种层级,分别用于优化延迟、吞吐量和成本。用户可以根据使用场景选择合适的层级。

AI Gateway的服务分层有哪几种?分别有什么特点?

有三种层级:默认(标准处理)、优先(更快处理,成本增加)和灵活(成本更低,但延迟可能更高)。

如何为请求指定服务层级?

在providerOptions.gateway中设置serviceTier,例如:providerOptions: { gateway: { serviceTier: 'priority' } }。该选项适用于所有支持服务分层的模型和提供商。

服务分层支持哪些模型和API格式?

目前支持OpenAI和Gemini模型,并且适用于所有AI Gateway API格式,包括AI SDK、Chat Completions API、Anthropic Messages API、OpenAI Responses API和OpenResponses API。

如果优先请求被降级,计费如何计算?

如果优先请求因容量不足而降级到默认层级,计费将按默认费率计算,而不是优先费率。

如何确认请求实际使用的服务层级?

请求返回的provider metadata中会包含实际应用的层级,可以用来确认请求被哪个层级服务,特别是在优先请求降级或比较延迟时。

能否针对不同提供商分别设置服务层级?

可以。如果模型由多个提供商提供服务,可以在提供商的命名空间下单独设置服务层级,例如在providerOptions.vertex中设置serviceTier,而其他提供商则使用默认层级。

服务分层是保证的吗?如果无法应用会怎样?

服务分层是尽力而为的。如果无法应用指定的层级,请求会以默认层级和默认费率运行,只有无效的服务层级值会导致请求失败。

🏷️

标签

➡️

继续阅读