内容提要
AI Gateway新增服务分层功能,支持默认、优先和灵活三种层级,分别优化延迟、吞吐和成本。用户可通过providerOptions指定层级,适用于OpenAI和Gemini模型,支持多种API格式。计费按实际使用层级自动调整,优先请求降级时按默认费率计费。
延伸解读
服务分层如何影响成本与性能
AI Gateway 的服务分层提供了三种选择:默认、优先和灵活。优先层约为基础价格的1.8-2倍,适合交互式工作负载,以减少排队并提高吞吐量;灵活层约为基础价格的0.5倍,适合可容忍更高延迟的后台任务。这种设计让用户可以根据具体场景在延迟、吞吐和成本之间做出权衡。
降级机制与计费透明度
服务分层采用尽力而为的机制:如果请求无法使用指定层级,会自动回退到默认层级,并按默认费率计费,而不是优先层费率。同时,实际使用的层级会通过 providerMetadata 返回,方便用户确认请求是否被降级,以及对比不同层级的实际延迟。这有助于用户了解服务表现并优化成本。
跨提供商与API格式的兼容性
服务分层目前支持 OpenAI 和 Gemini 模型,并适用于 AI Gateway 的所有 API 格式,包括 AI SDK、Chat Completions、Anthropic Messages、OpenAI Responses 和 OpenResponses。用户可以在 providerOptions.gateway 下统一设置 serviceTier,无需针对不同提供商调整代码。若模型由多个提供商服务,也可在特定提供商的命名空间下单独配置层级,实现更精细的控制。
Q&A
AI Gateway的服务分层功能是什么?
AI Gateway新增了服务分层功能,提供默认、优先和灵活三种层级,分别用于优化延迟、吞吐量和成本。用户可以根据使用场景选择合适的层级。
AI Gateway的服务分层有哪几种?分别有什么特点?
有三种层级:默认(标准处理)、优先(更快处理,成本增加)和灵活(成本更低,但延迟可能更高)。
如何为请求指定服务层级?
在providerOptions.gateway中设置serviceTier,例如:providerOptions: { gateway: { serviceTier: 'priority' } }。该选项适用于所有支持服务分层的模型和提供商。
服务分层支持哪些模型和API格式?
目前支持OpenAI和Gemini模型,并且适用于所有AI Gateway API格式,包括AI SDK、Chat Completions API、Anthropic Messages API、OpenAI Responses API和OpenResponses API。
如果优先请求被降级,计费如何计算?
如果优先请求因容量不足而降级到默认层级,计费将按默认费率计算,而不是优先费率。
如何确认请求实际使用的服务层级?
请求返回的provider metadata中会包含实际应用的层级,可以用来确认请求被哪个层级服务,特别是在优先请求降级或比较延迟时。
能否针对不同提供商分别设置服务层级?
可以。如果模型由多个提供商提供服务,可以在提供商的命名空间下单独设置服务层级,例如在providerOptions.vertex中设置serviceTier,而其他提供商则使用默认层级。
服务分层是保证的吗?如果无法应用会怎样?
服务分层是尽力而为的。如果无法应用指定的层级,请求会以默认层级和默认费率运行,只有无效的服务层级值会导致请求失败。