AI Gateway新增统一快速模式支持

AI Gateway新增统一快速模式支持

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

AI Gateway推出统一的快速模式测试版,用户可通过设置speed为fast请求所有模型的快速服务,若不可用则回退至标准速度。快速模式以更高token成本换取更低延迟或更高吞吐量,无需绑定特定提供商。支持在Claude Code中用/fast切换,其他代理可选fast slug。快速模式适用于部分模型,无快速层时请求无影响。

🔎

延伸解读

统一抽象,简化调用

AI Gateway 将不同模型的快速服务统一为 speed: 'fast' 参数,开发者无需针对每个提供商单独配置。这种抽象降低了集成成本,尤其适合多模型场景。但需注意,快速模式并非所有模型都支持,若模型无快速层,请求会自动回退到标准速度,不会报错。

成本与性能的权衡

快速模式以更高的每 token 成本换取更低的延迟或更高的吞吐量。对于延迟敏感的应用(如实时交互),这可能值得;但对于成本敏感或非实时场景,需谨慎评估。文章未给出具体价格差异,建议开发者根据实际需求测试并对比成本。

灵活的使用方式

除了统一参数,还可直接使用带 -fast 后缀的模型 slug(如 anthropic/claude-opus-5-fast),便于在模型列表或 fallback 配置中明确指定。在 Claude Code 中可通过 /fast 命令切换,其他代理则需手动选择 fast slug。这种灵活性适应不同开发习惯,但需注意 slug 可能随模型更新而变化。

Q&A

AI Gateway的快速模式是什么?

AI Gateway的快速模式是一种统一的抽象,允许用户通过设置speed为fast来请求所有模型的快速服务。它提供更低的延迟或更高的吞吐量,但以更高的每token成本为代价。

如何在AI Gateway中启用快速模式?

在providerOptions.gateway中设置speed为fast即可启用快速模式。例如:providerOptions: { gateway: { speed: 'fast' } }。也可以直接使用快速变体的slug,如anthropic/claude-opus-5-fast。

如果模型没有快速层,请求会怎样?

如果模型没有快速层,请求会以标准速度运行,不会产生任何影响。

快速模式与标准模式在成本上有何区别?

快速模式通常比标准模式更昂贵,因为它以更高的每token成本换取更低的延迟或更高的吞吐量。具体价格需查看定价详情。

在Claude Code中如何使用快速模式?

在Claude Code中,可以通过输入/fast命令来切换快速模式,适用于Anthropic Opus模型。

快速模式支持哪些模型?

快速模式支持一组不断增长的模型,可以在模型列表中通过闪电图标识别。如果模型没有快速层,请求会回退到标准速度。

🏷️

标签

➡️

继续阅读