内容提要
本文介绍如何用LiteLLM网关统一接入Amazon Bedrock的Mantle推理引擎与经典端点,使客户端通过单一地址和密钥调用GPT-5.6、Claude等9个模型。网关使用EC2实例角色进行SigV4认证,无需存储API密钥,并提供一个92行钩子解决Codex客户端兼容问题,实现多客户端共存。
延伸解读
端点与协议差异是接入的主要门槛
Mantle 与经典 bedrock-runtime 端点不仅地址不同,协议也不一致:GPT-5.x 只支持 Responses API,gpt-oss 只支持 Chat Completions,而 Claude 走 Converse/InvokeModel。这种差异导致业务代码需要适配多种请求体。通过 LiteLLM 网关统一收敛后,客户端只需使用一个地址和 key,即可透明调用所有模型,大幅降低集成复杂度。
使用实例角色认证可避免密钥管理负担
网关通过 EC2 实例角色进行 SigV4 认证,无需存储任何 API key,临时凭证自动轮转且仅存在于内存中。相比使用长期密钥,这减少了密钥泄露和轮转的运维负担。但需注意,Mantle 端点需要额外的 bedrock-mantle:CreateInference 权限,遗漏会导致授权失败。
测试形态与生产环境存在差距
文中部署方案将数据库与网关置于同一台 EC2,适合快速验证,但存在单点故障和数据丢失风险。生产环境建议将数据库外置至 RDS、网关多副本部署,并使用 Secrets Manager 管理凭证。此外,LITELLM_SALT_KEY 必须与数据库同生命周期保管,否则已存数据无法解密。
成本分级是接入多模型的实际价值
不同模型的 token 价格差异显著,例如 GPT-5.6 Sol 与 gpt-oss-20b 的输入价格相差约 78 倍。通过统一网关,团队可按任务难度选择不同档位的模型,实现成本优化。同时,虚拟 key 支持模型白名单和预算限制,便于按项目进行用量归集和管控。
Q&A
Mantle 是什么?它与 Bedrock 经典端点有什么不同?
Mantle 是 Amazon Bedrock 的新一代推理引擎,采用零运维人员访问设计,提供 OpenAI 兼容的 API(bedrock-mantle 端点),支持 Chat Completions 和 Responses 协议。与承载 Claude 的经典 bedrock-runtime 端点(使用 Converse/InvokeModel)在协议上不一致。
如何用 LiteLLM 网关统一调用 Bedrock 上的 GPT-5.6 和 Claude?
在 EC2 上部署 LiteLLM 网关,通过配置模型列表,将 GPT-5.x 模型路由到 bedrock_mantle/ 前缀(对应 Mantle 端点),将 Claude 模型路由到 bedrock/ 前缀(对应 bedrock-runtime 端点)。客户端只需使用一个网关地址和一个虚拟 key 即可调用所有模型。
为什么使用 bedrock_mantle/ 前缀而不是 openai/ 前缀?
bedrock_mantle/ 前缀使用 EC2 实例角色进行 SigV4 认证,无需存储 API key,且自动处理协议转换(如将 Chat Completions 转为 Responses)。而 openai/ 前缀需要提供 Bedrock API key,且不支持 Chat Completions 调用 GPT-5.x。
Codex 客户端调用 Mantle 时遇到 400 错误,如何解决?
Codex 客户端会将工具列表打包成 input 数组中的 additional_tools 私有变体,Mantle 不识别。解决方法是使用一个 92 行的 pre-call 钩子,将 additional_tools 项从 input 中摘出并合并到顶层 tools 字段,从而兼容标准 schema。
部署 LiteLLM 网关需要哪些 AWS 权限?
需要 IAM 角色包含 bedrock:InvokeModel 等常规权限,以及 bedrock-mantle:CreateInference 等 Mantle 特定权限。使用 EC2 实例角色进行 SigV4 认证,无需存储 API key。
LiteLLM 网关的测试形态和生产环境部署有什么区别?
测试形态将数据库和网关放在同一台 EC2 上,数据存在本地卷,无冗余。生产环境建议将数据库外置到 Amazon RDS,开启 Multi-AZ 和自动备份,网关放到 Auto Scaling 组或 EKS/ECS 中实现多副本,凭证使用 AWS Secrets Manager 管理。
使用 LiteLLM 网关调用 GPT-5.6 和 Claude 的成本大概是多少?
网关本身约 $63/月(t3.large 实例)。模型 token 费用按量计费,例如 GPT-5.6 Sol 输入 $5.50/百万 token,输出 $33/百万 token;gpt-oss-20b 输入 $0.07/百万 token,输出 $0.30/百万 token。
LiteLLM 网关支持哪些模型?
支持 9 个模型:GPT-5.6 的三个变体(Sol、Terra、Luna)、GPT-5.5、GPT-5.4、gpt-oss-120b、gpt-oss-20b,以及 Claude 的 claude-sonnet-4-5 和 claude-haiku-4-5。