原文中文,约8300字,阅读约需20分钟。
📝
内容提要
开发者在选择LLM时,需要在准确性、延迟和成本之间做出权衡。本文在 Amazon Bedrock 上对GPT-5.6 Sol、Claude Opus 4.8、Claude Sonnet 5运行 HumanEval 编程基准测试,三者均在 97-98% 区间。同时,我们展示了如何利用 Bedrock Prompt Caching 实现 84% 以上的输入 token 成本节省。
🏷️