本文介绍在Amazon Bedrock上使用lm-evaluation-harness框架评估LLM编程能力的方法,以HumanEval基准测试为例。通过LiteLLM适配层集成,对GPT-5.6 Sol、Claude Opus 4.8和Claude Sonnet 5进行测试,三者pass@1均达97-98%。同时利用Bedrock Prompt Caching技术,在批量评估中实现84%以上的输入token成本节省,并支持配置扫描优化参数。
完成下面两步后,将自动完成登录并继续当前操作。