清华大学与阿里巴巴达摩院发布MCPEvol-Bench基准,首次评估LLM Agent在动态工具环境中的适应力。通过11种突变算子模拟MCP服务器演化,测试123个服务器和12个模型,发现顶级Agent性能下降13.7%-14.4%,暴露静态基准的局限,凸显动态适应能力瓶颈,为AI应用部署提供质量保障。
完成下面两步后,将自动完成登录并继续当前操作。