Real-SWE基准测试将AI编程代理置于真实企业私有代码库中,结果显示其表现大幅下降。Claude Fable 5.1以38.8%的成功率领先,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。十个任务中有六个成功率低于15%,且无模型能解决分析流缩减器。失败主因是遗漏需求和集成错误,表明解决编程题与应对陌生生产代码库差异巨大。
完成下面两步后,将自动完成登录并继续当前操作。