AI最强编程代理失败率高达60%——数据为证

AI最强编程代理失败率高达60%——数据为证

💡 原文英文,约700词,阅读约需3分钟。
📝

内容提要

Real-SWE基准测试将AI编程代理置于真实企业私有代码库中,结果显示其表现大幅下降。Claude Fable 5.1以38.8%的成功率领先,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。十个任务中有六个成功率低于15%,且无模型能解决分析流缩减器。失败主因是遗漏需求和集成错误,表明解决编程题与应对陌生生产代码库差异巨大。

🔎

延伸解读

私有代码库测试为何更严苛

Real-SWE基准测试使用企业私有代码库,这些代码未公开,降低了模型在训练数据中见过的可能性。Specific Labs估计,企业真实场景中99%的token对前沿模型不可见。因此,测试结果更接近工程师日常面对陌生生产代码的挑战,而非公开题库的刷题表现。

失败模式揭示核心短板

文章指出,失败主因是遗漏需求和集成错误。Fable 5.1有36.7%的失败源于遗漏需求,34.7%源于集成错误;Astra的失败则平均分给集成错误和未验证假设。这表明模型在理解完整需求、正确集成到现有系统方面仍有明显不足。

任务复杂度与表现差异

Real-SWE任务涉及中位数11个文件,几乎是FrontierCode等基准(6个文件)的两倍。十个任务中六个成功率低于15%,且无模型解决分析流缩减器。但部分模型在多区域扫描任务上表现优异,说明能力因任务类型而异,并非全面失败。

结果解读需注意的局限

文章提醒,Real-SWE不能证明公开基准因数据污染而虚高,且仅10个任务样本较小。此外,每个模型搭配自家编码工具测试,分数反映整体配置而非纯模型能力。更换脚手架(如Fable 5.1在Cursor中)可能产生不同结果。

Q&A

Real-SWE基准测试是什么?它和传统编程测试有什么不同?

Real-SWE是由Y Combinator支持的Specific Labs推出的编程代理基准测试。它不使用公开仓库中的问题,而是将AI代理放入真实企业的私有代码库中,让它们解决工程师日常面对的问题。代码和解决方案不公开,因此更不可能出现在模型的训练数据中。Specific Labs估计,现实企业中99%的token对前沿模型是隐藏的。

在Real-SWE测试中,各AI编程代理的成功率分别是多少?

Claude Fable 5.1以38.8%领先,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。之后GLM 5.3为28.8%,Grok 4.6和Muse Spark 1.3并列23.8%,Kimi K3为18.8%,GPT-5.6 Sol为16.2%。每个模型对每个任务有8次尝试机会。

为什么AI编程代理在真实企业代码库中失败率这么高?

失败主因是遗漏需求和集成错误。Fable 5.1最常遗漏需求(36.7%)或遇到集成错误(34.7%)。Astra的失败在集成错误和未经验证的假设之间平分,各占34%。Gemini 3.8 Flash近一半的失败运行中出现集成错误,而GPT-5.6 Sol在43.3%的失败中做出了未经验证的假设。

Real-SWE测试中哪些任务特别难,甚至没有模型能解决?

十个任务中有六个成功率低于15%。例如,账单计划迁移修复率为14.1%,API令牌计量为12.5%,S3存储跟踪为10.9%,线性化扫描为4.7%,税务管辖区错误仅3.1%。没有任何模型在64次尝试中解决分析流缩减器。

Real-SWE测试使用了哪些真实企业的代码库?

Real-SWE使用从真实企业授权的专有代码,包括一个拥有超过20万用户的消费产品和一个处理了超过10万份银行对账单的金融科技平台。解决方案平均触及11个文件,几乎是FrontierCode和DeepSWE等基准中6个文件中位数的两倍。

Real-SWE的结果是否证明公开编程基准被数据污染夸大了?

文章指出,Real-SWE并不能证明公开编程基准被数据污染夸大了,而且10个任务仍然是小样本。但表现最好的代理在可能未见过的私有代码上仍然失败了超过60%,这表明解决编程问题与在陌生的生产代码库中导航非常不同。

🏷️

标签

➡️

继续阅读