论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从真实PR评论提取约束测试,并评测四个模型,其中最强模型GPT-5.5的失败率仍达29.5%。显式约束提示虽能提升合规性,但可能削弱修复能力,强调需关注产物的可合入性。
完成下面两步后,将自动完成登录并继续当前操作。