Dex Horthy在第三篇文章中承认此前“无好基准”的判断有误,介绍新基准SlopCodeBench(SCB),通过检查点模拟需求逐步演进。他实测Opus 5、Sonnet 5、Opus 4.8,最强Opus 5严格通过率仅24%,其余仅6%。代码质量指标显示劣化严重,结论是当前模型仍无法无人值守运行,但SCB提供了可追踪的衡量工具。
完成下面两步后,将自动完成登录并继续当前操作。