本文评估了大型语言模型(LLMs)在代码生成和调试方面的能力,提出了多个基准(如DevEval和DebugBench)。研究表明,LLMs在调试性能上普遍较差,调试复杂性与漏洞类别相关。此外,介绍了TaskBench和BIBench等新框架,以评估LLMs在任务自动化和商业智能中的表现,推动其实际应用的发展。
完成下面两步后,将自动完成登录并继续当前操作。