从HumanEval到CoderEval: 你的代码生成模型真的work吗?

💡 原文中文,约5900字,阅读约需14分钟。
📝

内容提要

本文介绍了一个名为CoderEval的代码生成大模型评估基准,对三个代码生成模型在该基准上的表现进行了评估和比较。实验结果表明,这三个模型在生成自包含函数方面的效果明显优于其他任务,但实际项目中的函数大部分依赖不同程度的上下文信息,因此提高模型对上下文信息的考虑和利用能力对于代码生成技术的实际可用性非常重要。该工作由北京大学和华为云Paas技术创新LAB合作完成,论文已被软件工程顶会ICSE 2024录用。

🏷️

标签

➡️

继续阅读