从HumanEval到CoderEval: 你的代码生成模型真的work吗?
原文中文,约6600字,阅读约需16分钟。
📝
内容提要
华为云软件分析Lab介绍了CoderEval评估基准,用于评估代码生成模型。CoderEval基于真实开源项目构建,分级评估模型在不同上下文中的表现。实验结果显示,模型在自包含函数生成上表现较好,但依赖上下文信息的任务表现有待提升。CoderEval论文已发表在ICSE 2024,项目已开源。
🏷️