NoFunEval: 搞笑的事实上代码语言模型在功能正确性以外的要求上遭遇困难

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

研究通过L2CEval系统评估了大型语言模型在语言到代码生成方面的能力,并分析了影响性能的因素。同时,还对模型的置信度校准情况和输出的程序进行了评估。该研究提供了对模型能力和限制的全面了解,并发布了评估框架和模型输出,为未来研究奠定基础。

🏷️

标签

➡️

继续阅读