L2CEval: 评估大型语言模型的语言到代码生成能力

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

本研究评估了大型语言模型在语言到代码生成方面的能力,分析了影响性能的因素,并衡量了模型的置信度校准情况。研究结果提供了对LLMs在语言到代码生成方面能力和限制的全面了解,并发布了评估框架和所有模型输出。

🏷️

标签

➡️

继续阅读