无黄金标准评估大型语言模型判断力的基准研究

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文提出了一种新评估指标GEM,用于评估大型语言模型生成信息性判断的表现。GEM通过估计候选回答与参考回答之间的互信息,实验证明其在与人类评分的相关性上优于现有方法,并在操控情况下表现出更强的鲁棒性。

🏷️

标签

➡️

继续阅读