基于 LLM 的评估者是否混淆了 NLG 质量标准?

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文提出了一种新框架,用于评估语言模型和人类评判者的偏见。结果显示人类和语言模型评判者都容易受到扰动,并存在偏见。作者呼吁社区意识到评估系统的脆弱性,并开发健壮的评估系统。

🏷️

标签

➡️

继续阅读