大型语言模型作为评估者的认知偏差基准测试

💡 原文中文,约600字,阅读约需2分钟。
📝

内容提要

研究发现,语言模型在文本质量评估中存在偏见,不适合作为评估器。机器偏好与人类不一致,因此LLMs可能不能用于自动注释。

🏷️

标签

➡️

继续阅读