大型语言模型是否可靠的评判者?一个关于 LLM 事实性评估能力的研究

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

研究发现大型语言模型常出现“幻觉”,需要事实验证器。FLAN-T5-11B在维基百科领域表现最佳。大型语言模型对高质量证据依赖,鲁棒性和泛化能力不足。

🏷️

标签

➡️

继续阅读