生成的社会偏见基准:生成和基于QA评估的比较

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本文提出了一种新的生成偏见基准(BBG),用于评估十种大型语言模型在故事提示生成中的中立性与偏见生成概率,指出现有评估方法的局限性。

🏷️

标签

➡️

继续阅读