SaGE:大型语言模型中的道德一致性评估

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

大型语言模型在道德场景中一致性不足。研究提出语义图熵等度量,通过经验法则提升与人类判断的相关性;调查显示模型在明确道德情境多与常识一致,模糊情境则常表不确定且易受提问方式影响。另有研究用多阶段框架提升问答可靠性,并提出假设与组合一致性等概念,发现模型面对质疑时判断一致性显著下降。

🔎

延伸解读

道德一致性评估的度量创新

文章提出语义图熵(SGE)作为新的信息熵测量方法,通过模型决策策略解释的“经验法则”(RoTs),使度量与人类判断更好地相关。这为评估LLM道德一致性提供了量化工具,并计划研究不一致性的根本原因。

明确与模糊情境下的模型表现差异

大规模调查涵盖680个道德情景和687个明确道德情景,测试28个模型。结果显示,明确情境中多数模型选择与常识一致的行动;模糊情境中多数模型表达不确定性,且对提问方式敏感,部分模型反映明确偏好,闭源模型间一致性较高。

质疑对判断一致性的影响

研究提出“跟进质问机制”及评估指标,对ChatGPT、PaLM2-Bison和Vicuna-13B测试发现,即使初始答案正确,面临质疑、否定或误导时,判断一致性大幅降低。提示语气影响一致性,但几种提示方法可缓解该问题。

多步推理中的自我一致性挑战

文章引入假设一致性和组合一致性概念,并演示GPT-3在维基百科、日常对话、算术和地理查询任务中表现不佳。在整数序列填充任务中,OpenAI模型平均一致性介于67%和82%,随能力提高而增加,但自我一致性标定性不良,常对潜在答案分配显著权重。

❓

Q&A

大型语言模型在道德场景中的一致性表现如何?

在明确道德情境中,大多数模型选择与常识一致的行动;在模棱两可情境中,大多数模型表达不确定性,且部分模型对提问方式敏感,一些模型在模糊情境中反映明确偏好,闭源模型之间一致性较高。

什么是语义图熵(SGE)?它有什么作用?

语义图熵(SGE)是一种新的信息熵测量方法,用于评估大型语言模型在道德场景中的不一致性。通过使用模型决策策略解释的“经验法则”(RoTs),该度量与人类判断更好地相关,并计划研究和改进LLM不一致性的根本原因。

有哪些方法可以提升大型语言模型在问答中的可靠性?

提出了一个多阶段框架,通过生成合理的依据并验证修正错误,将其作为支持参考生成答案,提高了GPT-3.5-turbo在生命科学行业药物相关查询中的响应质量,使答案更可靠和准确。此外,通过引入语义一致性的综合度量和问询策略,提高了开放式文本生成和闭卷问题回答的性能。

大型语言模型在面对质疑时判断一致性如何?

利用教育中的质问策略,提出“跟进质问机制”及两个评估指标,对ChatGPT、PaLM2-Bison和Vicuna-13B进行评估。实证结果表明,即使初始答案正确,当模型面临质疑、否定或误导等干扰时,判断一致性会大幅降低。

大型语言模型在多步推理中的自我一致性表现如何?

研究提出假设一致性和组合一致性两个概念,并演示了GPT-3模型在维基百科、日常对话、算术和地理查询任务中表现不佳。

如何评估大型语言模型的语义一致性?

通过手动创建高质量的事实问答近义词语料库,并结合其他相关度量标准,构建和评估一个用于事实问答参考无关性能预测的框架。对五个现代LLMs进行评估,结果显著超越基线。此外,提出了一种衡量语义一致性的度量标准,在TruthfulQA数据集上评估多个PLMs,发现比传统词汇一致性度量更可靠,与人类评估更相关。

🏷️

标签

➡️

继续阅读