OpenAI翁荔提出大模型「外在幻觉」:万字blog详解抵抗办法、产幻原因和检测方式

💡 原文中文,约9800字,阅读约需24分钟。
📝

内容提要

OpenAI华人科学家翁荔提出了大模型「外在幻觉」问题,讨论了产生幻觉的原因、检测和抵抗方法。幻觉可能与预训练数据集和微调新知识有关,可以通过检索增强评估和基于归因的微调来减少。翁荔负责ChatGPT的开发和模型安全。

🔎

延伸解读

幻觉分类的实践意义

翁荔将幻觉分为上下文内幻觉和外在幻觉,前者指输出与给定上下文不一致,后者指输出不基于预训练知识。这种区分有助于在实际应用中定位问题:如果模型在摘要任务中偏离原文,属于上下文内幻觉;如果在开放问答中编造事实,则属于外在幻觉。针对不同类型,缓解策略的侧重点也不同,例如上下文内幻觉可通过改进注意力机制或约束解码来缓解,而外在幻觉则需要检索增强或事实性微调。

微调新知识的风险

文章引用Gekhman等人的研究指出,用新知识微调模型时,模型学习新知识的速度慢于已有知识,且一旦学会新知识,产生幻觉的倾向会增加。这意味着在实际业务中,如果频繁用最新信息微调模型,可能会损害其事实性。因此,对于需要更新知识的场景,检索增强生成(RAG)可能是更安全的选择,因为它将知识放在上下文中,而不是试图将新知识蒸馏到模型参数中。

检测方法的选择与权衡

文章介绍了多种幻觉检测方法,包括基于检索的评估(如FactualityPrompt、FActScore、SAFE)和基于采样的检测(如SelfCheckGPT)。基于检索的方法通常需要外部知识库,但能提供更准确的事实性判断;基于采样的方法仅需黑盒访问,成本较低,但可能受模型随机性影响。在实际应用中,可根据资源和对准确性的要求选择合适的方法。例如,对于高风险的医疗或法律领域,建议采用基于检索的评估;对于一般对话系统,基于采样的检测可能足够。

抵抗幻觉的实用策略

文章总结了多种抵抗幻觉的方法,包括检索增强生成(RAG)、特殊采样方法(如ITI)、对齐微调(如FLAME)以及动作链验证(如CoVe)。这些方法各有适用场景:RAG适合需要外部知识的任务;ITI通过干预注意力头提升事实性,但需要模型内部访问;CoVe通过自我验证减少幻觉,但可能增加计算开销。实践中,可以组合使用这些方法,例如先通过RAG提供基础,再用CoVe进行验证,以平衡效果与成本。

❓

Q&A

大模型的外在幻觉是什么?

外在幻觉是指模型输出的内容不基于预训练数据集,而是虚构的内容。

幻觉产生的主要原因有哪些?

幻觉产生的原因包括预训练数据集中的过时或错误信息,以及微调新知识的影响。

如何检测大模型的幻觉现象?

幻觉检测方法包括检索增强评估和基于采样的检测,使用维基百科作为事实性基础。

有哪些方法可以抵抗大模型的幻觉?

抵抗幻觉的方法包括检索外部知识、特殊采样方法和对齐微调。

翁荔在OpenAI的角色是什么?

翁荔是OpenAI的华人科学家,负责人工智能应用研究,参与ChatGPT的开发和模型安全。

上下文内幻觉与外在幻觉有什么区别?

上下文内幻觉是模型输出与上下文不一致,而外在幻觉是模型输出不基于预训练数据集。

🏷️

标签

➡️

继续阅读