超越对齐:针对大型语言模型的原子偏好增强的真实性调整
内容提要
本文探讨了提升大型语言模型事实准确性的方法,包括无监督微调、事实增强训练和自动偏好优化(APO)框架。研究表明,通过优化算法和自我评估,模型生成文本的准确性显著提高。同时,提出了FActScore评估生成文本真实性的新方法,发现当前模型在检测事实错误方面仍存在不足。整体目标是提升语言模型的可靠性和准确性。
延伸解读
事实性提升的多路径探索
文章汇总了多种提升大语言模型事实准确性的方法,包括无监督微调、事实增强训练和自动偏好优化(APO)。这些方法从不同角度切入:有的利用外部知识库一致性,有的依赖模型置信度,有的通过直接优化算法。值得注意的是,这些方法均试图减少对人工标注的依赖,并已在准确性上超越传统的RLHF和解码策略。
引用机制与APO框架的突破
针对现有引用方法忽视人类学术写作中引用机制的问题,文章提出将归因任务建模为偏好学习,并引入自动偏好优化(APO)框架。APO通过自动合成偏好数据(95263对)和渐进式偏好优化,在ASQA、StrategyQA和ELI5数据集上取得了最先进的引文F1指标,同时提升了回答质量。这为增强模型可信度提供了新思路。
评估方法的演进与局限
文章介绍了FActScore和SAFE两种评估方法。FActScore将生成文本分解为原子事实,计算支持比例,但发现ChatGPT精度仅58%。SAFE利用LLM代理进行多步推理评估,在16k事实集上达到超人类评级性能,与人类标注者一致率达72%,且成本低20倍。然而,当前模型在检测事实错误方面仍远未令人满意,这提示评估方法本身也需持续改进。
模型规模与指令调整的影响
文章提及一项评估大型语言模型事实记忆能力的研究,发现指令调整对知识召回有负面影响,而模型规模对性能有正面影响。此外,反事实演示会降低大模型的事实知识召回。这些发现提醒我们,在追求事实准确性时,需权衡指令遵循能力与知识召回,并注意演示示例可能带来的反效果。
Q&A
如何提高大型语言模型的事实准确性?
可以通过无监督微调、事实增强训练和自动偏好优化(APO)框架来提高大型语言模型的事实准确性。
FActScore评估方法是如何工作的?
FActScore通过将生成文本分解为原子事实,计算支持的原子事实百分比,以评估生成文本的真实性。
自动偏好优化(APO)框架的主要优势是什么?
APO框架解决了引用机制的挑战,并在多个数据集上取得了先进的引文F1指标,提升了回答质量。
当前语言模型在检测事实错误方面存在哪些不足?
当前模型在忠实检测事实错误方面表现不佳,准确率仅为58%。
SAFE方法的主要功能是什么?
SAFE方法利用LLM代理评估长篇回复的事实准确性,通过多步推理过程来验证每个事实的支持情况。
大型语言模型在生成文本时面临哪些挑战?
大型语言模型在生成文本时常常产生不可靠内容,尤其是在开放式主题的事实查询中。