LongCite:使长文本问答中的大语言模型生成细粒度引用
内容提要
这项研究介绍了ALCE基准,用于评估大型语言模型(LLMs)在流畅度、正确性和引用质量方面的表现。研究发现,商业模型在短任务上优于开源模型,但在长依赖任务中表现不佳。提出了细粒度奖励训练框架和Ada-LEval基准,以评估LLMs在长上下文理解中的能力,结果显示当前模型在复杂推理任务中表现欠佳。此外,推出了Citekit工具包,旨在提高引用生成的质量和准确性。
延伸解读
长文本问答的评估基准演进
文章梳理了从2023年5月到2024年8月多个基准的提出,包括ALCE、LooGLE、Ada-LEval、BABILong、Loong和NeedleBench。这些基准从不同角度评估LLM的长文本能力,如引用质量、长依赖任务、上下文长度适应性和复杂推理。读者可以从中看到评估体系正逐步细化,覆盖更现实和复杂的场景。
商业与开源模型的长短任务差异
基于LooGLE的评估显示,商业模型在短依赖任务上优于开源模型,但在长依赖任务中表现不佳。这提示读者,模型在短问答中可能受益于检索式技术,而单纯扩展上下文窗口对长上下文理解帮助有限。选择模型时需根据任务类型权衡。
细粒度奖励提升引用生成
文章提出一种细粒度奖励训练框架,用于教LLM生成高度支持和相关的引用,并确保回答正确性。在LLaMA-2-7B上应用后,模型在ALCE和EXPERTQA上取得最佳性能,甚至超过GPT-3.5-turbo。这表明针对性训练可以显著提升开源模型的引用能力。
长上下文利用效率的局限
BABILong基准测试表明,当前流行模型仅有效利用上下文的10-20%,复杂推理任务性能急剧下降。检索增强生成能以最高60%准确率回答单个事实问题,且与上下文长度无关;循环记忆变压器可处理长达1100万标记。这些发现揭示了长上下文处理的瓶颈和潜在改进方向。
Q&A
ALCE基准的主要功能是什么?
ALCE基准用于自动化评估大型语言模型在流畅度、正确性和引用质量方面的表现。
商业模型与开源模型在短任务和长任务中的表现有何不同?
研究发现商业模型在短依赖任务上优于开源模型,但在长依赖任务中表现不佳。
细粒度奖励训练框架的目的是什么?
细粒度奖励训练框架旨在提高大型语言模型生成引用的相关性和正确性。
Ada-LEval基准测试的作用是什么?
Ada-LEval基准测试用于评估大型语言模型在长上下文理解能力上的局限性。
Citekit工具包的主要功能是什么?
Citekit工具包旨在提升引用生成的质量和准确性,简化现有引用生成方法的实施与评估。
BABILong基准测试的评估结果显示了什么?
BABILong基准测试表明当前模型在处理长上下文时效率低下,仅有效利用上下文的10-20%。