大型语言模型的免训练长篇背景文本扩展
内容提要
本文综述长上下文大语言模型研究,重点包括:通过持续预训练将上下文窗口扩展至32K乃至128K,并结合数据混合与长度上采样;评估显示模型在长上下文任务上显著优于Llama 2,70B变体超越gpt-3.5-turbo-16k;探讨位置编码外推、LongLoRA高效微调、LongAgent多智能体协作及Parallel Context Windows等方法;验证长上下文持续预训练比从头训练更高效。
延伸解读
长上下文扩展的实用路径
文章指出,通过持续预训练将上下文窗口从4K扩展到128K是可行且高效的。具体而言,使用5亿到50亿个标记进行轻量级持续预训练,就能让模型检索128K上下文中的任意信息。这比从头训练长序列模型更经济,且效果相当。对于希望提升模型长文本处理能力的团队,这提供了一条低成本的实践路径。
数据质量比长度堆砌更重要
在持续预训练中,简单上采样书籍等特定领域的长文本会导致次优性能,而平衡的领域混合才是关键。文章强调,预训练数据集中有大量长文本并非达到强性能的必要条件。这意味着,在扩展上下文时,应注重数据的多样性和平衡性,而非单纯增加长文本的数量。
位置编码外推的局限与改进
文章深入分析了Llama位置编码在建模长依赖时的局限性,并探讨了多种外推方法。其中,线性标度被证明是扩展上下文长度的最佳方法,且在评估时使用更长的标度能获得进一步收益。此外,截断策略也展现出有希望的推测能力。这些发现为改进位置编码提供了具体方向。
多智能体协作扩展上下文
LongAgent通过多智能体协作将LLaMA的上下文窗口扩展到128K,并在长文本检索和多跳问答等任务上,使用LLaMA-7B实例化的智能体团队取得了显著优于GPT-4的表现。该方法中,领导者理解用户意图并指导团队成员获取信息,同时通过信息共享机制解决幻觉引起的冲突。这为长文本处理提供了新思路。
Q&A
长上下文大语言模型通常如何将上下文窗口扩展到32K甚至128K?
通常采用持续预训练方法,从Llama 2等基础模型开始,使用更长的训练序列和上采样长文本的数据集进行训练,从而将上下文窗口扩展至32K或128K。
长上下文模型在评估中相比Llama 2和GPT-3.5有什么优势?
在长上下文任务上显著优于Llama 2,70B变体在长上下文任务中的整体性能超过了gpt-3.5-turbo-16k。
有哪些高效微调或无需训练的方法可以扩展大语言模型的上下文长度?
包括LongLoRA高效微调、LongAgent多智能体协作、Parallel Context Windows、LongHeads无需训练框架以及Focused Transformer等技术。
长上下文持续预训练与从头开始的长序列预训练相比,效率如何?
长上下文持续预训练比从头开始的长序列预训练更高效且同样有效。
在持续预训练中,数据混合和长度上采样对性能有什么影响?
平衡的领域混合很重要,简单上采样特定领域(如书籍)的长数据会导致次优性能;长度上采样是必要的,但需注意领域平衡。
扩展上下文长度时,位置编码外推有哪些方法和发现?
线性标度是扩展上下文长度的最佳方法,在评估时使用更长的标度可以获得进一步收益;截断策略修改位置编码基础也显示出有希望的推测能力。