扩容 Granite 代码模型至 128K 上下文
内容提要
本文介绍了一系列支持高达32,768个令牌的长上下文语言模型(LLMs),通过持续预训练,这些模型在长文本任务上相较于Llama 2取得显著提升。研究表明,适当的数据混合和持续预训练策略能有效扩展上下文长度至128K,并在长上下文理解方面表现优异。实验结果显示,商业模型在短依赖任务上优于开源模型,但在长依赖任务上仍面临挑战。
延伸解读
长上下文扩展的高效路径
文章指出,长上下文持续预训练比从头开始的长序列预训练更高效且同样有效。仅需5亿到50亿个标记的数据进行持续预训练,就能将模型上下文扩展到128K,并保持强大性能。这为资源有限的研究者提供了一种经济可行的策略,避免了重新训练的高昂成本。
数据质量的关键作用
研究强调,在持续预训练中,数据混合的“质量”至关重要。简单上采样特定领域(如书籍)的长数据会导致次优性能,而平衡的领域混合才是关键。这意味着,扩展上下文长度时,不应只关注长文本的数量,而应注重数据的多样性和平衡性。
商业模型与开源模型的差距
通过LongBench等基准评估,商业模型(如GPT-3.5-Turbo-16k)在短依赖任务上优于开源模型,但在长依赖任务上仍面临挑战。这表明,尽管开源模型在长上下文理解上取得进步,但在复杂长依赖任务上,商业模型仍具优势,但并非不可逾越。
位置编码与扩展策略的局限
文章深入分析了Llama的位置编码在建模长依赖性方面的局限性,并指出扩展上下文窗口长度的策略对长上下文理解的影响有限。例如,缩放位置嵌入和微调虽能带来改进,但检索等上下文压缩技术对长上下文能力较弱的模型帮助有限,性能仍落后于强模型。
Q&A
长上下文语言模型的最大上下文长度是多少?
长上下文语言模型的最大上下文长度为128K。
如何通过持续预训练提高长文本任务的性能?
通过持续预训练和适当的数据混合,可以显著提高长文本任务的性能。
商业模型在短依赖任务和长依赖任务上的表现如何?
商业模型在短依赖任务上优于开源模型,但在长依赖任务上仍面临挑战。
扩展上下文长度的策略对长上下文理解的影响如何?
扩展上下文长度的策略对长上下文理解的影响有限。
在长上下文模型中,数据混合的重要性是什么?
数据混合的领域平衡和长度上采样对模型性能至关重要。
如何评估长上下文语言模型的性能?
通过引入LongBench,对多个大型语言模型进行全面评估。