大模型上下文长度的超强扩展:从LongLoRA到LongQLoRA(含源码剖析)

💡 原文中文,约6000字,阅读约需15分钟。
📝

内容提要

本文介绍了LongLora和LongQLora两种长文本处理技术,分别通过稀疏局部注意力和低秩矩阵自注意力机制来扩展模型上下文和减少可训练参数数量。这些技术在长文本处理方面表现出良好效果。

🏷️

标签

➡️

继续阅读