本文介绍状态空间模型(SSM)如何通过固定大小状态压缩历史,解决Transformer长序列瓶颈。S4用HiPPO矩阵实现长程记忆,Mamba引入选择性机制按内容更新状态,并用并行扫描保持训练效率。推理时SSM显存O(1)优于KV Cache,但在精确检索任务上受容量限制。SSD揭示SSM与注意力对偶,混合架构如Jamba平衡两者优势。
本文讨论了策略梯度方法在语言模型训练中的应用,重点介绍了REINFORCE算法。通过log-derivative技巧,策略梯度能够优化期望回报,而无需对不可微奖励求导。文章还分析了高方差问题及其在长序列和稀疏奖励中的影响,并介绍了RLOO等现代改进方法,以降低方差并提高训练稳定性。
DeepSeek-V3.2-Exp模型已在华为云上线,采用稀疏Attention架构,提升推理效率,降低资源消耗,支持160K长序列,适合企业和开发者使用。
Mamba探讨了状态空间模型(SSMs)与Transformer的优劣,指出Attention并非万能,SSMs在处理长序列信息时更具优势。Mamba在同规模下超越Transformer,强调混合模型的潜力,未来可能结合两者优势开发新架构。
本文介绍了SMUGGLER,一种新型层次神经网络架构,计算复杂度为O(n log n),能高效处理长序列。该模型通过字节级预测,消除了嵌入表和注意力瓶颈,显著降低内存需求,适用于消费级硬件,性能与更多参数的模型相当。
清华大学陈键飞团队提出的稀疏注意力机制SpargeAttn,无需训练即可加速多种模型,推理速度提升4-7倍,同时保持端到端精度,有效解决长序列任务的计算瓶颈。
本研究提出了ATTENTION2D方法,旨在解决传统自注意力机制在处理长序列时的计算和内存成本问题。该方法通过查询与键/值维度的并行性,实现了高效的分布与并行化,实验结果显示训练和推理速度提升了5至9.4倍。
DeepSeek 开源的 FlashMLA 是针对 Hopper GPU 优化的高效 MLA 解码内核,支持变长序列处理,提升 LLM 推理效率。它借鉴了 FlashAttention 和 cutlass,采用低秩分解等技术,显著降低内存和计算需求,适合长序列和实时应用。FlashMLA 的开源将惠及更多开发者,推动 AI 创业。
LServe是一项创新技术,旨在提高长序列语言模型的处理效率。它通过混合稀疏注意机制,解决计算复杂性和内存问题,显著提升速度和准确性。LServe在金融和医疗等行业具有广泛应用,能够快速分析大量数据,优化工作流程。
本研究提出LServe系统,旨在解决长序列大型语言模型在预填充和解码阶段的计算复杂度和内存占用问题。通过混合稀疏注意力,该系统使预填充速度提升近2.9倍,解码速度提升1.3-2.1倍,同时保持长序列的精度。
本研究提出LASP-2序列并行方法,优化线性注意力的右乘特性,显著提升长序列训练的通信和计算并行性,训练速度比LASP快15.2%,比环形注意力快36.6%。
本文探讨了传统Softmax注意力在推理令牌长度增加时的数值不稳定和性能下降问题。提出了一种新颖的Softplus注意力机制,结合动态长度尺度因子和重新加权,显著提升了大型语言模型在处理长序列时的稳定性和性能。
本研究提出了TreeKV,一种直观且无需训练的键值缓存压缩方法,旨在解决长序列和资源有限环境中的信息保留问题。TreeKV通过树结构实现平滑缓存压缩,在语言建模任务中表现优异,相比基线模型在长上下文中显著提升性能,最佳效率仅需6%的预算。
本研究首次全面评估RWKV模型,填补了系统性综述的空白。RWKV通过独特的递归框架有效处理长序列,降低计算成本,展现出优越性能,并指出未来研究方向。
本研究提出了一种高效的Perceiver基架构(Long LoRA Perceiver - LLP),旨在解决Transformer在长序列处理中的复杂度问题。通过引入三种结构增强,该架构在自回归建模中实现了高性能与计算效率的平衡,实验结果表明其在多个基准测试中超越了最新的Transformer模型。
InfiniDreamer是一个新框架,解决了现有运动生成方法只能生成短序列的问题。它通过生成与文本描述对应的子运动,并利用片段评分蒸馏(SSD)优化长序列,从而能够生成一致且具上下文意识的任意长度运动序列。实验结果表明,该方法优于现有技术。
Qwen2.5-Turbo新版本支持1M tokens的上下文,显著提升了处理长序列的能力,准确率达到100%。推理速度提高4.3倍,价格保持不变。该模型在长文本任务中表现优异,超越GPT-4,短文本任务性能也未受影响。未来将继续优化长序列处理能力。
Reformer模型通过局部敏感哈希注意力和可逆层显著降低了内存和计算成本,同时保持高准确性,适用于长序列的语言建模、文档分析和基因组学等任务,提升了计算效率和可扩展性。
Mamba是一种基于选择性状态空间模型的架构,旨在解决Transformer在推理中的计算复杂性问题。Mamba在处理长序列时表现优异,推断速度比Transformer快5倍,并在多个任务上实现了先进性能,特别是在长上下文理解能力上有所提升,展现出作为高效替代品的潜力。
北京大学的林宙辰和徐鑫提出了MixCon,一种新型混合序列建模架构,结合Transformer层、Conba层和MoE组件,提升了计算和内存效率。实验显示,MixCon在长序列处理上优于现有模型,并在多个基准测试中表现出色。未来仍有改进空间。
完成下面两步后,将自动完成登录并继续当前操作。