DeepSeek 开源高性能 TopK 算子库 DeepSelect,针对稀疏注意力中的闪电索引器和采样器两个场景优化,速度可达 torch.topk 的 2 至 20 倍。该库不绑定推理框架,可通过 pip 直接替换,结果稳定,并支持关闭排序和返回值以进一步提速,助力 V4.1 Flash 推理大幅加速。
本文通过邻接矩阵统一理解Sparse Transformer、Longformer和BigBird三种固定稀疏注意力模式,分析其图论依据、工程代价及生产落地难点。文章指出稀疏注意力未取代全注意力,原因在于kernel生态、训练配方和任务敏感性限制,并讨论学习型稀疏的争论与开放问题。
大模型推理中的路由问题促使稀疏注意力机制的出现。路由的挑战在于平衡负载均衡与缓存感知,避免资源浪费。稀疏注意力通过减少KV块数量来缓解这一问题,但仍面临决策困难。Goodfire的研究提出了通过“知识指针”解决路由问题的新思路。总体而言,路由问题是分布式系统中的长期挑战。
美团LongCat-2.0正式开源,参数达到1.6T,采用动态激活和稀疏注意力技术,提升长上下文处理效率。开源的国产卡推理代码具有工程价值,解决了部署链路问题。建议团队在低风险环境中测试,以确保模型的稳定性和可控性,避免潜在风险。
稀宇科技推出的MiniMax-M3模型支持1M窗口,具备文本、图像和视频输入能力。基准测试显示其在编码任务上超越GPT-5.5和Gemini 3.1 Pro,接近Claude Opus 4.7。M3采用自研的稀疏注意力架构MSA,显著降低计算成本,未来将发布开源权重模型,强调长期协作和自主迭代能力。
北京大学团队提出的新稀疏注意力机制HISA,速度提升2-4倍,几乎不损失精度。该机制通过块级粗过滤和块内精挑字符,降低索引器成本,适应超长文本需求,工程友好性强。测试结果显示HISA在速度和精度上表现优异,未来可进一步优化块特征计算和训练方式。
美团龙猫LongCat推出新稀疏注意力机制LoZA,解码速度提升10倍,支持处理1M长文本。通过优化模型结构,降低计算复杂度,提高效率,同时保持稳定性能。该技术在长文本任务中优于同类模型,未来将支持动态稀疏比例,以适应不同场景需求。
DeepSeek发布了DeepSeek-V3.2开源AI模型,性能超过GPT-5,采用稀疏注意力机制和强化学习等新技术。尽管表现优异,但在知识广度和复杂任务解决上仍不及封闭模型,未来将致力于优化模型效率和知识积累。
DeepSeek V3.2 通过引入“系统 2”推理机制,重构了大型语言模型的解码策略,强调实时计算和思维链生成。其核心技术包括稀疏注意力机制和强化学习,提升了模型在复杂任务中的表现,标志着人工智能向理性智能体的演进。
DeepSeek 的闪电索引器通过计算索引分数提高模型效率,解决了全书阅读的 $O(L^2)$ 复杂度问题。它筛选出与当前查询相关的 Top-k token,将注意力复杂度降低到 $O(L k)$,显著提升计算效率。
九章云极推出DeepSeek-V3.2-Exp模型,采用稀疏注意力架构,降低计算复杂度,提升推理性能。该模型支持一键私有化部署,确保企业数据安全与合规。Alaya NeW智算云平台提供高性能计算资源,满足多场景需求,推动AI应用普及。
DeepSeek-V3.2-Exp模型现已支持,采用稀疏注意力机制,适用于长文本任务。vLLM集成了新的CUDA内核,优化了性能,用户可通过特定指令进行部署和测试,未来将扩展对更多硬件的支持。
本文介绍了一种新型极简激活超级大脑模型,参数总数为142B,动态激活为14B,训练成本仅为Qwen2.5-72B的1/4。该模型在中文理解、数学推理和代码生成等任务中表现优异,并开源了训练过程,强调数据质量和系统创新的重要性。未来将探索稀疏注意力和模拟人类学习效率。
清华大学与面壁智能团队推出的MiniCPM 4模型,提供0.5B和8B参数规模,训练开销仅为22%。该模型在长文本处理上实现5倍加速,采用稀疏注意力架构,性能超越多款同类模型,适合端侧设备,具备高效推理能力。
本研究提出广义邻域注意力(GNA)模型,以提高稀疏注意力机制的速度。通过在NVIDIA Blackwell架构上实现,GNA在多个生成模型中验证了28%至46%的速度提升,有效解决了注意力机制的O(n^2)复杂性问题。
清华大学陈键飞团队提出的稀疏注意力机制SpargeAttn,无需训练即可加速多种模型,推理速度提升4-7倍,同时保持端到端精度,有效解决长序列任务的计算瓶颈。
本研究提出了XAttention框架,旨在解决长上下文变换器模型的计算成本问题。通过稀疏注意力加速推理,利用反对角值之和作为块重要性代理,实现高效的块识别与剪枝,最终实现高达13.5倍的计算加速。
清华大学等机构提出APB框架,利用稀疏注意力机制显著提升长文本推理效率,速度比传统方法快10倍,有效解决长距离语义依赖问题,适用于大模型服务。
华为诺亚方舟实验室发布的新ESA算法通过稀疏注意力设计,突破了大模型在长文本处理中的瓶颈,显著提升了计算效率和性能。ESA通过低维压缩和动态选择关键token,降低了计算复杂度,适用于长序列任务,实验结果显示其在多项基准测试中优于传统方法。
Qwen2.5-1M模型正式发布,支持1M上下文长度,包含两个新开源模型。推理框架速度提升3-7倍,长文本任务表现优于128K版本,短文本任务性能保持稳定。模型采用稀疏注意力和长度外推技术,优化推理效率,未来将继续提升性能和应用范围。
完成下面两步后,将自动完成登录并继续当前操作。