墨芯人工智能成立稀疏计算产学研联盟,旨在推动稀疏计算产业化,应对AI算力需求激增。联盟聚焦能效提升、研发转化和生态建设,联合高校与企业,攻克技术门槛高、生态难等挑战,使稀疏计算成为AI算力基础设施的关键支撑。
本文通过邻接矩阵统一理解Sparse Transformer、Longformer和BigBird三种固定稀疏注意力模式,分析其图论依据、工程代价及生产落地难点。文章指出稀疏注意力未取代全注意力,原因在于kernel生态、训练配方和任务敏感性限制,并讨论学习型稀疏的争论与开放问题。
pgEdge ColdFront新增混合搜索功能,在PostgreSQL内结合密集向量与BM25稀疏向量,通过RRF融合结果。支持精确术语匹配和概念查询,可调p_alpha平衡权重。在pgEdge集群中,嵌入自动复制,实现高可用搜索,降低存储成本。
本文介绍CalibAtt,一种无需训练的加速文本到视频生成方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算。实验表明,在Wan 2.1等模型上,CalibAtt可提升端到端速度达1.58倍,同时保持视频质量和文本对齐。
大模型推理中的路由问题促使稀疏注意力机制的出现。路由的挑战在于平衡负载均衡与缓存感知,避免资源浪费。稀疏注意力通过减少KV块数量来缓解这一问题,但仍面临决策困难。Goodfire的研究提出了通过“知识指针”解决路由问题的新思路。总体而言,路由问题是分布式系统中的长期挑战。
本文讨论了稀疏嵌入在电子商务搜索中的优势,特别是相较于BM25的29%提升。稀疏嵌入通过保留单个词汇的信号,解决了密集嵌入模糊匹配的问题,确保了精确匹配。SPLADE模型通过学习相关词汇扩展查询,提升了搜索结果的准确性。后续文章将详细介绍训练和评估过程。
本文探讨了电子商务搜索中的稀疏嵌入微调,分析了专业化与泛化的权衡。研究表明,专注于特定领域的微调在单一零售商中效果最佳,而多领域训练则在多个零售商中更具泛化能力。微调模型能够更好地理解特定领域的搜索模式和词汇,从而提升搜索效果。
本文讨论了电子商务搜索中的稀疏嵌入微调,重点评估了SPLADE模型及其困难负样本挖掘。经过微调的SPLADE模型在nDCG@10指标上比BM25提高了28%,强调了领域特定训练的重要性。文章还分析了稀疏与密集向量的混合搜索效果,以及困难负样本挖掘(ANCE)对模型性能的提升。总体而言,微调显著改善了查询扩展、术语加权和电商词汇的表现。
本文讨论了在电子商务搜索中微调稀疏嵌入的方法,重点介绍了使用亚马逊ESCI数据集训练SPLADE模型的过程。强调了数据格式化的重要性,以及通过SpladeLoss实现对比学习与稀疏性正则化的平衡。此外,使用Modal的持久存储解决了检查点管理问题,确保了训练过程的稳定性。
本文介绍了如何使用qdrant-sparse-finetune工具化稀疏嵌入微调,以改善电子商务搜索。该工具简化了数据处理、模型训练和评估流程,支持自动化操作,提升用户体验。最终,用户可将模型快速发布到HuggingFace,实现28%的性能提升。
小米MiMo团队推出HySparse混合稀疏注意力架构,显著降低KV Cache的存储和计算开销,提升超长上下文建模效率。通过将“选择”和“缓存”交给Full Attention层,HySparse实现了高效的长距离信息访问,实验结果显示其在多项任务中表现优异。
VidBee 是一款开源视频下载器,支持从 1000 多个网站下载视频和音频,界面简洁并具备自动订阅功能。FlashMLA 是高效的注意力核函数库,提升深度学习性能。UltraRAG 是低代码框架,简化检索增强生成流程。WeMD 是专为微信公众号创作者设计的 Markdown 编辑工具,支持多功能和跨平台使用。
OpenAI开源的新模型采用Circuit Sparsity技术,使99.9%的权重为零,提升了模型的可解释性。通过严格的连接约束,简化了计算过程,解决了传统模型的黑箱问题。尽管计算成本较高,但未来有望实现更复杂的推理。
Infinity是一个为LLM应用设计的AI原生数据库,支持混合搜索,包括稠密和稀疏嵌入、张量、全文及结构化字段。它提供低延迟、高吞吐量的检索,适用于RAG、搜索、推荐、问答和对话AI,并配有易用的Python SDK和单一二进制部署选项。
DeepSeek R1引起关注,研究者提出新注意力机制NSA,旨在提高长上下文处理效率。NSA结合硬件优化与可训练设计,克服现有稀疏注意力方法的局限性,提升模型性能与训练效率。
DeepSeek最新模型V3.2-Exp上线,采用新稀疏注意力机制DSA,提升长文本推理效率,并开源TileLang和CUDA算子,API价格降至五折,国庆礼包也令人惊喜。
DeepSeek-V3.2-Exp模型现已支持,采用稀疏注意力机制,适用于长文本任务。vLLM集成了新的CUDA内核,优化了性能,用户可通过特定指令进行部署和测试,未来将扩展对更多硬件的支持。
我们重新审视高维向量在双服务器系统中的安全聚合问题,提出了PREAMBLE机制。该机制通过块稀疏向量实现高效聚合,降低通信成本,并优化隐私与效用的平衡。与Prio相比,噪声方差的开销极小。
本文探讨了扩散模型生成图像的多样性问题,提出了一种通过引入数据驱动的排斥项来增强生成图像多样性和质量的方法。该方法在批量生成相同提示的图像时表现优异,同时保护特定图像集的多样性。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
完成下面两步后,将自动完成登录并继续当前操作。