小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek 注意力结构对比:MHA、GQA、MLA、DSA、CSA、HCA、CSA2

DeepSeek注意力结构历经六轮迭代:MHA为基线,GQA减少KV头数,MLA将KV低秩压缩至576维latent,DSA用indexer选top-2048条以节省算力,CSA每4个token压缩并做块级检索,HCA压缩率达128且免检索,CSA2跨层共享KV并降至FP4。核心是逐代削减KV cache或注意力计算量,KV cache从V1的480KiB降至V4.1的890B。

DeepSeek 注意力结构对比:MHA、GQA、MLA、DSA、CSA、HCA、CSA2

Java不加糖's Blog Java不加糖's Blog · 2026-09-23T11:20:00Z

本文总结了MHA、GQA、MQA和MLA等注意力结构的源码及其演变过程,涵盖多头注意力、前馈神经网络和层归一化等实现细节。

MHA, GQA, MQA, MLA的代码

李文举 李文举 · 2025-04-01T00:54:08Z

该研究探讨了双编码器在信息检索中的应用,提出结合双编码器与注意力结构的神经模型,以提高检索精度。同时,介绍了无监督训练的密集感知器和稀疏表达的SPLADE检索器,证明其在效率和效果上的优势。此外,提出了新颖的稀疏技术和学习稀疏检索方法,显著提升了检索性能。

朝着竞争性搜索相关性的无推理学习稀疏检索器

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-07T00:00:00Z

本文介绍了基于Transformer的语言模型在推进人工智能通用性方面的重要性,并提出了锚函数的概念,为学习任务中的语言模型设计了一种基准函数。通过示例展示了锚函数的实用性,并揭示了语言模型中注意力结构的两个基本操作。锚函数框架为进一步探索有价值且易于研究的问题开启了研究空间。

锚定函数:一类用于研究语言模型的基准函数

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-01-16T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码