小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文总结了MHA、GQA、MQA和MLA等注意力结构的源码及其演变过程,涵盖多头注意力、前馈神经网络和层归一化等实现细节。

MHA, GQA, MQA, MLA的代码

李文举 李文举 · 2025-04-01T00:54:08Z
DeepSeek的MLA,任意大模型都能轻松迁移了

复旦NLP实验室的纪焘博士后研究了如何高效地将基于多头自注意力(MHA)的大语言模型迁移至多头潜在注意力(MLA)架构,提出了MHA2MLA框架。该框架通过部分RoPE保留和低秩近似,显著降低推理成本,仅需0.3%至0.6%的预训练数据,兼容现有技术,为资源高效的LLMs部署提供新路径。

DeepSeek的MLA,任意大模型都能轻松迁移了

机器之心 机器之心 · 2025-03-06T13:15:00Z

姚期智团队推出的新型注意力机制TPA,通过动态张量分解优化QKV,节省90%内存且不降低性能,兼容RoPE位置编码,统一多种注意力设计。新模型T6已开源,实验结果在多个基准测试中表现优异。

姚期智团队开源新型注意力,节省90%内存不降性能,一个框架统一MHA/MQA/GQA

量子位 量子位 · 2025-01-15T09:08:58Z

本研究解决了大型语言模型在输入序列长度增大时推理速度变慢的问题,提出了一种通过逐步去除冗余参数的低成本方法,将多头自注意力(MHA)模型修剪为关键-值查询(GQA)模型。通过对注意力头施加正交变换以提高相似性,我们的方法能够以高达87.5%的压缩比成功减少LLaMA2-7B模型的关键-值头数量,同时保持良好的性能。

合并前对齐注意力头:转换MHA为GQA的有效方法

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-12-30T00:00:00Z

本文介绍了DeepSeek-V2中的MHA创新点,包括MLA降低KV Cache开销,FFN结构改为DeepseekMoE,以及MLA对Query和Key的压缩和RoPE编码。

一文通透DeepSeek-V2(改造Transformer的中文模型):详解MoE、GRPO、MLA

结构之法 算法之道 结构之法 算法之道 · 2024-08-26T13:18:39Z

本文介绍了分组查询注意力和多查询注意力两种注意力机制,前者通过共享键和值矩阵减少内存成本,后者让所有头共享同一份键和值矩阵,每个头只保留一份查询参数,从而减少参数量。两种注意力机制的区别在于建立Wqkv层的方式。

一文通透各种注意力:从多头注意力MHA到分组查询注意力GQA、多查询注意力MQA

结构之法 算法之道 结构之法 算法之道 · 2023-11-05T03:48:34Z

MHA、MQA和GQA是不同版本的注意力机制。MHA具有多个头部,每个头部都有自己的QKV计算。MQA在所有Q头部中共享相同的K和V头部。GQA是MHA和MQA之间的折中,一定数量的Q头部共享一组K和V头部。MQA和MHA可以看作是GQA的特例。从MHA中获得MQA和GQA,对每个头部的K和V头部进行平均池化。在性能方面,GQA在MQA和MHA的优势之间提供了平衡。

MHA、MQA、GQA的差异与共性

YongYuan's homepage YongYuan's homepage · 2023-09-01T16:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码