一文通透各种注意力:从多头注意力MHA到分组查询注意力GQA、多查询注意力MQA

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

本文介绍了分组查询注意力和多查询注意力两种注意力机制,前者通过共享键和值矩阵减少内存成本,后者让所有头共享同一份键和值矩阵,每个头只保留一份查询参数,从而减少参数量。两种注意力机制的区别在于建立Wqkv层的方式。

🏷️

标签

➡️

继续阅读