【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

💡 原文中文,约15700字,阅读约需38分钟。
📝

内容提要

线性注意力把 softmax attention 改写成可累积的矩阵状态,RWKV 让训练走 Transformer 的路、推理走 RNN 的路,RetNet 用 retention 统一 parallel/recurrent/chunkwise 三种计算。本文用 MQAR、Based、GLA、RULER 等论文的实测数据说明它们各自在哪里赢、在哪里输给 full attention。

🏷️

标签

➡️

继续阅读