【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径
原文中文,约16200字,阅读约需39分钟。
📝
内容提要
Transformer 用 KV Cache 保存全部历史,SSM 用固定状态压缩历史。本文讲清 S4 为何长程却难训、Mamba 的 selective SSM 与 parallel scan 如何让递归既线性又能并行训练,比较推理状态与 KV Cache 的胜负边界,并给出 SSM 能否取代通用 LLM 的争论。
🏷️