一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

本文介绍了一种新的注意力模型Mamba,它基于SSM架构,具有线性复杂度和5倍推理吞吐量。Mamba在多个模态上表现出SOTA水平,在预训练和下游任务上都优于同类模型。作者认为Mamba是通用序列模型骨干的有力候选者。

🏷️

标签

➡️

继续阅读