本文概述大语言模型加速方法,分为三类:低秩方法(LoRA、Linformer、MLA)降低矩阵维度;分块计算(FlashAttention、FlashDecoding++)优化注意力与矩阵乘法;技巧类包括Medusa并行预测、SnapKV压缩缓存、参考推理、SwitchHead和DropBP等。此外还涉及Triton语言、硬件加速综述以及量化、剪枝、缓存等方向。
Flash Attention 通过分块计算 Q、K、V,避免存储 seq_len×seq_len 的 softmax 中间矩阵,减少 HBM 访问,使注意力内存随序列长度近似线性增长。虽然 FLOP 更高,但注意力受内存带宽限制,因此速度更快,并支持长序列训练。
完成下面两步后,将自动完成登录并继续当前操作。