本文概述大语言模型加速方法,分为三类:低秩方法(LoRA、Linformer、MLA)降低矩阵维度;分块计算(FlashAttention、FlashDecoding++)优化注意力与矩阵乘法;技巧类包括Medusa并行预测、SnapKV压缩缓存、参考推理、SwitchHead和DropBP等。此外还涉及Triton语言、硬件加速综述以及量化、剪枝、缓存等方向。
完成下面两步后,将自动完成登录并继续当前操作。