混合专家后训练量化的研究:一个基准评估
内容提要
本文提出了一种名为Mixture of Quantized Experts (MoQE)的权重量化方法,旨在降低混合专家模型的内存消耗和推理延迟,同时保持模型性能。通过专家修剪和跳过技术,该方法显著提高了部署效率,减少了模型大小并加快了推理速度。在大规模语言模型上,该方法实现了高达3.65倍的吞吐量,且准确性损失最小。
延伸解读
MoQE 的核心机制与优势
MoQE 是一种仅权重量化方法,通过减少内存消耗和加速推理来提升混合专家(MoE)模型的部署效率。它采用自适应的量化粒度,并实现了高效的 GPU 矩阵乘法和解量化算法,支持 fp16 或 bf16 激活与 int8 或 int4 权重的乘法。该方法无需额外微调,适用于 MoE 和密集模型,在 OPT-175B 和内部 MoE 模型上评估显示,准确性损失最小,吞吐量提升高达 3.65 倍。
专家修剪与跳过:进一步压缩 MoE
除了权重量化,文章还提出了任务无关和任务特定的专家修剪与跳过技术,以插拔式稀疏化改进 MoE 大语言模型的部署效率。这些技术能同时减小模型大小、增加推理速度并保持满意性能。一个统一的压缩框架整合了主流压缩方法,从专家瘦身和专家修剪两个角度进行压缩,实验实现了 6.05 倍加速和仅 20.0GB 内存使用,同时保持 Mixtral-8x7B 超过 92% 的性能。
MoE 的缩放定律与效率考量
文章指出,增加专家数量会导致递减收益,因此建议将推理效率作为模型缩放定律的指标之一,以在相同性能下提供最佳解决方案。研究还建立了适用于细粒度 MoE 模型的扩展规模定律,并发现将专家大小设置成与前馈层相似的常见做法在几乎任何计算预算下都不是最优的。这些发现有助于指导从业者在特定计算预算下推导最佳训练配置。
Q&A
Mixture of Quantized Experts (MoQE) 方法的主要目标是什么?
MoQE 方法旨在降低混合专家模型的内存消耗和推理延迟,同时保持模型性能。
MoQE 方法如何提高模型的部署效率?
通过专家修剪和跳过技术,MoQE 方法显著提高了部署效率,减少了模型大小并加快了推理速度。
在大规模语言模型上,MoQE 方法的吞吐量提升了多少?
在大规模语言模型上,MoQE 方法实现了高达3.65倍的吞吐量。
MoQE 方法是否需要额外的微调?
MoQE 方法适用于混合专家模型和密集模型,无需额外的微调。
MoQE 方法如何处理计算成本?
通过动态选择和激活部分专家,MoQE 方法显著减少计算成本,同时保持高性能。
MoQE 方法在准确性方面的表现如何?
MoQE 方法在实现高吞吐量的同时,准确性损失最小。