EMS-SD:高效的多样本猜测解码用于加速大型语言模型
内容提要
本文介绍了一种基于“假设采样”的算法,能够将Transformer解码速度提高2至2.5倍,同时保持样本质量。该方法通过草稿模型生成候选分段并进行批量验证,显著提升接受率。实验结果显示,该算法在多个数据集上优于传统解码方法,并在不同任务中实现了显著的内存速度提升。
延伸解读
多候选验证如何提升接受率
传统猜测性解码中,草稿模型生成的单个候选分段常因模型、数据集或解码设置等因素被目标模型拒绝,导致加速效果受限。EMS-SD通过从草稿模型中采样多个候选分段,并设计高效的多候选批量验证算法,在保持目标模型分布的前提下,显著提高了候选标记的接受率。这意味着在相同草稿成本下,更多候选能被目标模型接受,从而减少重新生成的开销,实现更稳定的加速。
跨任务加速的实证表现
文章在多个数据集和模型上验证了EMS-SD的有效性,其接受率改进始终优于标准猜测性解码。特别地,在MLLMs如LLaVA 7B上,仅使用语言模型作为草稿模型即可绕过图像令牌处理,在三个不同任务中实现了高达2.37倍的内存速度提升。这表明该方法不仅适用于纯文本生成,也能有效扩展至多模态场景,为实际部署中的推理加速提供了可靠参考。
语义自适应令牌的补充作用
除了多候选采样,文章还提及通过引入具有语义自适应能力的令牌来提升草稿令牌的准确性。在CodeLlama-13B和7B模型上,该方案分别获得了超过3.5倍和3.0倍的加速,且不影响模型准确性。这提示我们,草稿模型的质量对推测解码至关重要,而语义自适应令牌能够在不增加额外计算负担的情况下,进一步优化草稿生成,与多候选验证形成互补。
Q&A
EMS-SD算法如何提高Transformer解码速度?
EMS-SD算法通过假设采样方法,将解码速度提高2至2.5倍,同时保持样本质量。
EMS-SD算法的候选分段生成过程是怎样的?
该算法通过草稿模型生成多个候选分段,并进行批量验证,从而提升接受率。
EMS-SD算法在实验中表现如何?
实验结果显示,EMS-SD算法在多个数据集上优于传统解码方法,并实现了显著的内存速度提升。
EMS-SD算法如何影响模型的内存使用?
该算法在不同任务中实现了最高可达2.37倍的内存速度提升。
EMS-SD算法的优势是什么?
该算法在保持模型准确性的同时,显著提高了生成草稿令牌的准确性和解码速度。
EMS-SD算法是否需要额外的模型训练?
该方法不需要额外的神经网络训练和内存占用,是一种即插即用的推理加速解决方案。