迈向快速多语言 LLM 推断:投机式解码和专业的起草机

💡 原文中文,约1700字,阅读约需4分钟。
📝

内容提要

本文提出了一种新颖的自我推测解码方案,旨在加速大型语言模型(LLMs)的推理。该方法分为草稿和验证两个阶段,确保输出质量与原始模型一致。实验结果显示,该方案在多个任务中实现了显著的速度提升和内存效率,最高加速比可达3.16倍,且无需额外训练。

🔎

延伸解读

自我推测解码:无需辅助模型的加速方案

文章提出一种自我推测解码方案,无需辅助模型即可加速LLM推理。该方法通过草稿和验证两阶段实现:草稿阶段选择性跳过某些中间层,快速生成稍低质量的草稿标记;验证阶段用原始LLM一次前向传递验证草稿输出,确保最终输出与原始模型完全一致。这种即插即用的方案无需额外训练和内存占用,在LLaMA-2上实现了最高1.73倍的加速。

多语言与多模态场景下的推测解码实践

文章展示了推测解码在MLLMs中的应用,特别是LLaVA 7B。实验表明,仅语言模型可作为优秀的起草模型,绕过图像令牌处理组件。使用从头训练的115M参数语言模型,在三个任务中实现了高达2.37倍的内存速度提升。此外,引入的紧凑LLaVA起草模型在图像字幕生成上表现出边际性能增益,其他任务结果相当。

分阶段投机性解码:小批量推断的优化

针对小批量设备端LLM推断的低算术密度问题,文章提出分阶段投机性解码算法。首先将投机性批量重新组织为树结构,降低生成成本并增加每批预期标记数;其次添加第二阶段的投机性解码。综合使用762M参数的GPT-2-L模型,在完美保留输出质量的同时,将单批解码延迟降低了3.16倍。

草稿模型选择与训练策略的多样性

文章提及多种草稿模型优化方法:使用分析模型选择适合工作负载的草稿模型,为LLaMA-65B设计的新草稿模型吞吐量提高30%;Speculative Streaming将起草融入目标模型,解码速度提升1.8-3.1倍且参数效率高;Llama 2 Chat Drafter 115M仅占原始模型1.64%大小,实现2.3倍效率提升和2.4倍加速。这些策略为不同场景提供了灵活选择。

❓

Q&A

自我推测解码方案的主要目的是什么?

自我推测解码方案旨在加速大型语言模型(LLMs)的推理过程。

该方案是如何确保输出质量的?

该方案通过草稿和验证两个阶段,确保最终输出与原始模型一致,从而保持输出质量。

自我推测解码方案的加速比最高是多少?

实验结果显示,该方案的最高加速比可达3.16倍。

该方案是否需要额外的训练?

该方案不需要额外的神经网络训练。

推测解码在内存速度提升方面的优势是什么?

推测解码在多个任务中实现了最高2.37倍的内存速度提升。

该方案如何解决小批量推断的低算术密度问题?

该方案通过将投机性批量重新组织为一棵树,降低生成成本并增加每批预期的标记数。

🏷️

标签

➡️

继续阅读