自动生成巨大,快速生成:快速自回归解码的 LLM-to-SLM

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

该文综述大语言模型在翻译与语音识别中的进展:通过微调开源模型、添加音频编码器、混合训练策略及自推测解码等方法,提升同传翻译、多语种ASR和推理效率,部分方案无需额外训练即可加速,并在多项基准上媲美或超越专用模型。

🔎

延伸解读

同传翻译的轻量化路径

文章指出,经过小规模数据集微调后,开源解码器模型能通过生成“等待”标记控制输入分段,在同时翻译任务中达到与最先进基准相媲美的BLEU分数。这为资源有限的研究者提供了可行方案,无需依赖闭源模型。同时,闭源模型在该任务中展现出令人鼓舞的结果,暗示未来同传系统可能更注重模型与标记控制的结合。

语音识别的模态扩展策略

通过为大型语言模型添加小型音频编码器,可以构建与其文本版本能力相当的自动语音识别系统。实验表明,即使冻结LLM或使用近1秒步长的音频编码器生成更少嵌入,多语种ASR仍然可行。这降低了训练成本,并为LLM处理长篇音频开辟了可能性,但需注意编码器步长对识别精度的影响。

自推测解码的加速与局限

自推测解码通过草稿和验证两阶段加速LLM推理,无需辅助模型或额外训练。草稿阶段跳过中间层快速生成标记,验证阶段用原始LLM确保输出质量不变。在LLaMA-2上实现最高1.73倍加速,是一种即插即用方案。但加速比受模型结构和硬件影响,实际部署需权衡速度与资源。

多模型协同的推理优化

Big Little Decoder框架利用大小两个模型协同生成文本,在机器翻译、摘要等任务中实现最高2.38倍加速且性能损失不显著。这提示推理优化可结合不同规模模型,但需注意硬件依赖(如NVIDIA Titan Xp)和任务适配性。此外,并行自回归生成与推理解码结合也能提升生成速度,为效率与质量的平衡提供多种思路。

❓

Q&A

如何利用大语言模型实现同时翻译?

通过微调预训练的开源解码器-仅模型,使其生成特殊的“等待”标记来控制输入分段,从而在同时翻译任务中达到与最先进基准模型相媲美的BLEU分数。此外,利用混合训练策略(完整和前缀句子混合)进行监督微调,可以解决训练推理不匹配问题,在翻译质量和延迟上达到与专用同传模型相当的水平。

如何将大语言模型扩展到语音识别任务?

通过直接添加小型音频编码器来扩展大语言模型的能力,实现与其文本版本相同的自动语音识别系统。实验证明,即使在LLM被冻结或音频编码器使用几乎1秒的步幅生成更少嵌入时,多语种ASR仍然可行,为LLMs处理长篇音频开辟了可能性。

自我推测解码如何加速大语言模型推理?

自我推测解码通过两个阶段实现:草稿阶段以稍低质量但更快的速度生成草稿标记(选择性跳过某些中间层),验证阶段使用原始LLM在一次前向传递中验证草稿输出标记。该方法确保最终输出与未经修改的LLM完全相同,无需额外训练和内存,是一种即插即用的加速方案,在LLaMA-2上最高加速1.73倍。

Big Little Decoder (BiLD) 框架是什么?

BiLD是一个通过两个不同大小的模型协同生成文本来提高文本生成推理效率和延迟的框架。在机器翻译、摘要生成和语言建模等任务中,在NVIDIA Titan Xp GPU上实现高达2.38倍的加速且不对性能造成显著损失。

GenTranslate是什么?

GenTranslate是一种新的生成式翻译范式,利用大型语言模型的丰富语言知识和强大推理能力,从N个候选译文中生成更高质量的翻译结果,并在各种语音和机器翻译基准测试中明显优于现有模型。

SLAM-ASR系统是什么?

SLAM-ASR是一个简单而高效的语音识别系统,通过对大型语言模型和语音基础编码器进行多种组合的基准测试和研究提出,在Librispeech基准测试中表现出色,超过了最新的音频通用模型,并探讨了基于LLM的ASR的能力发展和模态对齐问题。

🏷️

标签

➡️

继续阅读