通过潜空间蒸馏压缩流式神经音频编码器

通过潜空间蒸馏压缩流式神经音频编码器

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

苹果设备端听写依赖神经音频编码器作为分词器,其参数量影响内存、功耗与延迟。研究提出潜空间蒸馏压缩法:以量化前的潜表示为目标,仅训练学生编码器回归教师逐帧潜表示,并用仿射层对齐宽度。2.8倍压缩下,六组师生中五组相对WER仅差1.9%,优于同容量独立训练编码器3.9%。

🔎

延伸解读

为何选择潜空间作为蒸馏目标

文章指出,学生编码器不直接模仿离散token或输出分布,而是回归教师模型量化前的逐帧潜表示。这一选择的关键在于,该潜表示是量化器和语言模型桥接之前最后的共享表示,因此一个蒸馏配方能同时覆盖两种token接口,并适用于单独预训练或与语言模型联合训练的tokenizer。

压缩效果与独立训练对比

在2.8倍压缩下,六组师生对中有五组的学生模型相对WER仅比教师高1.9%,且无需微调。相比同容量的独立训练tokenizer,蒸馏学生将相对WER改善了3.9%。这表明潜空间蒸馏在压缩编码器时,比从头训练同规模模型更能保留识别性能。

对设备端听写的实际意义

苹果设备端听写完全在本地运行,tokenizer的参数量直接影响内存占用、功耗和延迟。由于基础模型采用指令跟随剪枝,仅少量专家常驻DRAM,始终在线的tokenizer需与之竞争内存。因此,压缩tokenizer有助于降低常驻内存压力,对延长续航和减少响应延迟有实际价值。

❓

Q&A

苹果设备端听写为什么需要压缩神经音频编码器?

因为设备端听写完全在本地运行,编码器作为分词器将语音波形映射为语言模型可读的表示。由于语言模型在指令跟随剪枝下稀疏激活,只有少量专家占用DRAM,而常驻的分词器需要竞争同一内存,其参数量直接影响功耗和延迟,所以需要压缩。

潜空间蒸馏压缩法具体是怎么做的?

该方法以量化前的潜表示(即模型实际消费的、两个分词接口共享的最后一层表示)为监督目标,而不是离散token或输出分布。只训练学生编码器,用平方误差目标回归教师的逐帧潜表示,并用一个仿射层吸收教师和学生之间的宽度不匹配。

潜空间蒸馏为什么能同时适用于两种分词接口?

因为监督目标位于量化器和语言模型桥接之前,是两种分词接口共享的表示,所以同一个蒸馏方案可以覆盖两种接口,并且既适用于单独预训练的分词器,也适用于与语言模型联合训练的分词器。

潜空间蒸馏在2.8倍压缩下的效果如何?

在2.8倍压缩下,六组师生对中有五组的学生模型相对WER仅比教师差1.9%,且无需任何微调;相比同容量独立训练的编码器,相对WER提升了3.9%。

潜空间蒸馏与独立训练编码器相比有什么优势?

在相同容量下,蒸馏得到的学生编码器比独立训练的编码器相对WER改进了3.9%,说明蒸馏能更有效地利用教师知识来提升压缩后编码器的性能。

潜空间蒸馏需要微调学生模型吗?

不需要。在2.8倍压缩下,蒸馏后的学生模型在六组师生对中的五组上,无需任何微调就能达到与教师相对WER仅差1.9%的水平。

🏷️

标签

➡️

继续阅读