Meta新研究:字节模型蒸馏后,天花板破了

Meta新研究:字节模型蒸馏后,天花板破了

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

Meta FAIR与华盛顿大学提出字节级蒸馏新方法,将教师模型的Token概率分布转换为字节级目标,让学生模型直接学习字节分布。实验以Llama 3-8B为教师,提出Marginalize-It和End-Of-Token两种方案。End-Of-Token蒸馏下游准确率上限达52.4%,比传统Token蒸馏高4个百分点,且存储更省,但训练计算量更高。

🔎

延伸解读

字节级蒸馏的存储优势

文章指出,传统Token蒸馏需保存教师模型在庞大词表上的概率分布,如Llama 3-8B有128256个Token,存储成本高,常需top-k截断。而字节级蒸馏将候选空间压缩到256个基础取值,完整分布更易保存。实验显示,在Token只保存top-600、字节保存完整分布的设置下,存储量仅为约五分之一,显著降低了数据和教师分布的存储压力。

计算成本与推理公平性

字节级蒸馏虽节省存储,但训练计算量更高。End-Of-Token因在每个Token后加入特殊符号,处理相同文本量时训练计算量比普通字节模型高约30.94%。此外,论文尚未完成等推理成本下的公平比较,因此其实际效率优势需进一步验证。读者需注意,更少的数据不代表更少的计算,部署时需权衡计算资源。

Scaling潜力与预测上限

实验表明,Token模型在计算量较小时学得更快,但很快接近平台期;字节模型起步慢,却随计算量增加持续改善,展现出更好的Scaling潜力。根据缩放定律预测,End-Of-Token蒸馏下游平均准确率上限达52.4%,比传统Token蒸馏高4个百分点,且在约6.33×10²² FLOPs时追平Token蒸馏的预测上限。

方法差异与信息保留

Marginalize-It和End-Of-Token是两种将Token分布转换为字节目标的方案。Marginalize-It对已结束候选重新归一化,效率高但丢失部分概率信息,其预测上限50.5%甚至低于普通字节监督模型的51.2%。End-Of-Token通过为Token结束添加明确预测位置,更完整保留教师分布,预测上限最高,但代价是额外计算开销。

Q&A

Meta新研究提出的字节级蒸馏是什么?

字节级蒸馏是一种将教师模型的Token概率分布转换为字节级目标,让学生模型直接学习字节分布的方法。它由Meta FAIR和华盛顿大学提出,旨在突破Token蒸馏的天花板。

字节级蒸馏相比传统Token蒸馏有什么优势?

字节级蒸馏的优势包括:下游准确率上限更高(End-Of-Token蒸馏达52.4%,比Token蒸馏高4个百分点),存储更省(字节完整分布存储量约为Token top-600的五分之一),且学习的基本单位更小但能力上限更高。

End-Of-Token和Marginalize-It两种方案有什么区别?

Marginalize-It在Token结束时不再追后续字节,重新归一化剩余候选概率,效率高但会丢失部分信息;End-Of-Token在每个Token末尾加入特殊结束符号,为结束本身提供预测位置,能更完整地保留教师分布,但训练计算量更高。

字节级蒸馏的实验结果如何?

实验以Llama 3-8B为教师,预测平均准确率上限:Token蒸馏48.4%,Marginalize-It蒸馏50.5%,End-Of-Token蒸馏52.4%。End-Of-Token比Token蒸馏高4个百分点,且存储更省,但训练计算量更高。

字节级蒸馏有哪些局限性?

局限性包括:训练计算量更高(End-Of-Token比普通字节模型高约30.94%),推理成本尚未进行等成本公平比较,且Marginalize-It会丢失部分Token结束后的概率信息。

字节级蒸馏的未来潜力如何?

字节级蒸馏展示了一条小模型训练的新路径:用更小的预测空间和更少的训练文本争取更高的能力上限。End-Of-Token在外推中表现最好,但需要继续投入计算才能兑现潜力。

🏷️

标签

➡️

继续阅读