为什么语言模型的本质是压缩器?

为什么语言模型的本质是压缩器?

💡 原文中文,约2800字,阅读约需7分钟。
📝

内容提要

这篇文章讨论了语言模型与压缩的等价性。研究者通过压缩的视角来评估大型语言模型的压缩能力,并证明了基于预测与压缩的等价性可以使用任何压缩器构建条件生成模型。实验证明大语言模型也是强大的通用预测器。研究者还考虑了不同数据集上的压缩效果,并发现通用压缩器在各种数据源上都有良好的性能。这篇论文解释了为什么压缩和预测是等效的。

🔎

延伸解读

从算术编码看语言模型如何充当压缩器

文章用算术编码的例子说明,语言模型输出的条件概率可以逐步将字符映射到区间,最终得到二进制编码。每一步的概率都来自模型对语料库的统计,因此最小化对数损失等价于最小化压缩率。这解释了为什么训练语言模型的目标天然就是压缩目标,也说明预测与压缩在数学上可以相互转化。

通用压缩能力:Chinchilla 跨模态表现突出

实验显示,主要用文本训练的 Chinchilla 70B 在图像和音频数据上也能取得优于领域专用压缩器的效果,例如将 ImageNet patches 压缩到原始大小的 43.4%,超过 PNG 的 58.5%。这表明大语言模型不仅是文本预测器,还可能成为通用压缩器,其能力不局限于训练模态。

上下文长度与压缩率的权衡

不同压缩器使用的上下文长度差异很大:Transformer 受限于 2048 字节,而 gzip 可达 32K 字节,LZMA2 几乎无限。更长的上下文有助于利用序列依赖性提升压缩率。实验中研究者将数据划分为 2048 字节的序列,以协调不同压缩器的比较,这提醒读者在评估压缩能力时需注意上下文设置的影响。

对扩展定律与上下文学习的启示

文章指出,从压缩视角审视预测问题,能为扩展定律和上下文学习提供新见解。因为压缩率直接反映模型对数据规律的学习程度,模型越大、训练越充分,压缩能力越强,这或许解释了为何大模型在多种任务上表现出强大的泛化能力。这一视角将模型规模、训练目标与泛化性能联系起来。

❓

Q&A

语言模型与压缩之间有什么等价性?

语言模型可以被视为无损压缩器,二者在预测和压缩的目标上是等价的。

大型语言模型的压缩能力如何评估?

通过压缩的视角评估,实验表明大型语言模型在多种数据集上表现出强大的压缩能力。

Chinchilla模型在不同数据类型上的表现如何?

Chinchilla模型在图像和音频数据上的压缩效果优于其他领域特定的压缩器。

算术编码与语言模型建模有什么相似之处?

算术编码的过程与语言模型建模过程相似,二者可以相互转化。

通用压缩器在不同数据源上的表现如何?

通用压缩器如gzip在各种数据源上表现良好,能够有效压缩不同模态的数据。

压缩目标与语言模型训练目标有什么关系?

压缩目标与语言模型训练目标一致,因此二者是等价的。

🏷️

标签

➡️

继续阅读