香农信息论才是AI底牌,大模型压缩机80年前就造好了

香农信息论才是AI底牌,大模型压缩机80年前就造好了

💡 原文中文,约7400字,阅读约需18分钟。
📝

内容提要

香农信息论被视为AI的底层逻辑,大模型本质上是数据压缩器,其压缩能力与智能正相关;扩散模型通过去噪测量互信息;自由能原理驱动智能体探索。然而,批评者指出该理论忽视了记忆、深度、因果与意义。香农理论是智能的基础,但并非全部,意义问题仍未解决。

🔎

延伸解读

压缩与智能的强关联

文章指出,大模型的压缩能力与推理能力高度相关,相关性约0.95。这意味着,模型在压缩文本上的表现越好,其在推理、数学等任务上的得分也越高。这一发现为理解大模型的工作原理提供了新的视角,也解释了为何语法学习快而冷知识学习慢:压缩器优先处理高频模式。

幻觉的另一种解释

从信息论角度看,模型幻觉并非故障,而是压缩器在数据缺失处的“平滑插值”。模型的目标是生成最可压缩的接续,而非追求真实性。因此,当模型面对未知事实时,它会用流畅但虚构的内容填补空缺,因为这在统计上更“经济”。这提醒我们,模型输出需谨慎对待。

提示词与边信息

香农的“边信息”概念解释了提示词为何有效:上下文中的相关条件降低了答案的条件熵,使正确答案成为更可压缩的选项。检索文档、示例或指令,本质上都是通过侧信道传递缺失的比特,从而引导模型生成更准确的输出。这为优化提示词提供了理论依据。

信息不等于意义

文章强调,模型发射的是比特,不是意义。即使模型将损失压到理论下限,也可能无法传递用户真正需要的信息。香农在1948年划清了信息与意义的界限,而当前AI系统主要处理信息,意义问题仍未解决。这提醒我们,AI的“理解”与人类的理解存在本质差异。

Q&A

香农信息论如何成为AI的底层逻辑?

香农在1948年发表的《通信的数学理论》中定义了信息的基本单位“比特”和熵公式,将信息与意义分离。大模型训练时优化的损失函数(交叉熵)正是基于香农熵公式,因此香农信息论成为AI的底层逻辑。

为什么说大语言模型本质上是一个数据压缩器?

大语言模型通过预测下一个词来训练,其损失函数(交叉熵)等价于算术编码中模型产生的压缩文件长度。模型猜得越准,压缩得越小,因此大语言模型本质上是一个数据压缩器。

大模型的压缩能力与智能水平有何关联?

研究人员测试了31个不同的大模型,发现它们压缩新文本的能力与在推理、数学等基准上的得分高度相关(相关性约0.95)。压缩得越好,思考得越好,表明压缩能力与智能水平正相关。

扩散模型如何与香农信息论联系起来?

扩散模型通过加噪声和去噪来生成图像,加噪声过程类似于信号在噪声信道中传输。I-MMSE关系表明,去噪误差与互信息相关,扩散模型的训练目标(最小化去噪误差)实际上是在测量互信息,因此扩散模型与香农信息论紧密相连。

自由能原理如何解释智能体的探索行为?

自由能原理认为智能体通过最小化变分自由能来维持自身状态,这包括感知和行动。在规划时,智能体最小化期望自由能,它分为两部分:追求目标(利用)和降低不确定性(探索)。因此,好奇心是数学中自带的,无需额外奖励。

批评者认为香农信息论忽视了哪些方面?

批评者指出香农信息论忽视了记忆(模型记住更多而非遗忘)、深度(计算步数而非仅比特数)、因果(数据不提供原因)和意义(信息与意义分离)。这些方面是智能的重要组成部分,但香农理论未涵盖。

香农信息论在AI中的根本局限是什么?

香农信息论只处理信息的形式,不涉及意义。大模型能压缩文本、图像等,但无法回答“你刚才说的那句话是什么意思”,因为意义问题未被纳入理论。香农本人也承认语义问题有待进一步研究。

🏷️

标签

➡️

继续阅读