内容提要
该论文提出“结构信息”新概念,挑战传统信息论,认为AI训练中大量数据是随机噪声,真正有用的是可拆解重组的结构信息。研究发现,数据顺序影响模型学习能力,简单规则可涌现复杂行为,文本数据的结构信息含量高于图像。这为数据选择提供理论依据,强调追求可学习的新颖性,而非盲目追求低损失。
延伸解读
数据顺序为何影响学习效果
论文通过国际象棋实验发现,先给棋步再给棋盘状态比反向顺序更容易学习,但反向顺序训练出的模型在残局判断等能力上更强。这表明数据顺序并非无关紧要,它会影响模型被迫“思考”的深度,从而影响结构信息的积累。对实践者而言,这意味着在数据预处理时,可以尝试调整样本顺序或任务设计,以激发模型更强的学习能力,而非仅仅追求训练速度。
简单规则涌现复杂行为的意义
一维元胞自动机规则54的实验显示,计算力有限的模型为了预测远期状态,会自发构建出类似“滑翔机”等高阶概念,其内部程序长度远超生成数据的简单规则。这反驳了“AI只是鹦鹉学舌”的观点,表明模型在训练中可能涌现出超越训练数据表面的抽象理解。这提示我们,评估模型能力时,不应仅看其拟合数据的能力,更应关注其是否形成了可迁移的、结构化的知识。
文本与图像数据的结构信息差异
论文用前序编码和重序编码估算,发现文本数据的结构信息含量高于图像数据。图像像素随机性高,模型记住的多是难以复用的细节;而文本的长程依赖和逻辑关系迫使模型构建可复用的内部结构。这解释了为何语言模型预训练后能迁移到多种任务,而图像模型往往局限于生成。对于数据选择,这意味着应优先考虑富含结构信息的数据,而非单纯追求数据量。
数据选择的新标准:信息吸收率
论文提出自适应数据优化算法,不追求最低损失,而是最大化“信息吸收率”,即选择那些让模型学起来费劲但能举一反三的数据。实验表明,这种策略在未见任务上表现更好。这为数据筛选提供了理论依据:与其盲目堆砌数据,不如精选那些能促进模型结构信息增长的数据,从而提升泛化能力,避免浪费计算资源。
Q&A
传统信息论在衡量信息时有什么缺陷?
传统信息论认为只要字节数相同,信息量就相同,比如一堆乱码和一篇莎士比亚在字节数相同时信息量一样。但论文指出,这种观点忽略了信息的可复用性,真正有价值的是能被拆解重组、用于其他任务的结构信息,而随机噪声无法复用。
什么是结构信息?它与随机噪声有何区别?
结构信息是指数据中可拆解、可重组、能被模型复用于其他任务的知识,类似于乐高城堡可以拆了重组;而随机噪声(时间限制熵)是数据中无法复用的部分,类似于散沙只能扬掉。论文认为AI训练中大部分数据是随机噪声,真正有用的是结构信息。
数据顺序对模型学习有什么影响?
论文通过国际象棋数据实验发现,先给棋步后给棋盘状态(正向)模型容易学习,而先给棋盘状态再倒推棋步(反向)模型学习曲线下降更慢,但学出来的模型在残局判断等能力上更强。这说明数据顺序会影响模型被迫思考的程度,从而影响结构信息的积累,挑战了传统信息论中顺序不影响信息量的假设。
为什么说简单规则能涌现复杂行为?
论文以一维元胞自动机规则54为例,计算力有限的模型为了预测系统长期状态,不能仅靠死记硬背规则,而必须自己发明出关于“滑翔机”、“碰撞”等高阶概念的理论物理,导致模型的结构信息(程序长度)变得比生成数据的简单程序更复杂。这展示了简单规则可以涌现出远超数据本身的复杂行为。
文本数据和图像数据在结构信息含量上有什么差异?
论文用前序编码和重序编码估计算法测量,发现在相同计算量下,文本数据的结构信息含量高于图像数据。图像像素随机性高,模型记住的是具体特征(如猫的毛色),难以迁移;而文本词汇间的长程依赖和逻辑关系迫使模型构建复杂内部电路(如归纳头),形成可复用的结构信息。这解释了为什么语言模型预训练后能迁移到其他任务,而图像模型预训练后主要只能生成类似图像。
如何利用结构信息概念选择训练数据?
论文提出自适应数据优化算法,不追求最低损失,而是追求信息吸收率,即选择那些让模型学起来费劲但一旦学会就能举一反三的数据。这种数据富含结构信息,能提升模型在未见任务上的表现。因此,应避免选择顺风顺水、一点就透的数据,而应重视充满“意外”和“结构”的数据。