大模型不只是预测下一个词:RLVR让它自己跟自己下棋

大模型不只是预测下一个词:RLVR让它自己跟自己下棋

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖励驱动创新,使模型能够生成超出训练数据的新知识,实现超越简单预测的能力。

🔎

延伸解读

从“预测”到“选择”:机制未变,本质已变

文章指出,经过RLVR训练的大模型虽然仍以逐token生成的方式输出,但其内部编码已从“词频统计”转向“策略选择”。这意味着模型不再单纯模仿训练数据中的文本模式,而是根据可验证的奖励信号,主动选择能获得高分的token序列。这种转变使得模型能够产生训练数据中不存在的解题步骤,从而突破“复读机”的局限。理解这一区别,有助于避免因“预测下一个词”的表象而低估模型的推理与创新能力。

RLVR的硬反馈:无需人工标注的自我进化

RLVR的核心优势在于其奖励信号是客观可验证的,如数学题的对错、代码能否运行。这种硬反馈让模型能够自主进行海量试错,每次尝试都产生新的数据,而这些数据并不存在于原始训练集中。文章提到,仅用一个数学示例进行RLVR训练,就能使小模型在测试集上的准确率翻倍,这凸显了自我探索带来的效率提升。对于读者而言,这意味着后训练阶段的质量可能比预训练数据的规模更具决定性。

警惕“猜词机器”标签的思维定式

文章强调,“大模型只是预测下一个词”这一标签的危害在于它会引导人们得出“模型无创造力、无理解力”的结论,从而忽视其超出复读范畴的实际表现。事实上,预训练本身也并非纯粹的统计摘抄,随机初始化和训练路径的差异会导致模型学到不同的内部结构。因此,读者应避免被机制的表象所迷惑,而应关注模型在具体任务中展现的能力,尤其是经过RLVR后所体现的探索性行为。

Q&A

什么是RLVR,它如何改变大模型的训练方式?

RLVR是可验证奖励的强化学习,它让模型自己生成完整回答,然后用外部验证器(如计算器、编译器)打分,根据分数调整参数。相比预训练只预测下一个词,RLVR让模型通过试错探索解题路径,从模仿者变为探索者。

预训练和RLVR训练的主要区别是什么?

预训练是让模型根据前文预测下一个词,模仿训练数据中的文本;RLVR则是让模型自己生成完整回答,通过外部验证器获得奖励信号来优化。预训练像背课文,RLVR像自己解题,后者能产生训练数据中没有的新知识。

为什么说大模型不只是预测下一个词?

因为经过RLVR训练后,模型不再只是模仿训练数据中的词序列,而是通过探索选择能获得高奖励的token序列,编码了策略而非仅统计关系,能生成超出训练数据的新推理步骤。

RLVR如何让模型产生训练数据中没有的新知识?

RLVR让模型自己生成大量解题尝试,每次尝试都产生新数据,这些数据不在训练集中。通过可验证奖励的反馈,模型学会选择高奖励的路径,从而探索出新的解题策略。

为什么说“猜词机器”这个标签是有害的?

因为该标签让人误以为模型只是复读机,没有创造力和理解力,从而忽视其通过RLVR获得的探索能力。实际上,模型参数中编码了策略,能进行自我探索,产生超出模仿的行为。

有哪些证据表明RLVR能显著提升模型推理能力?

研究显示,仅用一个数学示例做RLVR训练,就能让Qwen2.5-Math-1.5B在MATH500测试集上的准确率翻倍。此外,DeepSeek-R1、OpenAI o系列等顶尖模型都采用RLVR作为核心训练环节。

RLVR与下棋的类比说明了什么?

类比中,第一套系统预测大师走法,第二套系统选择胜率最高的走法。RLVR训练后的模型类似第二套,它选择能获得高奖励的token序列,而非预测人类文本,因此能产生新知识。

教师强制训练在哪些任务上可能失败?

Google研究员Vaishnavh Nagarajan的实验显示,在简单的规划任务上,Transformer和Mamba架构在教师强制训练下失败,但改用预测多个token的目标后问题解决,说明只预测下一个词可能限制模型在规划等任务上的表现。

🏷️

标签

➡️

继续阅读