大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖励驱动创新,使模型能够生成超出训练数据的新知识,实现超越简单预测的能力。
完成下面两步后,将自动完成登录并继续当前操作。