内容提要
2026年,开源小模型通过平衡强化学习(RL)与监督微调(SFT),可超越闭源大模型。SFT提供战略方向,RL负责战术创新,两者失衡会导致模型僵化或混乱。GRPO、RULER、ART等工具优化平衡,使3B模型准确率从62%升至89%,突破纯SFT的72%上限,实现高效进化。
延伸解读
平衡的艺术:SFT与RL的配比决定成败
文章强调,SFT与RL并非二选一,而是需要动态平衡。SFT提供先验知识,确保模型不偏离基本方向;RL则在安全区内探索创新,突破性能上限。若SFT过强,模型沦为死记硬背的书呆子,无法应对新情况;若RL过强,则产生混乱噪音,甚至灾难性遗忘。健康的训练流程应先用SFT打好基础,再逐步引入RL,并辅以KL散度惩罚防止偏离。
2026年工具链:从玄学炼丹到仪表盘驾驶
GRPO、RULER、ART等工具将平衡从经验主义变为科学。GRPO通过组内相对比较隐式引入先验约束;RULER用LLM裁判评估轨迹质量,多维评价;ART则自动管理KL散度约束和奖励缩放,实时监控训练曲线。这些工具让开发者无需手动调参,即可实现SFT与RL的自动平衡,大幅降低训练门槛。
实战验证:3B模型如何逆袭闭源巨无霸
文章给出具体数据:ART训练的3B模型在MCP工具调用任务上,准确率从62%提升至89%,而纯SFT上限仅72%,纯RL则初期暴跌至40%以下且语言质量恶化。这表明,在正确平衡下,开源小模型能超越闭源大模型,关键在于策略而非参数规模。
Q&A
SFT和RL在模型微调中各扮演什么角色?
SFT(监督微调)提供先验知识,确保模型输出方向正确,相当于战略;RL(强化学习)在SFT划定的安全区内进行探索和创新,突破性能上限,相当于战术。两者需动态平衡。
为什么SFT过强会导致模型变成书呆子?
SFT过强时,模型过度依赖训练数据,只会死记硬背,面对新情况无法灵活应对,缺乏从错误中学习的能力,在真实环境中容易出错。
RL过强会带来哪些问题?
RL过强会导致模型输出随机性大,缺乏方向感,可能发生灾难性遗忘,破坏语言能力,训练曲线不稳定,难以预测和控制。
如何实现SFT和RL的平衡?
先用高质量SFT将模型拉到及格线,再启动RL进行精细化打磨,同时给RL的探索加上KL散度惩罚,防止偏离SFT先验。训练初期SFT权重高,中后期逐步放权给RL。
GRPO、RULER和ART分别有什么作用?
GRPO通过组内相对比较隐式包含先验约束,兼顾任务完成度和输出质量;RULER用LLM作为裁判评估轨迹质量,在奖励信号中嵌入先验知识;ART将两者打包成自动管理KL散度和奖励缩放的训练流水线,实时监控并调整超参数。
3B模型如何通过平衡SFT和RL超越闭源大模型?
通过ART框架训练3B模型,初始SFT准确率62%,加入RL迭代五轮后准确率升至89%,且语言质量稳定;而纯SFT上限72%,纯RL语言质量恶化。平衡策略使小模型突破天花板并保持输出质量。