内容提要
亚马逊团队公开Rufus-Air八阶段后训练配方:先用可自动验证的硬奖励建立能力,再引入主观软奖励,每阶段须通过回归门禁。难度过滤、奖励可靠性与基础设施同样关键。开发者应保存逐阶段检查点,监控目标收益及通用与安全回退,并设停止条件,而非照搬八步。
延伸解读
奖励顺序为何比阶段数量更关键
文章强调,后训练应先使用可自动验证的硬奖励(如数学答案、代码测试)建立能力,再引入主观软奖励。因为软奖励噪声大,早期模型易学会讨好裁判而非任务本身。先硬后软相当于先校准尺子,再测柔软材料,能降低奖励漏洞风险。
难度过滤与能力覆盖的平衡
难度过滤让强化学习样本处于有效区间:太简单则奖励方差小,梯度无信息;太难则奖励长期为零,模型无法区分尝试好坏。同时,阶段间存在能力覆盖风险,如代码阶段可能使回答模板化,搜索阶段可能放大低质来源依赖。因此每阶段需同时监控目标能力、通用能力、安全性和校准度。
阶段门禁与可回滚检查点
文章建议为每个阶段设置晋级门禁:核心能力必须提升,通用与安全回退不能超阈值,软奖励阶段需足够样本量。并保存逐阶段检查点,以便退化时定位来源。若连续检查点目标收益低于噪声或单位算力收益下降,应暂停扩训,从最近通过门禁的检查点重启,而非用最终模型反向猜原因。
对开发者的现实启示
Rufus-Air的八阶段配方基于106B模型,完整复现需巨大算力和严格数据版本控制。中小团队更应复用其原则:奖励排序、难度过滤、逐阶段门禁和可回滚检查点,而非照搬八步。同时,训练指标不能替代留出评测,代码和搜索Agent需真实工具环境,阶段顺序应随基础模型能力诊断结果调整。
Q&A
Rufus-Air的后训练配方包含哪八个阶段?
Rufus-Air在GLM-4.5-Air-Base上串联八个后训练阶段,依次为:监督微调、推理、代码、指令、通用Agent、编码Agent、搜索Agent和RLHF。
为什么后训练中奖励设计要遵循“先硬后软”的顺序?
因为数学题答案、代码单元测试等硬奖励可自动验证、噪声小,能先建立可靠能力;而搜索质量、帮助程度等软奖励依赖模型裁判,误差大。早期用软奖励容易让模型学会讨好裁判而非任务本身,所以先用硬奖励校准“尺子”,再引入软奖励。
后训练中难度过滤为什么重要?
题目太简单,所有样本奖励接近满分,梯度没有信息;题目太难,奖励长期为零,模型不知道哪个尝试更好。有效训练区间应持续监控通过率、奖励方差和失败类型,而不是固定一套数据跑到底。
阶段晋级门禁需要检查哪些指标?
门禁要求核心能力必须提升(如目标收益≥2%),通用能力回退不超过1%,安全指标回退不超过0.5%,软奖励阶段还需满足最低样本量(如≥1000)。只有四项都满足才晋级。
开发者应该保存哪些检查点信息以便定位退化?
不要只保存最终模型,应为每个阶段保存检查点,并记录数据版本、奖励版本和评测报告。这样若某阶段出现退化,可以定位来源并从最近通过门禁的检查点重启。
中小团队应该如何借鉴Rufus-Air的配方?
中小团队不必复刻106B训练,而应复用其核心原则:奖励排序、难度过滤、逐阶段门禁和可回滚检查点。同时设置停止条件,如连续两个检查点目标收益低于噪声区间或单位GPU小时收益快速下降,就暂停扩训并复查数据。