内容提要
该论文首次在开放生成任务上对比五种测试时扩展方法,发现瓶颈不在生成候选(探索有效),而在选择最终答案(利用失效)。奖励模型相关性低,BoN近乎随机,Fusion仅回收约40%增益。树搜索多样性坍缩,自我修正多无效。结论:候选池非瓶颈,选择才是,Fusion是目前唯一一致有效方法。
延伸解读
验证器失效是核心瓶颈
论文指出,在开放生成任务中,当前开源奖励模型与人类判断的相关性极低(Spearman 相关系数仅约 0.1),导致基于奖励模型的 Best-of-N 选择近乎随机。这意味着,即使生成大量候选,若无法有效筛选,最终质量提升有限。这一发现挑战了“更多采样必然更好”的直觉,强调了验证环节的重要性。
Fusion 方法的相对优势
在对比的多种测试时扩展方法中,Fusion 是唯一一致有效的方法,能回收约 40% 的潜在增益,而 BoN 仅约 15%。这表明,简单的多数投票或合成式选择可能优于依赖单一奖励模型。但论文也强调,剩余约六成增益仍是开放问题,Fusion 并非最终解决方案。
树搜索与自我修正的局限
树搜索方法(如 Particle Filter)在多样性上坍缩,输出候选高度相似,等效于单条轨迹,导致探索与利用同时失效。自我修正(Sequential Refinement)仅在特定基准(如 PRBench)有效,在其他任务上可能变差,且部分增益被冗长度混淆。这提醒开发者,这些方法并非通用,需谨慎评估。
Q&A
测试时扩展的瓶颈是什么?
测试时扩展的瓶颈不在生成更多候选(探索有效),而在从候选池中选出最终答案(利用失效)。
论文对比了哪些测试时扩展方法?
论文对比了Best-of-N(BoN)、Beam Search、Particle Filter(PF)、Sequential Refinement(SR)、Fusion,以及Budget Forcing作为对照。
为什么说奖励模型在开放生成任务上几乎无法区分好坏?
因为当前一代开源奖励模型在开放生成任务上的Spearman相关仅约0.1,例如Skywork-Reward-V2-Llama-3.1-8B为0.120,Llama-3.1-70B-Instruct-RM-RB2为0.107,导致基于它们的BoN选择近乎随机。
Fusion方法在头空捕获上表现如何?
Fusion方法在头空捕获上平均约40%,是唯一一致有效的方法,但仍有约六成头空未解决。
树搜索和顺序细化在开放生成任务中分别有什么失败模式?
树搜索(如Particle Filter)在多样性上坍缩,输出相似度极高,等效于单条轨迹;顺序细化(SR)只在PRBench上真实提升,在其他基准上无效或变差,且部分增益被冗长度混淆。
论文的实验覆盖了哪些基准和模型?
实验覆盖HealthBench、LEXam、PRBench、WildBench、WritingBench五个开放生成基准,生成器包括OLMo3-7B-Think、OLMo3.1-32B-Think、Qwen3.5-9B和Qwen3.5-35B-A3B。
个人开发者如何复现论文的核心洞察?
个人开发者可以在小规模开放任务上采样N个候选,用LLM裁判打分,对比BoN选择与合成式Fusion,单卡或API调用即可,无需论文级的算力规模。