斯坦福验证框架发威!DeepSeek V4 Flash反超 Fable5

斯坦福验证框架发威!DeepSeek V4 Flash反超 Fable5

💡 原文中文,约4800字,阅读约需12分钟。
📝

内容提要

斯坦福等机构提出LLM-as-a-Verifier验证框架,通过细化打分粒度、重复评估和标准分解,提升大模型自我判断能力。DeepSeek V4 Flash用此方法自验证,成本仅0.11美元,成功率88%,反超Claude Fable 5,验证成为继预训练、后训练、测试时计算后的第四条扩展曲线。

🔎

延伸解读

验证为何成为第四条扩展曲线

文章指出,预训练、后训练和测试时计算之外,验证正成为新的扩展轴。其核心在于,通过细化打分粒度、增加重复评估次数和分解评估标准,可以稳定提升模型判断力,而无需重新训练或增加推理时间。实验显示,三个维度各自独立生效且可叠加,这为提升模型能力提供了新的、可规模化的方向。

打分粒度与平局率的关系

文章提到,LLM作为裁判时,打分粒度太粗导致高达27%的平局率。例如,两个方案都被打7分,但模型对其中一个的把握明显更足。通过使用概率分布加权求期望,可以得到连续分数(如4.2分 vs 4.7分),从而区分高下。这说明,改进打分机制能释放模型已有的判断能力。

自验证的成本优势与局限

DeepSeek V4 Flash使用自身进行验证,成本仅0.11美元,远低于Claude Fable 5的1.3美元,成功率却达到88%,接近后者。但文章也指出,Oracle上限为96.6%,意味着验证器仍有8.6个百分点的提升空间。这提示,验证虽能显著提升效果,但尚未完全挖掘模型潜力。

Q&A

LLM-as-a-Verifier 框架的核心思想是什么?

LLM-as-a-Verifier 的核心思想是:不要只取打分 token 中概率最高的那个分数,而是利用整个概率分布加权求期望,得到连续分数,从而更精细地评估候选答案。同时,通过细化打分粒度、重复评估和标准分解三个维度,提升验证的准确性。

为什么说大模型的自我判断存在结构性漏洞?

因为大模型在自我评估时,打分粒度太粗,例如使用 1 到 5 分的整数评分,导致两个候选答案可能得到相同的分数(如都是 7 分),但实际上模型对它们的置信度不同。这种打分机制抹平了模型内心的细微差别,导致平局率高达 27%,无法有效区分优劣。

LLM-as-a-Verifier 框架在哪些基准测试上取得了 SOTA 结果?

LLM-as-a-Verifier 在 Terminal-Bench V2 上成功率达到 86.5%,在 SWE-Bench Verified 上为 78.2%,在 RoboRewardBench 上为 87.4%,在 MedAgentBench 上为 73.3%,均为当时最优(SOTA)。

DeepSeek V4 Flash 是如何利用 LLM-as-a-Verifier 反超 Claude Fable 5 的?

DeepSeek V4 Flash 在 Terminal-Bench 2.1 上对每个任务采样 5 条候选轨迹,并使用自身作为验证器进行自验证,最终系统成功率达到 88%,超过了 Claude Fable 5。关键点在于生成和验证都使用同一个模型,无需额外接入更强模型,且单任务成本仅约 0.11 美元,远低于 Fable 5 的 1.3 美元。

为什么说验证是继预训练、后训练、测试时计算之后的第四条 scaling 曲线?

因为验证不需要重新训练模型、不需要更大参数或更多推理时间,只需在验证阶段投入更多计算(如更细粒度、更多重复、更系统的标准分解),就能稳定提升最终效果。论文通过消融实验证明,这三个维度各自独立生效且能叠加,从而验证了验证作为新的 scaling 轴的有效性。

LLM-as-a-Verifier 与传统的 LLM-as-a-Judge 有何区别?

LLM-as-a-Judge 通常只给出一个总体印象分(如 1-8 分),而 LLM-as-a-Verifier 则提供更细致的证据,例如在多个子标准上分别打分,并重复评估取平均。此外,Verifier 采用循环赛机制对候选轨迹进行两两比较,最终选出胜场最多的,而 Judge 只是简单打分选最高。

验证信号除了用于选择答案,还能如何应用?

验证信号可以用作强化学习的密集反馈,在每一步都给出细粒度评分,改进 SAC 和 GRPO 算法,提升机器人和数学推理任务的样本效率。此外,团队还为 Claude Code 开发了扩展插件,让开发者在写代码时实时看到验证反馈,实现边写边验。

🏷️

标签

➡️

继续阅读