长度价值模型:面向令牌级长度建模的可扩展价值预训练

长度价值模型:面向令牌级长度建模的可扩展价值预训练

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

LenVM提出了一种令牌级长度建模框架,通过价值估计预测每步生成的剩余长度,无需标注且可扩展。实验显示,在LIFEBench上,7B模型长度分数从30.9提升至64.8,超越前沿闭源模型;在GSM8K低预算下保持高准确率,并支持长度控制、预测和生成动态解释,为未来强化学习训练提供基础。

🔎

延伸解读

长度建模的粒度突破

传统方法通常在序列级别控制长度,而LenVM将长度建模细化到每个解码步骤,通过预测剩余生成长度来提供密集的监督信号。这种令牌级粒度使得模型能够更精细地调整生成过程,从而在长度匹配任务上取得显著提升,例如7B模型在LIFEBench上的长度分数从30.9跃升至64.8,甚至超越前沿闭源模型。

效率与性能的权衡控制

LenVM支持在推理时连续调节长度,从而在性能与效率之间取得平衡。在GSM8K任务中,当预算仅为200个令牌时,LenVM保持了63%的准确率,而基线方法仅有6%。这表明LenVM不仅能控制长度,还能在资源受限时维持较高的推理质量,为实际应用中的成本优化提供了新思路。

可解释的生成动态

LenVM的令牌级价值信号提供了对生成过程的动态解释,能够揭示哪些具体令牌促使推理转向更短或更长的生成路径。这种可解释性有助于研究人员理解模型的行为,并为未来将长度价值信号整合到强化学习训练中奠定了基础,可能进一步提升模型对长度控制的适应能力。

Q&A

LenVM是什么?它如何建模生成长度?

LenVM(长度价值模型)是一种令牌级长度建模框架,它将长度建模视为价值估计问题,在每个解码步骤预测剩余生成长度。通过为每个生成的令牌分配恒定的负奖励,LenVM预测一个有界、折扣的回报,作为剩余生成范围的单调代理。

LenVM的训练数据需要人工标注吗?

不需要。LenVM的监督信号是自动生成的,无需人工标注,具有密集、无偏和可扩展的特点。

LenVM在LIFEBench上的表现如何?

在LIFEBench精确长度匹配任务上,将LenVM应用于7B模型,长度分数从30.9提升到64.8,显著优于前沿闭源模型。

LenVM如何实现长度控制?在GSM8K上的效果如何?

LenVM通过令牌级价值信号实现对生成长度的连续控制。在GSM8K上,当预算为200个令牌时,LenVM保持了63%的准确率,而基线只有6%。

LenVM能否预测总生成长度?

可以。LenVM能够从提示边界准确预测总生成长度。

LenVM的令牌级价值如何帮助解释生成动态?

LenVM的令牌级价值提供了生成动态的可解释视图,揭示了特定令牌如何将推理转向更短或更长的生成模式。

LenVM对未来强化学习训练有什么潜在价值?

LenVM作为长度特定的价值信号,可以作为未来强化学习训练的基础,支持更广泛的长度建模应用。

🏷️

标签

➡️

继续阅读