套利:通过优势感知投机实现高效推理

套利:通过优势感知投机实现高效推理

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

ARBITRAGE是一种新型步骤级投机生成框架,通过轻量级路由器动态选择草稿模型或目标模型生成的推理步骤,以近似最优效率-准确性权衡。相比传统令牌级和现有步骤级方法,它减少不必要的拒绝和重生成,在数学推理基准上推理延迟降低约2倍,同时保持匹配的准确性。

🔎

延伸解读

步骤级投机生成的优势

传统令牌级投机解码在推理任务中常因语义等价但令牌不同的步骤被拒绝而浪费计算。ARBITRAGE将验证单位从令牌提升到整个推理步骤,通过接受或拒绝完整步骤来减少不必要的重生成,从而在数学推理等任务中更高效地利用目标模型的计算资源。

动态路由机制

ARBITRAGE的核心是一个轻量级路由器,它预测草稿模型与目标模型生成步骤的相对优势,并据此动态选择更优的步骤。与固定接受阈值不同,这种路由方式近似理想情况下的最优选择,实现了接近最优的效率与准确性权衡,避免了固定策略在复杂推理中的局限性。

推理延迟的显著降低

在多个数学推理基准上,ARBITRAGE相比现有步骤级投机解码方法,在保持匹配准确性的同时,将推理延迟降低约2倍。这一改进主要源于减少了被拒绝步骤的重生成,使得目标模型的计算资源更集中于真正需要改进的步骤,从而提升了整体推理效率。

Q&A

ARBITRAGE是什么?它如何提高推理效率?

ARBITRAGE是一种新型步骤级投机生成框架,通过轻量级路由器动态选择草稿模型或目标模型生成的推理步骤,以近似最优效率-准确性权衡。相比传统令牌级和现有步骤级方法,它减少不必要的拒绝和重生成,在数学推理基准上推理延迟降低约2倍,同时保持匹配的准确性。

ARBITRAGE与传统的令牌级投机解码有何不同?

传统的令牌级投机解码在推理任务中因语义等价步骤的令牌不匹配而导致不必要的拒绝,效率低下。ARBITRAGE采用步骤级语义验证,接受或拒绝整个推理步骤,并通过路由器动态选择更优步骤,减少浪费。

ARBITRAGE中的路由器是如何工作的?

ARBITRAGE使用一个轻量级路由器,训练来预测目标模型是否可能产生更有意义的步骤。它根据草稿模型和目标模型之间的相对优势动态路由生成,而不是使用固定的接受阈值,从而近似理想ORACLE的选择。

ARBITRAGE在哪些基准上进行了评估?结果如何?

ARBITRAGE在多个数学推理基准上进行了评估,一致优于先前的步骤级投机解码基线,在匹配准确性的情况下,推理延迟降低约2倍。

ARBITRAGE的ORACLE是什么?它有什么作用?

ARBITRAGE ORACLE是一个理想化的选择器,总是选择草稿模型和目标模型中质量更高的步骤。ARBITRAGE通过路由器近似这个ORACLE,实现接近最优的效率-准确性权衡。

ARBITRAGE相比现有步骤级方法有什么优势?

现有步骤级方法仍会重新生成许多被拒绝的步骤,改进有限,浪费目标计算。ARBITRAGE通过动态路由减少不必要的拒绝和重生成,从而更高效地利用目标模型的计算资源。

🏷️

标签

➡️

继续阅读