自适应指令检索器:以2倍更低延迟实现前沿质量搜索

自适应指令检索器:以2倍更低延迟实现前沿质量搜索

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

Databricks推出自适应指令检索器,结合并行与顺序搜索,根据查询复杂度动态调整步骤,平衡质量与延迟。训练采用在线强化学习,优化步骤惩罚,实现2倍低延迟且性能媲美顶级模型,适用于企业数据代理场景。

🔎

延伸解读

自适应机制的核心:动态决定搜索步数

该检索器通过在线强化学习(ORL)训练,在质量与延迟之间取得平衡。它设定最大步数上限,并根据查询复杂度动态决定是否提前停止或继续搜索。简单查询快速返回,复杂多跳问题则利用更多步骤迭代推理,从而在保证质量的同时控制成本。

质量-延迟前沿:可调节的权衡

通过调整ORL中的步数惩罚强度,可以训练出一系列检查点,形成质量-延迟前沿。较轻的惩罚允许更多步骤以提升质量,较重的惩罚则降低延迟。用户可根据实际工作负载(如交互式应用或离线任务)选择最合适的检查点,实现灵活部署。

小模型的竞争力与实用价值

该模型为小型定制模型,却能在多步推理任务中媲美大型第三方模型,且延迟降低2倍。这展示了小模型在特定任务上的潜力。同时,训练方法基于Databricks的AI Runtime,客户可借鉴此方法开发自己的领域专用模型,提升数据代理的检索效率。

Q&A

什么是自适应指令检索器?

自适应指令检索器是Databricks推出的一种检索模型,它结合了并行检索的速度和顺序搜索的性能,根据查询的复杂度动态调整搜索步骤,以在保证质量的同时降低延迟。

自适应指令检索器相比单步检索有什么优势?

相比单步检索,自适应指令检索器在复杂多跳问题上能通过顺序搜索提高检索质量,同时在简单问题上提前停止以减少延迟,整体性能显著优于单步检索。

自适应指令检索器是如何训练的?

它使用在线强化学习(ORL)训练,优化目标为平衡轨迹质量和搜索成本,通过调整步骤惩罚来控制模型在何时采取额外搜索步骤。训练数据包括合成企业检索环境和多跳问题,并利用AI Runtime(AIR)进行训练。

自适应指令检索器的延迟和性能表现如何?

在基准测试中,自适应指令检索器在保持与领先第三方模型(如Claude Sonnet 5、GPT-5.6 Luna)相当性能的同时,实现了2倍更低的延迟,平均端到端延迟为5.8秒。

如何调整自适应指令检索器的质量与延迟权衡?

通过改变在线强化学习中的步骤惩罚大小,可以训练出一系列检查点,每个检查点对应不同的质量-延迟权衡。用户可以根据生产工作负载选择最合适的检查点,例如交互式应用偏向速度,离线任务偏向质量。

自适应指令检索器适用于哪些场景?

它适用于企业数据代理,如Databricks的Genie Code、Genie One和Genie Agents,这些场景需要在大型动态工作区中快速找到正确的表格、笔记本、仪表板和文档,同时控制延迟。

🏷️

标签

➡️

继续阅读