内容提要
Databricks推出自适应指令检索器,结合并行与顺序搜索,根据查询复杂度动态调整步骤,平衡质量与延迟。训练采用在线强化学习,优化步骤惩罚,实现2倍低延迟且性能媲美顶级模型,适用于企业数据代理场景。
延伸解读
自适应机制的核心:动态决定搜索步数
该检索器通过在线强化学习(ORL)训练,在质量与延迟之间取得平衡。它设定最大步数上限,并根据查询复杂度动态决定是否提前停止或继续搜索。简单查询快速返回,复杂多跳问题则利用更多步骤迭代推理,从而在保证质量的同时控制成本。
质量-延迟前沿:可调节的权衡
通过调整ORL中的步数惩罚强度,可以训练出一系列检查点,形成质量-延迟前沿。较轻的惩罚允许更多步骤以提升质量,较重的惩罚则降低延迟。用户可根据实际工作负载(如交互式应用或离线任务)选择最合适的检查点,实现灵活部署。
小模型的竞争力与实用价值
该模型为小型定制模型,却能在多步推理任务中媲美大型第三方模型,且延迟降低2倍。这展示了小模型在特定任务上的潜力。同时,训练方法基于Databricks的AI Runtime,客户可借鉴此方法开发自己的领域专用模型,提升数据代理的检索效率。
Q&A
什么是自适应指令检索器?
自适应指令检索器是Databricks推出的一种检索模型,它结合了并行检索的速度和顺序搜索的性能,根据查询的复杂度动态调整搜索步骤,以在保证质量的同时降低延迟。
自适应指令检索器相比单步检索有什么优势?
相比单步检索,自适应指令检索器在复杂多跳问题上能通过顺序搜索提高检索质量,同时在简单问题上提前停止以减少延迟,整体性能显著优于单步检索。
自适应指令检索器是如何训练的?
它使用在线强化学习(ORL)训练,优化目标为平衡轨迹质量和搜索成本,通过调整步骤惩罚来控制模型在何时采取额外搜索步骤。训练数据包括合成企业检索环境和多跳问题,并利用AI Runtime(AIR)进行训练。
自适应指令检索器的延迟和性能表现如何?
在基准测试中,自适应指令检索器在保持与领先第三方模型(如Claude Sonnet 5、GPT-5.6 Luna)相当性能的同时,实现了2倍更低的延迟,平均端到端延迟为5.8秒。
如何调整自适应指令检索器的质量与延迟权衡?
通过改变在线强化学习中的步骤惩罚大小,可以训练出一系列检查点,每个检查点对应不同的质量-延迟权衡。用户可以根据生产工作负载选择最合适的检查点,例如交互式应用偏向速度,离线任务偏向质量。
自适应指令检索器适用于哪些场景?
它适用于企业数据代理,如Databricks的Genie Code、Genie One和Genie Agents,这些场景需要在大型动态工作区中快速找到正确的表格、笔记本、仪表板和文档,同时控制延迟。