内容提要
NaviAgent是京东提出的双层Agent架构,用于大规模工具编排。它通过“LLM规划+图导航”分离决策与工具搜索,利用动态图建模工具依赖,支持路径恢复。在API-Bank和ToolBench上,任务成功率提升13.1%,真实API测试提升4.3至12.0分,同时减少步骤和延迟,展现稳健泛化能力。
延伸解读
双层架构的实用价值
NaviAgent将LLM的交互决策与工具链搜索分离,使LLM无需直接面对数千API的搜索问题。这种设计降低了LLM的决策难度,同时通过工具图提供全局依赖关系,减少了错误累积。对于实际部署,这意味着在工具数量庞大、任务复杂的场景下,系统能更稳定地完成任务,且性能提升在复杂任务上更为显著。
动态图与路径恢复机制
TWNM不仅静态建模工具依赖,还通过历史调用记录动态更新边权,并利用执行反馈调整图结构,适应API的新增、失效或恢复。Path Recombination机制在工具调用失败时进行局部修复,而非重新规划整条链,减少了计算开销。这提示读者,动态更新和局部恢复是提升系统鲁棒性的关键设计。
实验结果的启示
在ToolBench上,NaviAgent在多个基础模型上均取得最高成功率,且任务越复杂优势越明显。消融实验显示,仅加入工具图即可将TSR从34.5%提升至45.7%,结合双层规划和搜索策略后达到55.2%。这表明显式建模工具依赖和全局规划是提升多工具任务成功率的核心因素。
Q&A
NaviAgent是什么?它主要解决什么问题?
NaviAgent是京东提出的面向Oxygen智能体的大规模工具编排框架,采用“LLM规划+图导航”的双层Agent架构。它主要解决大型语言模型在调用大量工具时缺乏全局规划、错误累积和可扩展性差的问题,通过动态图建模工具依赖关系,将工具调用从逐步决策转化为图搜索过程,实现稳定高效的工具编排。
NaviAgent的双层架构具体是如何工作的?
NaviAgent的双层架构分为规划层和执行层。规划层由LLM负责交互决策,决定是直接响应、澄清意图、检索工具链还是执行工具调用,不直接选择具体API。执行层由工具世界导航模型(TWNM)负责,通过图构建、图表示学习、图搜索和图进化,动态规划并执行工具链,实现任务规划与工具搜索的解耦。
NaviAgent在实验中取得了哪些具体成果?
在API-Bank和ToolBench上,NaviAgent的任务成功率(TSR)持续提升,其中TWNM在复杂任务上的平均提升幅度为13.1%。在涵盖7个领域的50个真实API测试中,TSR提升4.3至12.0分,同时减少了步骤数和延迟,展现了稳健的泛化能力。
NaviAgent如何处理工具调用失败或API失效的情况?
NaviAgent通过Path Recombination机制处理运行时问题。当工具调用失败时,系统利用工具图中的依赖关系进行局部修复,包括寻找等价API替换、回退至上游节点重新规划后续路径,或重新检索新的工具子图,以减少重复搜索和规划带来的计算开销,提升执行效率与稳定性。
NaviAgent的工具图是如何构建和更新的?
工具图(TWNM)将工具生态建模为异构图,包含API节点和参数节点,通过参数依赖建立连接。图构建时结合API文档的静态依赖和历史调用记录建立行为边,并初始化边权。图进化阶段,系统根据执行反馈持续更新图结构,包括接入新增API、剪枝失效API、动态调整边权,并通过指数滑动平均融合长期经验和近期反馈,使工具图在稳定性与适应性之间取得平衡。
NaviAgent相比传统ReAct模式有哪些优势?
传统ReAct模式逐步决策,缺乏全局视角,容易导致错误累积和可扩展性差。NaviAgent通过双层架构将任务规划与工具搜索解耦,利用工具图显式建模工具依赖,实现全局规划。实验表明,NaviAgent在任务成功率上显著提升,同时减少执行步骤和延迟,尤其在复杂任务上优势更明显。