一分钟读论文:《追踪错误生命周期以识别长程Agent轨迹中的关键失败》

一分钟读论文:《追踪错误生命周期以识别长程Agent轨迹中的关键失败》

💡 原文中文,约1300字,阅读约需3分钟。
📝

内容提要

清华大学与腾讯混元合作提出TrajDebug方法,将关键错误检测分为多粒度历史压缩、错误触发检测和因果归因三阶段,解决长程轨迹中定位关键失败步骤的难题。该方法在诊断驱动的Agent改进中成功率提升10.80%,失败记忆迁移提升5.70%,优于现有基线。

🔎

延伸解读

关键错误不等于首个错误

论文指出,长程轨迹中平均包含7.62个局部错误,但只有1个是关键错误,且61.9%的局部错误会被后续修复。这意味着简单依赖“最早出现”或“最明显”的错误来定位失败原因并不可靠。TrajDebug通过区分错误状态(如已解决、活跃)和因果归因,帮助开发者避免被表面错误误导,聚焦真正导致最终失败的步骤。

三阶段流程的实践意义

TrajDebug将关键错误检测分解为多粒度历史压缩、错误触发检测和因果归因三个阶段。这种设计不仅压缩了长轨迹的上下文,还通过逐字证据条件减少幻觉诊断。对于开发者而言,这种结构化方法可复用到不同Agent系统,提升调试效率,尤其适用于轨迹长达数百步的复杂任务。

诊断结果的可迁移性

实验显示,将失败轨迹的诊断转化为针对性引导后,同一任务成功率提升10.80%;而将历史失败诊断聚合为失败记忆并迁移到新任务,成功率提升5.70%。这表明错误诊断不仅有助于修复当前问题,还能沉淀为可复用的经验,提升Agent在未见任务上的表现,具有实际应用价值。

Q&A

TrajDebug方法的核心目标是什么?

TrajDebug的核心目标是在长程Agent轨迹中自动定位导致最终失败的关键错误步骤,帮助开发者更高效地诊断和改进智能体系统。

TrajDebug将关键错误检测分解为哪三个阶段?

TrajDebug将关键错误检测分解为三个递进阶段:多粒度历史压缩、错误触发检测与状态分类、候选集引导的因果归因。

TrajDebug如何解决长轨迹中上下文压缩与证据保留的矛盾?

TrajDebug通过多粒度历史压缩为每个轨迹步骤构建高、中、低三种细节视图,按需检索最细粒度视图,在压缩远距离上下文的同时保留可验证证据。

TrajDebug中错误状态分类有哪四种?

TrajDebug将错误实例分为四种状态:Clean Resolution(已解决无印记)、Costly Resolution(已解决有预算债务)、Manifest Active(活跃有不可逆印记)和Latent Active(活跃无印记)。

TrajDebug在实验中取得了哪些具体成果?

TrajDebug在诊断驱动的Agent改进中成功率提升10.80%,失败记忆迁移提升5.70%,优于现有基线。

TrajErrBench基准测试包含哪些内容?

TrajErrBench包含486条手动标注的失败轨迹,其中400条来自工具使用场景(平均29.3步),86条来自编码场景(平均119.7步),由三名标注员独立标注,多数投票作为标准答案。

长程轨迹中定位关键错误步骤的主要困难是什么?

主要困难包括:长轨迹中个体错误的识别需要追溯到遥远的任务指令和环境反馈;失败轨迹中通常存在多个局部错误,有些被修复或无害,只有部分真正导致最终失败,且关键错误不一定是第一个出现的局部错误。

🏷️

标签

➡️

继续阅读