One Minute Read Paper Stair Reusing Past Repairs Through Hierarchical Trajectory Abstraction For Coding Agents

💡 原文中文,约2600字,阅读约需7分钟。
📝

内容提要

STAIR框架通过分层轨迹抽象,使AI编程代理能从历史修复中学习,将经验转化为可复用计划。在SWE-bench测试中,STAIR配合开源模型达到81.2%准确率,超越商业模型。该框架存在冷启动和语言局限,但未来可应用于多领域。

🔎

延伸解读

框架设计可弥补模型差距

实验显示,STAIR配合开源模型MiniMax M2.5达到81.2%的Pass@1,超过配合GPT-5的79.2%,并与基于Claude 4.5 Opus的Sonar Foundation Agent持平。这表明在资源受限时,优化代理架构可能比追求最强模型更具性价比。消融实验也证实,多层抽象比单层或原始轨迹提升13-19个百分点,凸显了框架设计的重要性。

冷启动与成本限制

STAIR需要预先处理历史轨迹,成本约211美元(479个轨迹),新仓库在积累足够数据前无法获得有效指导。这意味着其应用依赖于组织已有的修复记录,对于历史数据不足的团队,初期投入可能较高。此外,计划质量依赖底层LLM(如GPT-5),若使用较弱模型,抽象效果可能打折。

跨语言与失败轨迹的局限

实验仅在Python代码库上进行,跨语言迁移效果未验证,因此对其他编程语言或领域的适用性尚不明确。回退分析显示约19%的情况下STAIR未能解决而基线成功,主要源于计划不完整或执行偏离。未来研究可关注失败轨迹的价值,将“什么不起作用”编码为反模式知识,以提升鲁棒性。

Q&A

STAIR框架是什么?它主要解决什么问题?

STAIR(Hierarchical Trajectory Abstraction for Coding Agents)是一个用于编码代理的框架,通过分层轨迹抽象,让AI编程代理从历史修复中学习,将经验转化为可复用计划,解决现有代理将每个issue视为独立任务、丢弃历史修复知识的问题。

STAIR框架的核心创新是什么?它是如何工作的?

核心创新是分层轨迹抽象,通过分组和抽象两个操作符,将历史修复轨迹从细粒度步骤抽象为中层策略和高层原则,形成层次化结构。框架包含四个模块:程序性知识构建、分层轨迹抽象、指导检索与计划生成、计划引导的问题解决,形成收集-抽象-检索-应用的闭环。

STAIR在SWE-bench上的表现如何?

在SWE-bench Verified上,STAIR配合开源模型MiniMax M2.5达到81.2% Pass@1,排名第一;配合GPT-5达到79.2%,与基于Claude 4.5 Opus的Sonar Foundation Agent持平。这表明框架设计可以弥补骨干模型能力的差距。

STAIR相比现有知识复用方法有哪些优势?

现有方法(如Lingxi、SWE-Exp、ExpeRepair)存在三个局限:仅从单一粒度级别表示知识、检索到的知识不针对目标issue适配、未关联相似轨迹提取模式。STAIR通过分层抽象、适配和关联,克服了这些局限,实现了更有效的知识复用。

STAIR框架有哪些局限性?

局限性包括:冷启动问题(预处理成本约211美元,新仓库需积累历史);计划质量依赖LLM(分组和抽象基于GPT-5);实验仅限于Python代码库,跨语言迁移未验证;约19%的情况下STAIR未能解决而基线解决了,主要源于计划不完整或执行偏离。

STAIR框架未来可能应用在哪些领域?

未来可应用于Web导航、数据分析、科学发现等多步推理场景;多智能体协作系统中共享层次化程序性记忆;个性化AI助手将用户偏好编码为多层次可复用知识。

🏷️

标签

➡️

继续阅读