不换模型,效果提升104%!上海AI Lab让Harness也能自进化了

不换模型,效果提升104%!上海AI Lab让Harness也能自进化了

💡 原文中文,约2700字,阅读约需7分钟。
📝

内容提要

上海AI实验室提出Self-Harness方法,使AI能自动改进自身Agent外层装置。通过分析失败轨迹、提出有界修改并回归测试,在Terminal-Bench-2.0上显著提升模型性能(如Qwen3.5提升104%),实现Harness的可搜索、验证和迭代,减少人工调参依赖。

🔎

延伸解读

Self-Harness的核心:回归测试门控

Self-Harness的关键在于其保守的接受规则:候选修改必须在held-in或held-out至少一个split上提升,且另一个split不能退化,才会被采纳。这种设计避免了模型凭感觉修改,而是将每次改动置于可记录、可复现、可回退的评测闭环中,确保改进是真实有效的,而非盲目堆叠提示词。

不同模型,不同失败模式

实验显示,不同模型在初始Harness下暴露的弱点各异:MiniMax M2.5常因探索过久未创建产物而失败,Qwen3.5-35B-A3B易陷入重复命令循环,GLM-5则对shell会话状态切换不敏感。Self-Harness针对这些具体问题生成定制化修改,而非使用通用提示,体现了其适应性和针对性。

Harness工程从经验走向自动化

传统Harness依赖工程师手动调参,难以扩展。Self-Harness将流程压缩为三步:挖掘失败模式、提出有界修改、回归测试验证。这标志着Harness工程从经验驱动转向数据驱动,让模型自身参与改进,同时保持人类可控的边界,为多模型、多任务场景提供了可扩展的解决方案。

Q&A

Self-Harness是什么?它主要解决什么问题?

Self-Harness是上海AI实验室提出的一种方法,让AI能够自动改进自身的Agent Harness(外层装置)。它主要解决传统上Harness依赖工程师手动调参、难以扩展的问题,通过自动分析失败轨迹、提出修改并回归测试,实现Harness的自我进化。

Self-Harness的工作流程是怎样的?

Self-Harness的工作流程分为三步:首先,系统让当前Harness驱动固定模型完成任务,记录执行轨迹和失败样本,并分析失败机制;其次,模型作为proposer针对失败机制提出有边界的Harness修改建议;最后,候选Harness在相同评测协议下重跑,与当前Harness对比,只有通过回归测试(held-in或held-out至少一个提升,另一个不退化)的修改才会被采纳。

Self-Harness在Terminal-Bench-2.0上的实验结果如何?

在Terminal-Bench-2.0上,固定模型、工具环境和评测协议不变,只修改Harness,三个模型都取得了提升:MiniMax M2.5总提升28%,Qwen3.5-35B-A3B总提升104%,GLM-5总提升24%。

Self-Harness与普通的自动修改prompt有什么不同?

Self-Harness与普通自动修改prompt的区别在于,它不让模型凭感觉拍板,而是将每一次改动都放入可记录、可复现、可回退的评测闭环中。每个候选修改都经过held-in和held-out回归测试,只有真正带来收益且没有明显回退的修改才会被保留,而不是盲目堆砌更长的提示词。

Self-Harness如何针对不同模型进行个性化改进?

Self-Harness通过分析每个模型在真实轨迹中暴露出的弱点,生成并筛选适合该模型的Harness改动。例如,MiniMax M2.5的修改鼓励更早识别必需输出并创建初始产物;Qwen3.5-35B-A3B的修改引入依赖预检查、失败后产物恢复和避免重复命令;GLM-5的修改提醒确认环境变量跨命令持续可用,并在长时间探索后推动转向实现。

Self-Harness的局限性是什么?

Self-Harness没有证明Agent可以完全自己进化,也没有绕过benchmark范围。论文中的结果主要来自Terminal-Bench-2.0和固定模型后端,因此其泛化性可能有限。

🏷️

标签

➡️

继续阅读