AI 范式雷达:《不再调权重:Agent 的自进化搬进了 Harness》

AI 范式雷达:《不再调权重:Agent 的自进化搬进了 Harness》

💡 原文中文,约6200字,阅读约需15分钟。
📝

内容提要

三篇论文提出Agent自进化新方向:从模型权重转向外部执行框架(Harness)。Recuris通过三层记忆架构和结构化证据实现组件级修补,在τ²-Bench上提升显著;StarHarness用分层搜索优化prompt和工具接口;SkillForge验证技能质量。核心模式是“结构化证据+组件级修补+验证门”,但依赖可验证环境,迁移有条件,归因准确率有限。

🔎

延伸解读

范式转移的驱动力:工程约束而非模型能力

三篇论文的共同点是将自进化从模型权重转移到外部执行框架,核心驱动力是成本、可回滚性和归因精度。权重更新全局性强、成本高且难以回滚,而Harness层修改局部、可验证。Recuris的归因准确率从二值信号的13.0%提升到结构化轨迹的64.8%,说明记录过程是有效进化的前提。

验证门是进化的安全阀

三篇论文都强调验证机制:Recuris用开发集锚点任务防回退,StarHarness用隐藏选择集和留出集,SkillForge用成功率和使用次数。验证门能挡住回退,但无法保证补丁有效,因为归因准确率有限。生产环境若无程序化验证器,整个循环可能退化为无监督自我修改,风险需警惕。

迁移性证据需谨慎解读

Recuris的跨模型迁移仅在SkillFlow基准上验证,且无留出任务集;StarHarness的跨模型迁移限于三个企业基准。将“跨GPT/Qwen可迁移”泛化为“到处可迁移”超出证据范围。此外,Recuris在Terminal-Bench的置信区间包含零,统计强度有限,评估时应关注样本量和任务多样性。

落地实践:从四元组轨迹到最小验证器

论文收敛出的最小可行模式包括:记录结构化轨迹(状态、技能、动作、观测)、归因到组件、验证门控提交、预算对齐对照。其中验证器是前置条件,没有程序化验证器则验证门失效。建议先积累失败样本,为关键任务编写断言式验证器,再逐步引入自动修补。

Q&A

什么是Agent自进化中的Harness?

Harness(执行外壳)是包裹在LLM外部的执行框架,负责记忆管理、技能调用、任务状态跟踪、工具交互和结果验证,模型本身只是其中的推理引擎。

为什么Agent自进化要从模型权重转向Harness层?

因为权重层进化存在三个工程痛点:成本高(每轮改进都要训练)、不可回滚(权重更新全局性,改坏只能重训)、归因难(非结构化日志归因准确率仅53.5%)。Harness层进化将改进对象从模型参数换成外部记忆与接口,绕开了这些问题。

Recuris的三层记忆架构是什么?

Recuris的三层记忆架构包括:工作记忆(跟踪当前任务进度,是结构化状态对象)、经验记忆(持久存储跨任务经验,用于技能调用检索)、技能记忆(可被进化的技能模板,是唯一允许被Meta-Agent修改的组件)。

Recuris在τ²-Bench上取得了什么效果?

在τ²-Bench Retail上,Claude Opus 5从72.4%提升到87.9%(+15.6),GPT-5.6 Sol从58.3%提升到76.1%(+17.8),比不用Recuris的最佳模型高9.7个点。

StarHarness的进化对象包括哪些?

StarHarness的进化对象包括prompt与任务框架、工具接口、技能、MCP provider、子Agent结构和agent loop配置。

SkillForge与SkillRL的主要区别是什么?

SkillForge让RL直接优化技能调用决策本身,并为每个技能跟踪成功率与使用次数,聚合出低效分数触发反思式修订,而SkillRL把技能库当只追加仓库,从不验证已存技能是否有效。

Harness自进化依赖哪些边界条件?

依赖可验证环境(有程序化验证器),迁移有条件(跨模型迁移不等于跨任务迁移),统计强度有限(部分结果置信区间包含零),归因准确率有上限(64.8%),且与权重层路线是分工关系而非替代。

如何将Harness自进化落地到生产环境?

最小可行模式包括:记录结构化轨迹(每步存状态、技能、动作、观测四元组);失败归因到组件(用小模型或规则映射到具体组件);验证门控提交(修改必须在留出集上修复目标失败且不回退锚点任务);预算对齐的对照(控制重试预算)。

🏷️

标签

➡️

继续阅读