一分钟读论文:《Do Agent Optimizers Compound?Agent优化收益能否持续累积》

一分钟读论文:《Do Agent Optimizers Compound?Agent优化收益能否持续累积》

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

RELAI团队首次系统评估Agent优化在持续学习中的累积能力,基于Terminal-Bench 2.0构建两阶段框架,对比三种方法。结果显示仅内置回归控制的RELAI-VCL实现正向迁移,得分76.4%,远超基线58.7%。回归控制如早停,防止过拟合,是Agent系统基础组件,决定能力提升而非数据捷径,跨分布测试对评估至关重要。

🔎

延伸解读

单轮评估的盲区

传统单轮评估只在固定任务集上训练一次,无法判断优化收益能否累积。本文的两阶段框架揭示,GEPA和Meta Harness在第一阶段表现良好,但第二阶段显著下滑,说明它们可能过拟合了训练分布。这提醒我们,只看单轮指标可能高估Agent的真实能力,跨分布测试是识别过拟合的关键。

回归控制:防过拟合的基石

RELAI-VCL通过内置回归控制(类似早停)实现正向迁移,而其他方法因缺乏此机制而性能退化。这表明回归控制不是可选技巧,而是Agent优化的基础组件。它防止优化器在有限数据上追求局部最优,从而牺牲泛化能力。没有它,优化可能沦为数据捷径的陷阱。

性能差距的启示

RELAI-VCL最终得分76.4%,比基线58.7%高出近20个百分点,凸显了正确归纳偏置的价值。但需注意,结果基于Terminal-Bench 2.0,可能不完全代表所有场景。部署Agent时,应重视持续学习评估,并考虑内置回归控制以提升长期稳定性。

Q&A

Agent优化收益能否在持续学习中累积?

根据RELAI团队的论文,只有内置回归控制的方法(如RELAI-VCL)能实现正向迁移和持续改进,最终得分76.4%,而其他方法出现性能下降,因此Agent优化收益并非自动累积,需要正确的归纳偏置。

单轮静态评估有哪些局限性?

单轮静态评估无法回答优化是否具有累积效应,因为每次从相同分布采样数据重新训练,无法观察性能随经验的变化;同时掩盖了过拟合风险,优化器可能学会针对特定数据集的捷径策略而非泛化能力。

RELAI团队如何设计持续学习评估框架?

他们基于Terminal-Bench 2.0构建两阶段框架:第一阶段用训练集对Agent优化方法进行训练和优化,第二阶段在新任务子集上测试泛化能力,观察性能是提升还是退化。

GEPA和Meta Harness在第二阶段表现如何?

GEPA从第一阶段的68.3%下降到第二阶段的59.1%,Meta Harness从65.7%降至57.2%,均出现超过8个百分点的性能滑坡,表明它们过度拟合了第一阶段的训练分布。

回归控制在Agent优化中起什么作用?

回归控制类似于早停策略,当检测到过拟合时自动回退到更泛化的表示,为Agent优化提供关键归纳偏置,防止优化器在有限数据上追求局部最优而牺牲长期泛化能力。

为什么说回归控制是Agent系统的基础组件?

因为实验显示只有内置回归控制的RELAI-VCL能实现正向迁移,而其他方法出现性能下降,说明回归控制决定了优化是走向真正能力提升还是陷入数据捷径,是基础组件而非可选技巧。

RELAI-VCL在两个阶段的具体得分是多少?

RELAI-VCL在第一阶段达到72.1%,第二阶段提升至76.4%,展现了稳定的正向迁移效应。

对Agent部署实践有哪些启示?

评估Agent能力时不能仅看单轮指标,必须引入跨分布的持续学习测试来检测过拟合风险;回归控制应作为基础组件,正确的归纳偏置可带来近20个百分点的性能提升。

🏷️

标签

➡️

继续阅读