内容提要
DarwinX提出一种自我改进agent方法:冻结模型权重,仅进化外部“外壳”(提示、工具、控制流等)。通过群体选择,子代须在至少一任务上变好且不显著退化父代能力,避免单线搜索的路径依赖和局部退化。实验显示四档基准平均提升约17点,跨benchmark迁移仍有正收益,但未做隔离消融,算力成本未报告。
延伸解读
准入条件:把“不许倒退”变成硬门槛
DarwinX 的核心机制不是让模型自我改进,而是把“不退化”写进进化准入条件:子代必须至少在一项任务上变好,且父代已解决的任务上损失不超过容差 δ。这改变了自我改进的评估方式——回退不再是事后统计,而是被直接挡在门外。这种设计避免了单线搜索中“局部胜利换全局退化”的常见问题,但也意味着每次提案都要跑保存性探测,回退率越高,算力成本越大。
四档基准:进化信号与测试的距离决定可信度
论文按“进化信号与测试之间的距离”设计了四档实验,从同题打分到跨 benchmark 迁移。第一档 Terminal-Bench 2.1 是纯 in-domain,只证明循环能跑;第二档 TerminalWorld 用留出题验证泛化;第三档 WebArena-Infinity 任务分布和奖励来源同时变,缺口最宽;第四档把第一档进化出的壳搬到 SWE-bench Verified,仍获正收益。四档平均涨约 17 点,但作者明确区分了域内结论与迁移靶子,第四档的 3.4 点正收益才说明学到的是通用能力而非补丁。
未做隔离消融:17 点提升的来源无法归因
作者自认没有做隔离消融:archive、父代选择器、重组算子、推理预算等至少四个可独立开关的部件,都未单独随机化,最后只报了合起来的效果。因此那 17 点提升里,究竟是“不许回退”这道门起的作用,还是单纯多跑了几十次提案,目前无法分开。此外,TerminalWorld 只有 41 道题,一道题就动 2.4 个点,McNemar 检验 p=0.45,作者也写明是提示性而非决定性。
Q&A
DarwinX的核心思想是什么?
DarwinX提出一种自我改进agent的方法,核心是冻结模型权重,只进化外部“外壳”(包括提示、工具、控制流等),通过群体选择和准入规则实现能力提升,避免单线搜索的路径依赖和局部退化。
DarwinX如何避免单线搜索的路径依赖和局部退化?
DarwinX采用群体选择,同时维护多个变体,每个变体独立进化并记录成绩。子代必须满足两个条件:至少在一个任务上变好,且在父代已解决的任务上退化不超过容差。这样避免了单线搜索中因路径依赖和局部胜利导致的全局退化。
DarwinX中的“外壳”包括哪些部分?
外壳包括提示、工具、笔记和控制流等,分为skill(提示、记忆、蒸馏知识)和code(工具、控制流、agent循环)两部分,共用一套编辑接口。
DarwinX在Terminal-Bench 2.1上的表现如何?
在Terminal-Bench 2.1的88道题中,36道变好、43道不变、9道变差,整体从75.5%提升到83.2%,涨7.7点。
DarwinX在跨benchmark迁移中的表现如何?
将第一档进化出的外壳迁移到SWE-bench Verified的500道题上,获得421/500(84.2%)的pass@1,比参照的80.8%高3.4点,表明迁移后仍有正收益,说明学到了一些通用能力。
DarwinX的编辑信号来源有哪些?
三种来源:失败信号(从失败轨迹归纳结论)、教师信号(蒸馏参照求解器的成功轨迹)、自省信号(对比自身通过与失败的rollout)。教师信号只在agent从未跑通的任务上使用。
DarwinX的局限性有哪些?
局限性包括:没有做隔离消融,无法确定各部件贡献;TerminalWorld测试集小,结果提示性而非决定性;有效性审计非形式化;选择上限受提案多样性限制;算力成本未报告。