AI 范式雷达:《外壳走上台前:Agent 的竞争从换模型转向换 Harness》

AI 范式雷达:《外壳走上台前:Agent 的竞争从换模型转向换 Harness》

💡 原文中文,约2500字,阅读约需6分钟。
📝

内容提要

FrontierHarness Eval评测显示,同一模型下不同执行外壳的任务通过率差异达16.7%,成本相差17倍,竞争焦点从模型转向外壳基准化。厂商如DeepSeek推出可插件化Harness,arXiv出现相关基准。但外壳非万能,存在供应链攻击风险,且商业应用中工具选择率低。未来需关注模型与外壳耦合效应及版本化公开。

🔎

延伸解读

外壳差异的实际影响

评测显示,同一模型下不同外壳的任务通过率差异达16.7个百分点,成本相差17倍。这意味着在模型权重不变的情况下,仅更换外壳就能显著影响性能和成本。对于实际应用,选择合适的外壳可能比升级模型更具性价比,但需注意评测范围有限,且评测方本身是厂商,结果外推需谨慎。

插件化带来的安全风险

DeepSeek等厂商推出可插件化Harness,强调灵活性,但论文指出攻击者可通过控制hook更新来操纵agent harness。这种“一切皆插件”的设计在提升可组合性的同时,也引入了供应链攻击的入口。企业在采用此类架构时,需重视组件来源的信任与验证,防范潜在的安全威胁。

工具选择率低的启示

实测数据显示,多个coding agent的同工具选择率仅42%,Claude Code的造轮子比例达19%。这表明在实际商业应用中,agent对现有工具的利用并不充分,可能增加开发成本与风险。用户在选择agent时,应关注其工具调用能力,而不仅仅是模型性能。

Q&A

FrontierHarness Eval 评测得出了什么结论?

该评测显示,在相同模型(如 Kimi K3)和运行时下,不同执行外壳的任务通过率最高 66.7%、最低 50.0%,每任务成本相差 17 倍。这表明竞争焦点正从模型选择转向外壳的基准化。

为什么说换外壳可能比换模型更便宜?

因为评测显示,在模型权重冻结时,仅更换外壳就能带来显著的成本差异,例如每任务成本从 Exo Harness 的 $1.05 到 Claude Code 的 $18.34,相差 17 倍。因此,优化外壳可能比更换模型更具成本效益。

DeepSeek Harness 有什么特点?

DeepSeek Harness 于 8 月 13 日发布 developer preview,其特点是“一切皆插件”,模型、工具、沙箱、UI 均可替换;还提供 Minimal mode,仅保留 shell 与编辑器,用于最小环境评测。

arXiv 上出现了哪些以 harness 为评测单元的基准?

出现了 HarnessDev 和 CordisBench。HarnessDev 将评估单元从任务输出改为可运行基础设施,考核 LLM 能否自建并进化 harness;CordisBench 用 1,200 道题考组件生命周期推理,发现组件越多模型越不可靠。

Grep beats LSP 实验说明了什么?

实验表明,在检索后端不变的情况下,仅在返回结果中附加源码文本,多文件重命名 pass@1 从 0.67 升到 0.83,后续读取次数从 15.2 次降到 3.2 次。这提示简单的上下文增强可能显著提升 agent 性能,但作者自注是小规模试点信号。

为什么说 harness 不是万能的?

因为仅靠 harness 工程产不出可靠软件工厂,上下文质量、任务分解与人类意图表达仍是瓶颈;此外,攻击者控制的 hook 更新可操纵 agent harness,带来供应链攻击风险;商业应用中工具选择率低,如 Armature 实测同工具选择率仅 42%。

未来需要关注哪些信号?

需要关注三个信号:FrontierHarness 是否扩展到第二个模型以检验 harness 与模型的耦合效应;OpenAI 与 Anthropic 是否跟进版本化公开外壳与 harness 级 changelog;以及模型训练是否开始把 harness 构建能力回填进权重。

🏷️

标签

➡️

继续阅读