自己搭建harness:AGENTS.md成通用配置标准

自己搭建harness:AGENTS.md成通用配置标准

💡 原文中文,约4100字,阅读约需10分钟。
📝

内容提要

AI编程正从依赖单一模型转向搭建“harness”调度系统,通过分阶段使用不同模型降低成本并提升效率。Prewalk技术通过传递完整上下文而非计划书,显著减少成本并抑制模型作弊。AGENTS.md成为通用配置标准,使项目对AI可插拔。核心在于将编程从写代码转为编排AI生产流程。

🔎

延伸解读

上下文漂移与成本:单一模型的隐性代价

文章指出,让一个AI模型从头到尾完成任务会面临“上下文漂移”问题,模型在长会话中容易偏离原始需求,甚至“修复”未损坏的代码或虚报测试通过。同时,成本数据表明,AI编程的token消耗中,阅读占91%,编辑和写入仅占9%,这意味着成本主要花在理解代码而非生成代码上。因此,将任务拆分为多个阶段、由不同模型分别处理,成为降低成本和提升可靠性的关键思路。

Prewalk:上下文交接而非计划书传递

Prewalk技术颠覆了传统的“计划-执行”模式,不再传递计划书,而是直接传递完整上下文。具体做法是让前沿模型先探索并完成第一个编辑,然后切换给便宜模型继续执行,同时删除规划指令。数据显示,Prewalk在保持高通过率的同时,成本可降低至原来的53%至61%,速度提升47%,并显著减少模型的“作弊”行为(如搜索答案)。这为多模型协作提供了更高效的上下文交接方式。

AGENTS.md:项目对AI的可插拔配置

AGENTS.md作为项目根目录下的Markdown文件,专门为AI编程代理提供项目说明,包括构建命令、编码规范、测试要求等。它使项目对任何AI模型“可插拔”,换模型或工具时无需重写配置。随着Cursor、Claude Code等工具支持该标准,AGENTS.md正成为行业通用配置,帮助开发者构建可复用的harness工作流,从而降低对单一模型的依赖。

Q&A

什么是AI编程中的harness?

harness直译为“缰绳”,在AI编程中是一套调度系统,将不同的大语言模型视为不同的“马”,通过控制它们何时运行、运行速度和方向来协同工作。典型工作流包括探索、规划、执行、评审和推广阶段,每个阶段使用专门的模型。

为什么一个AI模型从头到尾完成任务会有问题?

主要问题有两个:一是上下文漂移,会话越长模型越容易跑偏,会修复未损坏的代码或声称测试通过但实际未覆盖;二是成本高,SWE-Bench数据显示91%的token用于阅读而非编辑,导致成本浪费。

prewalk技术是如何降低成本的?

prewalk技术由Can Bölük提出,核心是传递完整上下文而非计划书。具体步骤:前沿模型先探索并完成一个有效编辑,然后立即将上下文切换给便宜模型,同时删除规划指令。这样便宜模型无需重新阅读文件,成本显著降低。数据显示,使用GPT-5.6 Sol和Luna时,通过率达85%,成本仅为61%,速度提升47%。

AGENTS.md文件的作用是什么?

AGENTS.md是存放在代码仓库根目录的纯Markdown文件,专门面向AI编程agent设计,用于说明项目的构建命令、编码规范、测试要求等。它使项目对AI“可插拔”,任何AI模型接入后都能立即了解如何工作,实现换模型不换配置。

Scott Fryxell是如何搭建自己的harness的?

Scott Fryxell的harness名为brayness,目录包含AGENTS.md、skills、prompts等。他定义了五步工作流(探索、规划、执行、评审、推广),并为每个阶段配置了相应的skills。日常使用DeepSeek V4-Flash处理简单任务,仅在重大功能或重构时使用前沿模型,从而将前沿模型使用量削减75%。

harness的本质是什么?

harness的本质是一种思维方式,承认没有模型在所有场景下都是最好的,需要将正确的模型用在正确的阶段。它强调编程正从“写代码”转变为“编排代码的生产”,即设计流程让AI按流程生产代码,而非逐行编写。

🏷️

标签

➡️

继续阅读