内容提要
多智能体并行虽高效,但每个智能体需独立上下文,重复阅读文件导致token成本高。自查不可靠,需独立质检。任务书应自包含且窄,验收独立派人,能串行则不并行。核心判据:任务拆分后所需背景越少越适合并行,否则协作成本高,无人掌握全局最贵。
延伸解读
并行成本的结构性来源
文章指出,多智能体并行的主要成本并非来自模型调用次数,而是每个智能体都需要独立的上下文。仓库结构、任务背景、代码风格等信息,每个智能体都要从头理解一遍,导致同一份介绍费被重复支付。此外,智能体之间无法共享已读信息,同一个文件可能被多个智能体重复读取,进一步推高token消耗。这种成本与具体模型无关,是并行架构本身固有的。
自查失效的机制与教训
作者通过实际项目发现,让产出方自查质量并不可靠。十个绘图智能体全部报告“没问题”,但独立质检却指出22张图需要重画。原因在于自查时智能体立场是“把它做好”,而质检需要“挑毛病”的立场。这类似于人类自我评估的局限,但模型不会感到为难。因此,自查环节的花费可能白费,应把预算投入到独立验收上。
任务拆分的核心判据
文章提出判断是否适合并行的关键标准:任务拆分后,每个子任务还需要多少背景知识才能开工。背景需求越多,拆分越不划算,因为需要大量共同上下文的活,由一个智能体顺序完成更便宜。相反,彼此独立、背景很薄的子任务才适合并行。这一判据帮助避免因协作成本过高而导致的资源浪费。
Q&A
为什么多智能体并行处理任务时token消耗会很高?
因为每个智能体都需要独立的上下文,包括仓库结构、任务背景、代码风格等,都要从头理解一遍。而且它们互相不知道对方看过什么,同一个文件可能被多个智能体重复读取,导致token成本成倍增加。
如何避免多智能体并行时任务书不清晰导致的返工?
任务书要自包含且窄,不要依赖智能体自己去仓库熟悉情况,而是把需要的路径和判断标准直接写进任务书,这样可以减少不必要的token消耗和误解。
为什么让AI自查质量不可靠?
因为产出方自查等于没查,就像让学生自己给自己打分一样,分数不能算数。AI模型不会觉得为难,所以会倾向于报告“没问题”,但实际上可能存在质量问题。
在什么情况下适合使用多智能体并行?
当任务拆分后每个子任务所需的背景知识很少时,适合并行。如果任务需要大量共同上下文,则串行更经济。核心判据是:任务拆分后所需背景越少越适合并行。
如何有效进行质量验收?
验收要独立派人,不要依赖干活的人自查。可以派一批专门挑毛病的agent,只改变提示词立场,从“把它做好”改为“挑毛病”,这样能发现真正的问题。
多智能体并行中,为什么说“没有人拥有全局”是最贵的?
因为每个智能体只关注自己的部分,不知道整体风格或目标,导致协作成本高,甚至可能各自为政,最终需要返工。这种缺乏全局观的情况在人类组织中叫协作成本,在AI中则体现为额外的token消耗。