内容提要
企业常误以为接入AI Agent就拥有核心能力,但模型只负责行动,判断对错依赖反馈基础设施。Agent面临可追踪、可判定、可归因、可修正四个问题,过去靠专家经验,未形成系统能力。企业须将专家工作流外化为可验证、可恢复的反馈链路,否则赋予Agent更多权限只会扩大其猜测范围。
延伸解读
反馈基础设施:Agent 自主性的真正瓶颈
文章指出,企业常误以为接入 AI Agent 就获得核心能力,但模型只负责行动,判断对错依赖反馈基础设施。Agent 面临可追踪、可判定、可归因、可修正四个问题,过去靠专家经验,未形成系统能力。没有反馈基础设施,赋予 Agent 更多权限只会扩大其猜测范围。因此,企业须将专家工作流外化为可验证、可恢复的反馈链路,否则 Agent 的自主性将受限于组织存量能力。
从专家经验到系统能力:反馈链路的构建
文章强调,反馈基础设施不是一套新平台,而是将分散在测试、发布、可观测性、数据、灰度等系统中的事实围绕一次行动形成连续链路。专家工作流的外化,需要明确依据什么信号发现异常、如何区分事实与推测、用什么实验排除解释、根据什么标准决定保留或放弃。这要求企业将隐性的判断条件显性化,变成 Agent 必须面对的验收契约,同时保留不确定性,允许系统给出“证据不足”的反馈。
可观测不等于可判断:评估器的局限
文章提醒,日志、指标、调用链和评估分数让系统更可观测,但不会自动变成反馈。评估器只能执行已被明确表达、能够机械执行的判断,无法替代组织决定阈值和发现未写进标准的风险。如果评估标准错误,Agent 会稳定地走向错误目标。好的反馈应说明观察来源、覆盖范围、能支持什么判断、还不能证明什么,以及下一步如何验证,从而用可靠证据约束 Agent 的下一步判断。
自主权的边界:可验证性与可恢复性
文章认为,Agent 的自主程度不取决于企业给多少权限,而取决于企业能多快证明它错了并恢复错误。权限只决定动作执行到哪里,真正限制自主权的是错误能否被及时发现、原因能否定位、影响能否控制、结果能否恢复。人在回路中若只看到结论,审批易流于形式。企业能稳定交给 Agent 的,只能是那些自己已经知道如何定义、观察、验证和恢复的工作。
Q&A
为什么说没有反馈基础设施,Agent 只是一个有权限的猜测者?
因为模型只负责行动,判断对错依赖反馈基础设施。没有反馈基础设施,Agent 无法知道自己做了什么、结果是否符合目标、变化是否由自己引起、下一步该验证什么,即使能调用工具,也只是在执行猜测,而权限只会扩大猜测的影响范围。
Agent 面临的四个反馈问题具体指什么?
四个问题分别是:可追踪(是否知道自己做了什么)、可判定(如何判断结果符合目标)、可归因(看到的变化由什么引起)、可修正(知道下一步该验证什么)。它们对应工程师问题解决流程中的观察、还原、假设、实验等环节。
Harness 和反馈基础设施有什么区别?
Harness 编排 Agent 的行动,解决它怎样持续工作;反馈基础设施承载组织的判断,解决它凭什么认为自己做对了。通用 Harness 可以接收和组织反馈,却不能替企业生产反馈,因为“什么算成功”“什么代价可接受”等判断不是通用答案。
为什么企业原有的能力不会因为接入 AI 就自动出现?
因为很多系统能力其实寄存在少数人的脑子里,依赖专家经验、跨系统人工连接和临场判断。一旦工作交给 Agent,这层人工补偿不再自动生效,没有进入上下文的信息和未明确表达的判断标准就会变成反馈链路上的断点。
如何把专家工作流转化为反馈基础设施?
需要外化专家获得答案的过程:依据什么信号发现异常、怎样区分事实与推测、用什么实验排除解释、根据什么标准决定保留或放弃。让分散在测试、发布、可观测性等系统中的事实围绕一次行动形成连续链路,并明确验收条件,同时保留不确定性并控制反馈成本。
可观测性越高,反馈就越可靠吗?
不一定。日志、指标、调用链和评估分数让系统更可观测,但不会自动变成反馈。它们回答“发生了什么”,不能证明“为什么发生”。评估器只能执行已明确表达的标准,若标准错误,Agent 会稳定地走向错误目标。好的反馈应说明观察来源、覆盖范围、能支持什么判断以及下一步如何验证。
Agent 的自主程度到底由什么决定?
不取决于企业愿意给多少权限,而取决于企业能多快证明它错了,并把错误恢复掉。权限只决定动作执行到哪里,真正限制自主权的是错误能否被及时发现、原因能否定位、影响能否控制、结果能否恢复。企业能稳定交给 Agent 的,只能是那些自己已经知道如何定义、观察、验证和恢复的工作。