看不见,就无法调试——AI代理的可观测性

看不见,就无法调试——AI代理的可观测性

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

传统APM无法解释AI代理为何重复提问、成本飙升。代理监控需三大支柱:追踪(记录每次模型调用和工具执行)、成本(监控令牌消耗和循环)、审计(不可变日志)。关键经验:成本异常是首要警报,追踪用于调试,指标用于告警,自动化分析标记异常会话,并确保PII脱敏。

🔎

延伸解读

成本异常是首要警报

文章强调,成本异常是代理出问题的首要信号。当代理陷入循环或上下文无限累积时,令牌消耗会呈几何级数增长,而传统监控往往在账单到达时才发现。因此,建议将单次会话成本与滚动平均值对比,设置告警,并优先处理成本异常,再深入调试。

追踪与指标的分工

作者明确指出,追踪用于调试,指标用于告警。追踪记录每次模型调用和工具执行的详细时间线,适合事后分析;而指标(如工具成功率、会话成本)适合实时监控和告警。两者互补,不应混淆。同时,指标标签需保持低基数,避免将会话ID等唯一标识符放入Prometheus标签,以防基数爆炸。

审计日志的PII脱敏

审计日志是事故复盘的关键,但必须确保敏感数据脱敏。文章强调,工具输出若含敏感信息,需在记录前进行清理,否则可观测性工具本身可能成为数据泄露的隐患。审计日志应不可变、结构化、可搜索,以便在需要时准确重建事件过程。

Q&A

为什么传统的APM工具无法满足AI代理的监控需求?

传统APM只能回答服务是否在线、响应速度、错误率等问题,而AI代理需要回答的是为什么任务成本异常、为什么重复调用工具、代理是否真的按预期执行等问题,这些是根本不同的,所以传统APM无法满足。

AI代理可观测性的三大支柱是什么?

三大支柱是:追踪(记录每次模型调用和工具执行的完整决策历史)、成本(监控令牌消耗和循环)、审计(不可变的日志记录)。

如何防止AI代理因循环调用工具而导致成本飙升?

可以设置硬性迭代上限、每个工具的调用预算、以及检测并阻止相同连续调用的循环检测机制,这些作为前置断路器;同时设置告警作为第二道防线,当会话成本超过滚动平均值的倍数时触发。

在AI代理监控中,追踪和指标各自的作用是什么?

追踪用于调试,提供详细的会话时间线;指标用于告警,提供实时监控和聚合数据。两者互补,不能互相替代。

为什么审计日志中的PII脱敏是必须的?

因为审计日志会在事件回顾时被查询,如果包含凭证或PII,可观测性工具就会变成责任风险,所以必须进行脱敏。

如何高效地审查大量AI代理会话?

通过自动化分析完成的追踪,标记异常会话(如循环、高成本、工具错误),然后由人工审查这些标记,而不是审查所有会话。

在将指标导出到Prometheus时,需要注意什么?

需要保持标签低基数,只使用工具名和代理名等有界值,避免将会话ID等唯一标识符放入标签,以防止基数爆炸导致指标服务器崩溃。

为什么说成本是AI代理的‘金丝雀’?

因为成本突然飙升几乎总是表明存在bug,如循环、模型路由错误或上下文无限累积,所以应该首先对成本进行告警,然后再调试。

🏷️

标签

➡️

继续阅读