内容提要
本文总结了IT领导者使用可观测性监控AI应用的七条经验:从MVP阶段就纳入LLM可观测性,避免“测量债务”;用非确定性指标监控概率系统;采用标准遥测词汇;让仪表报告已知数据;控制遥测成本;识别数据而非模型问题;以及成本可见性不等于质量保证。核心是尽早测量,以证明AI价值。
延伸解读
测量债务:AI项目被忽视的隐性成本
文章提出“测量债务”概念,指AI能力上线时未埋点,未来需证明其价值时却缺乏数据。这类似技术债,会随领导层要求回报而累积。数据显示,85%的IT决策者计划为LLM应用启用可观测性,但仅8%已实施。尽早埋点可避免事后无法重建历史数据,使ROI成为实时查询而非事后拼凑。
概率系统监控:传统指标失效
生成式AI应用可能完全可用、响应快但输出错误,传统可用性和延迟指标无法捕捉质量问题。需补充令牌消耗、检索质量、用例分类等信号。这些信号在用户真实交互后尤为重要,用于比较版本优劣。基线数据必须提前建立,否则无法判断模型、提示词或检索策略的变更是否真正改进。
遥测成本控制:避免账单意外
AI工作负载使遥测数据量激增,97%的组织遭遇过意外成本。常见问题包括用会话ID等增长型标签标记指标,导致监控成本随采用率上升;以及均匀采样,虽控制成本但同比例丢弃失败数据。解决方案是制定schema和采样策略,而非依赖默认配置,确保成本可控且关键数据不丢失。
成本可见性≠质量保证
成本数据只反映花费,不反映正确性。文章建议以“每完成任务的成本”为分母,而非“每次调用成本”,因为弱模型可能降低单次成本但增加重试和后续调用,总成本反而更高。同时,质量评估应嵌入追踪数据,使质量分数与成本记录关联,避免财务和质量审查脱节。
Q&A
为什么在MVP阶段就要纳入LLM可观测性?
因为如果等到领导层要求回报数据时才开始测量,使用历史可能已经丢失或无法重建。尽早测量可以避免“测量债务”,并确保有数据来证明AI应用的价值。
监控生成式AI应用时,为什么不能只用可用性和延迟这类确定性指标?
因为生成式AI是概率系统,即使可用且快速,也可能输出错误结果。需要额外跟踪令牌消耗、检索质量和用例分类等信号,以捕捉质量问题和成本。
为什么建议使用OpenTelemetry的语义约定来命名遥测数据?
因为使用标准词汇可以避免因自定义命名导致的迁移问题。当更换代理框架、添加模型提供商或收购新公司时,标准词汇能减少重建报告层的成本。
如何避免AI成本报告与提供商账单不一致?
应直接使用提供商返回的准确令牌数和价格,而不是用tokenizer库估算或硬编码价格。同时避免重复埋点,并在查询时根据价格表计算成本,这样价格变化只需更新数据而非部署。
为什么遥测成本会随着AI应用成功而增加?如何控制?
因为使用高基数的标签(如会话ID)会导致监控平台存储和索引成本随使用量增长。控制方法包括避免高基数标签、谨慎设置采样策略,并将schema和采样视为架构决策。
当AI应用回答错误时,为什么首先应该检查数据而不是模型?
因为大多数质量失败源于数据检索问题,而非模型本身。如果检索到的文档不完整,无论怎么换模型都无法解决。记录检索内容、排名和支持程度,可以区分是模型问题还是数据问题。
为什么成本可见性不等于质量保证?
因为成本可见性只显示花费,不反映回答是否正确。需要建立系统的评估机制,将质量评分与成本数据关联,并采用“每完成任务的成本”作为指标,避免被单位成本误导。