内容提要
论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。
延伸解读
为何准确率如此重要
ORCA-bench 的结果显示,即使是最佳语言模型 Agent,在中等难度任务上的根因分析准确率也仅为 25.3%,困难任务仅 10.0%。这意味着在真实 on-call 场景中,Agent 可能无法可靠地定位故障根因,甚至可能产生幻觉式诊断。对于依赖 Agent 进行故障排查的团队而言,这一低准确率意味着需要保持人工监督,不能完全信任 Agent 的结论。
代码访问的关键性
实验发现,移除源代码访问会降低所有指标,表明代码理解是根因分析的核心能力。这提示我们,在评估或部署 Agent 时,应确保其具备访问和分析代码的能力。同时,这也意味着如果 Agent 只能访问日志和指标,其诊断能力将受到显著限制,团队在配置 Agent 权限时应充分考虑这一点。
性能下界与真实差距
论文指出,ORCA-bench 的测试床规模(50GB 数据、六天运行时间)远小于真实生产系统,因此当前性能是下界估计。真实系统更大、更动态、更多样化,Agent 的实际表现可能更差。这提醒我们,在评估 Agent 能力时,不能仅依赖基准测试结果,还需在真实环境中进行验证,并预留性能余量。
Q&A
ORCA-bench是什么?
ORCA-bench是一个生产保真度的根因分析基准测试,用于评估语言模型Agent在真实微服务系统中的on-call表现。
ORCA-bench的测试床有什么特点?
测试床是一个六天的OpenTelemetry仪器化微服务系统,暴露真实的遥测接口(Prometheus、Jaeger、OpenSearch via Grafana)和完整的源代码访问权限,包含六天的指标、日志和追踪数据。
ORCA-bench包含多少个任务?
ORCA-bench包含1,079个RCA任务,这些任务系统性变化报告具体性、检测时间和并发故障场景。
在ORCA-bench上,最佳语言模型Agent的表现如何?
最佳模型在中等难度任务上的RCA准确率仅为25.3%,在困难任务上仅10.0%。
移除源代码访问对Agent性能有什么影响?
移除源代码访问使所有指标下降,表明代码理解是RCA的核心能力。
ORCA-bench的评估结果如何保证可靠性?
Ground-truth symptoms由SRE专家审核签署,LLM-as-judge的评分经人类重新验证(Cohen's κw=0.90),确保评估结果的可靠性。
ORCA-bench的结果是否高估了Agent的实际表现?
是的,当前性能是下界估计,因为测试床只有50GB数据和六天运行时间,而真实生产系统更大、更动态且更多样化,实际部署中Agent的表现可能更差。