Atlassian开发了自动化根因分析系统,将RCA视为跨信号类型、时间和拓扑的三维关联问题。系统通过服务拓扑缩小范围,独立检测指标、日志和追踪异常,经时间关联和依赖图分析生成排序假设,并附可读叙述。模块化设计支持渐进改进,显著减少人工排查时间,提升事故响应效率。
论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。
AI编程工具加速代码开发,但机器生成的代码让SRE难以理解系统故障。Chronosphere建议企业自建AI SRE代理,通过整理系统信息生成Markdown文件,辅助根因分析。尽管其提供商业产品,但强调自建过程能积累关键上下文,最终仍需遥测和可观测性工具支持。
Elastic收购AI调查平台Deductive AI,其AI SRE代理可连接代码、遥测源和组织知识,进行根因分析并优化调查路径。结合Elastic的AI能力,旨在减少手动调查时间,更快解决生产问题。现有客户将继续获得支持,未来将公布产品路线图。
文章探讨了故障处理的自动化方法,包括利用Agent进行故障处理、巡检和根因分析。通过建立标准流程和巡检能力,结合AI进行故障分析,提升故障定位和修复效率,重点在资源关联和数据管理,最终实现自动化故障分析。
在复杂的云环境中,运维团队面临挑战。CloudWatch AIOps 利用人工智能和机器学习技术,自动化根因分析,快速定位和解决问题,从而提高故障排查效率,减轻运维负担。
Elastic收购开源AIOps公司Keep Alerting Ltd,整合其事件管理和根因分析能力。Keep将与Elasticsearch和Kibana集成,继续保持开源,提升用户的AI自动化体验。
谷歌SRE工程师Michelle Brush分享了反“背锅”文化的关键策略,强调持续改进和问责的重要性,提到根因分析的问题,讨论了奖励和惩罚的有效性,以及如何建立正确行为的动力,强调创建容许框架和持续改进的文化的重要性。
本文介绍了根因分析的原则和业务结构,以及监控数据的分析。通过对Tomcat和Database的RT监控数据的比较,发现高并发情况下Tomcat的RT上升,Database的RT下降。进一步分析发现,这是因为Tomcat在Database响应慢时拦截流量,导致Tomcat的RT上升。同时提到了Druid连接池的报错问题和分片逻辑的影响。总结了问题的根本原因和压测能过的原因。
本文介绍了复盘的重要性和价值,以及复盘的五个步骤。通过复盘,我们可以更科学地认知和分析问题,并找到可借鉴的解决方法和执行途径。作者分享了一个案例,通过复盘找到问题的根因并制定优化改进方案,最终推广形成整个团队的SOP。
Elasticsearch 8.7 引入新的 Health API,用于诊断集群健康问题。该 API 提供红、黄、绿状态,支持快速概览和详细根因分析两种模式,通过模块化指标检测主节点稳定性、分片可用性、磁盘空间等,并给出具体修复建议和操作指南,帮助用户自助解决问题。
完成下面两步后,将自动完成登录并继续当前操作。