Adobe Firefly采用AWS Amazon Managed Prometheus替代自建Prometheus,解决GPU训练集群高基数指标查询性能问题。迁移后查询速度提升28倍以上,支持24小时观测窗口,降低运维负担,并计划扩展至多租户可观测性架构。
作者从零基础前端开发者,通过LFX导师计划成长为云原生工程师。他部署OpenTelemetry和Prometheus系统,解决真实故障,学会系统思维和自主解决问题。项目产出包括文档改进和部署蓝图,并建立了行业人脉。他认为该计划提供了生产环境、真实失败和架构思考,是超越教程的宝贵学习经历。
AWS 上周发布多项更新:Bedrock 中 OpenAI GPT-5.6 模型价格大幅下调,最高降 80%;CloudWatch 推出托管式 Prometheus 收集器,简化指标监控;AWS Interconnect 正式支持与 Oracle 云的多云连接;IAM Identity Center 扩展多区域支持;S3 表类支持 Iceberg V3 Variant 数据类型。另附 AWS CLI 安装、Kimi K3 部署等指南及活动预告。
Elastic推出全新列式指标引擎,支持日志、指标与追踪统一平台,帮助公共部门IT团队提升系统可用性并降低成本。该方案兼容Prometheus与PromQL,提供灵活部署模式及按数据量计费,存储效率提升6.6倍,查询速度最高提升160倍,并简化迁移流程,获Gartner认可。
Kubernetes内置CPU和内存监控,但实际扩展决策依赖外部信号。本文介绍如何从零开始编写一个供Prometheus使用的指标导出器。导出器通过HTTP服务器在/metrics端点上暴露应用状态,Prometheus定期抓取数据。使用Go Prometheus客户端库注册指标,并通过轮询更新数据。最后,构建Docker镜像并在Kubernetes中部署,以确保Prometheus能够抓取这些指标,实现基于实际负载的自动扩展。
VictoriaMetrics(VM)是一款兼容Prometheus的时序数据库,具有低资源占用和强扩展性。它支持单机版和集群版,适合中小规模监控。单机版可替代Prometheus存储,集群版通过多个节点实现数据存储和查询。此外,VM支持vmagent抓取指标并写入,适用于自监控和Grafana集成。
Zenjoy基于Amazon Bedrock和EKS构建的AIOps Agent,通过数学算法与大语言模型结合,提升监控告警的准确性。该方案利用Z-Score和IQR等算法分析监控数据,减少误报和漏报,并通过夜莺平台实现告警统一管理,显著提高运维效率,适应微服务架构的复杂性。
本文讨论了ClickHouse的监控与健康检查,强调了system表的重要性。建议监控system.parts、system.merges和system.replicas,以确保数据存储和查询的健康。提供了监控分层结构和常用查询示例,帮助识别潜在问题,如parts过多、merge堵塞和副本延迟,并提到与Prometheus集成的监控方法,以确保系统性能符合SLA要求。
亚马逊创始人杰夫·贝索斯的新AI初创公司Prometheus致力于开发“通用人工工程师”,提供用于机器人、药物设计和制造的AI工程工具。该公司最近融资获得120亿美元,估值达410亿美元,现有约150名员工。贝索斯表示,这些工具将帮助各行业开发复杂产品,如火箭发动机。
OpenTelemetry已成为应用和服务可观测性的标准。OpenTelemetryChatClient中间件通过重写方法,支持LLM调用的链路跟踪和性能监控。结合Prometheus和Grafana,开发者可以轻松搭建监控环境,收集和展示性能指标。示例代码展示了如何使用ActivitySource记录调用链信息,并在控制台和Grafana中查看性能数据。
文章讨论了在生产环境中运行多个CNCF项目时的集成税,强调了团队在连接项目时所需的时间和精力。作者分享了集成过程中遇到的问题及解决方案,指出使用Cluster API和GitOps方法可以简化管理和灾难恢复。通过自动化和标准化配置,团队提高了效率,减少了故障发生。
自2018年在Linux内核中实施以来,压力停滞信息(PSI)帮助用户在资源饱和前识别问题。Kubernetes v1.36发布后,用户可以在节点、Pod和容器级别观察资源竞争。测试表明,Kubelet的PSI功能对资源使用影响微小,适合生产环境。PSI指标可通过Prometheus监控,需满足特定内核配置。
文章讨论了在生产环境中运行多个CNCF项目时的“集成税”,即整合不同工具的隐性成本。互操作性不足导致监控和证书管理等功能失效。通过Cluster API(CAPI)和GitOps方法,可以简化集群管理和灾难恢复,提高系统的可维护性和安全性。
In modern application development, observability is no longer optional. It is a core requirement for stable operations, faster troubleshooting, and better understanding of system behavior....
Elastic 9.4发布了多个新功能,包括优化的Agent Builder、原生Prometheus支持和Elastic Workflows。新版本增强了AI驱动的安全操作、监控和自动化能力,提高了性能和效率,帮助用户更好地管理和分析数据。
Elastic 9.4 正式发布,新增 Elastic Workflows、Agent Builder 更新及原生 Prometheus/PromQL 支持。此版本提升了 AI 驱动的安全运营能力,优化了上下文管理,增强了日志和指标处理性能,提供统一平台以加速问题解决。新功能包括精确实体识别、动态观察列表及智能体调查能力,旨在提升安全性和合规性。
本文介绍了五种主要的度量指标存储方案:Prometheus、Thanos、Mimir、VictoriaMetrics和M3DB。重点分析了Prometheus的架构、数据模型及扩展方案,讨论了各方案的优缺点及适用场景,尤其是在高并发和多租户环境下的表现,并提供了一些工程实践中的常见问题及解决方案,以帮助用户选择合适的监控工具。
监控与可观测性是不同的概念,监控关注预设问题和指标,而可观测性能够回答任意问题。传统的监控工具如Nagios和Zabbix逐渐被Prometheus和OpenTelemetry取代,后者支持更灵活的数据模型和多维度分析。可观测性强调记录足够的上下文信息,以便在故障发生时进行深入分析。随着微服务和复杂系统的普及,传统监控已无法满足需求,行业正向统一的可观测性平台发展。
Slack在HTTP/3支持中遇到客户端可观察性不足的问题。实习生Sebastian Feliciano为Prometheus Blackbox Exporter实现了QUIC支持,解决了监测HTTP/3端点的难题。这一开源贡献提升了监测能力,并为Prometheus社区带来了益处,未来将继续改进。
观察日已成为云原生观察性社区的重要活动,汇聚了Prometheus、Fluentd等项目的维护者与实践者,涵盖AI系统、成本效率等新领域,提供多样化课程,促进项目间合作与交流。
完成下面两步后,将自动完成登录并继续当前操作。