Kubernetes上线后,集群健康不代表应用正常。HPE专家指出,需明确平台团队与使用团队的职责分工,在云环境和集群层面制定访问控制、网络、备份、版本升级等标准。升级应分阶段进行,以应用关键路径正常、服务目标达标为完成标准。团队应提前在实验环境测试责任模型,跟踪运维指标,确保变更有人审批、故障有人响应。
本文介绍了17个常用的运维指标,包括可用性、故障率、平均修复时间、平均故障间隔时间、响应时间、吞吐量、错误率、容量利用率、延迟、数据完整性、系统响应成功率、平均等待时间、数据备份成功率、数据恢复时间、安全漏洞修复时间、服务器利用率和网络带宽利用率。
完成下面两步后,将自动完成登录并继续当前操作。