2021年10月,Facebook因BGP配置错误宕机超过6小时,损失超1亿美元。2023年阿里云和2024年CrowdStrike也发生类似故障。文章探讨容灾架构的核心概念,包括恢复点目标(RPO)、恢复时间目标(RTO)和恢复成本目标(RCO),分析不同容灾等级的特点与适用场景,如冷备、温备、热备、同城双活和异地多活。强调选择容灾方案需平衡业务价值与技术成本,定期演练是确保方案有效性的关键。
高可用架构确保电商系统在故障时持续服务,采用分层设计、冗余和故障转移机制。电商数据分为流水型和状态型,流水数据无依赖,状态数据需强一致性。通过改造单据号生成和路由数据库,实现动态扩容和容灾,保障业务连续性和数据一致性。
Microsoft Orleans通过集群架构和容灾机制,实现可伸缩性和容错性。Orleans集群由多个Silo组成,具备弹性扩展、高可用性和负载均衡。故障检测采用心跳机制,Grain可自动恢复,确保业务连续性。
Agora成立于2014年,提供实时音视频云服务,支持语音、视频和AI功能的集成。其全球网络覆盖200多个国家,确保99.99%的服务可用性,并通过Aurora Global Database实现跨区域高可用架构,优化容灾和数据同步性能,以满足全球用户需求。
在设计云架构时,身份层的多区域容灾设计至关重要。若身份认证依赖单一区域,故障时可能导致无法登录AWS账户。本文介绍AWS IAM、IAM Identity Center和STS的多区域灾备最佳实践,强调提前部署紧急访问机制、使用区域STS端点及添加多个Sign-In服务端点,以确保业务连续性。
Nginx的容灾机制不够可靠,无法自动检测后端服务器状态,导致在服务器宕机时仍会转发流量,用户可能遇到错误。为实现秒级容灾,需考虑其他方案,如OpenResty或Envoy。
在SOA系统中,容灾能力至关重要。通过多数据中心部署、自动故障转移和数据备份等技术,可以提升系统的恢复能力。在LBS场景下,数据备份面临用户体验与成本的平衡挑战。采用网格系统和异步备份策略,确保数据一致性,最终将存储成本降低至9018元/月。
企业对高可用性和容灾需求增加,本文介绍利用亚马逊云的全球基础设施,通过Envoy的Redis Proxy实现双Region、双ElastiCache集群的数据同步方案。Envoy作为L7代理,支持多种协议,能高效复制Redis流量到灾备集群,实现选择性复制增、改、删操作。
企业通过同城多机房部署提升容灾能力和性能,利用故障隔离和数据冗余确保服务持续性。地理优势降低延迟,负载均衡支持弹性扩展。可用区独立且高速连接,AZ间距需平衡容灾与延迟,通常为30至50公里。跨地域部署增加延迟,总往返延迟约0.32至0.52毫秒。
随着金融行业发展,金融机构将多个业务系统整合到一套分布式数据库集群中。TiDB通过多租户资源管控和容灾技术,帮助金融机构实现高效业务整合和容灾能力。TiCDC工具用于跨区域数据同步。实际测试验证了基于TiDB的资源管控和TiCDC的多业务融合容灾方案的可行性。
本文介绍了使用Amazon Aurora Global Database Headless作为数据库跨区域方案的好处和实现跨区域灾难恢复的方法。Aurora Global Database Headless是指没有数据库实例的从集群,可以降低成本并提供高性价比的容灾方案。文章还介绍了RTO和RPO这两个容灾规划中的关键指标,以及如何将无头从集群Failover变成主集群。
在面向服务的架构(SOA)系统中,容灾能力是保障系统稳定性的重要组成部分。通过引入多数据中心部署、自动化故障转移、数据备份等技术手段,可以提升系统在面对突发灾难事件时的恢复能力。在LBS场景下的数据备份方案中,需要考虑缓存poi经纬度数据、降低容灾数据存储成本、保障缓存数据资源的有效性等问题。通过构建网格系统、削减数据备份量级、引入GIZP压缩等方法,可以降低成本并提高数据备份效果。同时,还介绍了灰度方案、容灾备份数据切换方案等落地过程。除了数据备份,还可以采取服务冗余、故障切换机制、负载均衡、服务监控和告警、业务连续性计划和定期演练等手段来提高流量后端服务的容灾能力。
37Games是一家成立于2011年的全球前20大游戏公司。本文讨论了37Games游戏平台在AWS上的部署以及跨区域主动-主动架构的实施。文章解释了游戏平台服务的架构设计以及在可用性方面面临的挑战。还介绍了多区域主动-主动架构,确保高可用性和灾难恢复。文章讨论了架构的访问层、应用层和数据层,以及流量分发和数据同步方法。强调了使用AWS服务如Route53、CloudFront、Aurora Global Database和DynamoDB Global Tables的优点。文章最后强调了通过这种架构实现的改进的可用性、容错性和灾难恢复能力。
该文章介绍了同城多活架构的方案概述和应用场景,包括机房级的快速切换、非对等部署下的全局流量负载均衡和流量的精细化管控。通过云原生微服务引擎MSE产品,可以实现同城容灾多活微服务应用。适用于需要高可用、同城容灾和多活需求的微服务场景。文章还介绍了相关产品和部署架构。
本文介绍了基于K8s容器集群的容灾架构与方案,包括RTO和RPO的容灾方针,备份与康复、主备和双活的容灾战略,以及多可用区和多地域的容灾规模选择。容灾可通过ACK One备份中心实现备份与康复,通过主备和双活模式实现数据库切换和事务流量切换。多可用区容灾和多地域容灾可通过规划容灾战略实现。单地域多可用区和单地域云IDC容灾计划可实现容灾,多地域容灾可通过大局流量办理和多地域单元化多活布置实现。
本文介绍了云上环境双集群后台手动部署和使用细粒度容灾的步骤,包括容灾前准备、细粒度容灾操作和解除容灾。细粒度容灾满足核心分析型业务的连续性要求,降低容灾建设成本,轻量化架构易运维、易操作、易演练。
谷歌云端硬盘出现异常,导致用户文件丢失。谷歌工程师正在排查原因,用户无法手动恢复。谷歌美国支持团队承认多个用户受影响,用户需等待谷歌解决方案。建议用户定期备份数据到本地。
Amazon Backup是亚马逊提供的云备份服务,支持集中备份管理和增强数据安全性。它通过优化备份策略和过期策略实现容灾备份和快速数据恢复,同时节省存储成本。跨region备份提供地理冗余和灾难恢复能力。使用Amazon Backup服务,满足长期备份需求,降低成本,提高数据安全性和业务连续性。
阿里巴巴影业集团利用阿里云边缘容器服务ACK@Edge实现了一套面向影演现场服务场景的云边端一体混合云架构,提供高效、便捷、安全的现场服务。该架构已经应用于现场服务中,提升了业务效率和用户体验。未来,阿里影业将继续发展战略,提供丰富的文娱消费体验。
本文介绍了美团的容灾架构和演练体系建设,包括多环境、高频次、大规模、长链路的演练体系,其中隔离环境演练和生产环境演练是常态化的。未来,美团将补齐短板、迭代技术架构两个方向上进行持续的提升。
完成下面两步后,将自动完成登录并继续当前操作。