内容提要
GitHub因流量激增和基础设施扩展不足,于8月17日发生近八小时宕机,这是当月第二次重大事故。尽管已迁移至Azure并增加大量资源,但扩展速度仍跟不上需求。GitHub正采取措施改进稳定性,同时其故障为竞争对手如Entire和Cursor提供了机会。
延伸解读
扩展速度与需求增长的赛跑
GitHub在8月17日宕机近八小时,原因是流量达到新峰值,而关键基础设施未能同步扩展。尽管今年已增加300万CPU核心和120PB高速存储,但扩展速度仍跟不上需求。这反映出在AI编程助手推动下,开发活动激增,基础设施的扩展往往滞后于需求增长,导致容量瓶颈。
迁移Azure的进展与挑战
GitHub正加速向Azure迁移,目前58%的平台负载和一半的Git操作已由Azure处理,而5月份这一比例仅为12%。然而,迁移过程中仍面临挑战:现有数据中心已因电力限制而无法再增加硬件,而Azure的扩展也未能完全避免故障。这表明云迁移并非一蹴而就,混合架构的过渡期仍存在风险。
运维实践与系统隔离的改进
GitHub承认运维实践未能跟上变化速度,已投入资源加强测试、安全发布、可观测性和告警,并隔离关键系统以减少依赖。这些措施旨在降低故障概率和影响范围。此外,为应对宕机,GitHub还调整了服务间交互的重试限制和超时,以防止重试风暴和级联负载。
竞争对手的机遇
GitHub的频繁宕机为竞争对手创造了机会。例如,由前CEO Thomas Dohmke创立的Entire公司,以及Cursor推出的Origin,都试图利用分布式系统更好地处理代理驱动的开发工作负载。有观点认为,如果GitHub保持稳定,这些替代方案可能不会如此受关注。
Q&A
GitHub在2025年8月17日发生的宕机持续了多久?
GitHub在2025年8月17日发生的宕机持续了将近八个小时。
GitHub在8月17日宕机的主要原因是什么?
宕机的主要原因是流量达到新峰值,而GitHub在美国中部的关键基础设施组件未能随之扩展,导致容量压力扩散,引发认证失败和多项服务中断。
GitHub为应对流量增长采取了哪些扩容措施?
GitHub今年增加了300万个CPU核心和120PB高速存储,并将58%的平台负载迁移到Azure,其中一半的Git操作由Azure处理。
GitHub在8月17日宕机后计划如何改进稳定性?
GitHub计划通过应用一致的重试限制和预算、调整服务间交互的超时设置来防止重试风暴和级联负载,同时隔离关键系统并移除共享依赖,以降低宕机可能性和影响。
GitHub的宕机对竞争对手产生了什么影响?
GitHub的宕机为竞争对手创造了机会,例如前CEO Thomas Dohmke创立的Entire和Cursor推出的Origin,它们利用GitHub的不稳定来吸引用户。
GitHub在8月17日宕机前,其平台负载在Azure上的比例是多少?
在8月17日宕机前,GitHub平台负载在Azure上的比例已从5月的12%提升至58%。