文章讲述了一个数据库故障案例:一个未处理的异常导致事务未提交,连接一直打开,阻塞了后续的ALTER迁移,进而使所有查询排队等待,最终造成数据库停机。文章指出可通过设置`idle_in_transaction_session_timeout`预防,并介绍了PlanetScale提供的连接管理工具,包括仪表盘和CLI,用于查看和终止阻塞连接。
本文讨论了数据库中的经典故障模式,包括长事务、脏页、死锁和复制延迟,并提供了相应的排查和修复建议,如调整事务超时、优化写入峰值和改用不同的隔离级别。
二月份,GitHub发生六起服务性能下降事件,主要由于数据库故障、配置更改和授权问题。为防止类似事件,GitHub已采取措施提升系统韧性,优化缓存机制,并增强监控和响应能力。
2025年10月20日,Heroku因弗吉尼亚地区云基础设施提供商的数据库故障,导致服务中断。事件分为两个阶段:首先是数据库故障,影响应用监控和自动扩展;其次是网络故障,导致客户应用无法访问。服务于10月21日恢复,Heroku承诺改进系统以防止类似问题。
完成下面两步后,将自动完成登录并继续当前操作。