2025年7月14日Cloudflare 1.1.1.1事件

2025年7月14日Cloudflare 1.1.1.1事件

💡 原文英文,约2100词,阅读约需8分钟。
📝

内容提要

2025年7月14日,Cloudflare的1.1.1.1解析服务因内部配置错误全球中断,影响用户访问互联网,故障持续约62分钟。Cloudflare已采取措施防止类似问题再次发生。

🎯

关键要点

  • 2025年7月14日,Cloudflare的1.1.1.1解析服务因内部配置错误全球中断,影响用户访问互联网,故障持续约62分钟。

  • 故障的根本原因是维护基础设施的遗留系统配置错误,而非攻击或BGP劫持。

  • Cloudflare于2018年推出1.1.1.1公共DNS解析服务,成为全球最受欢迎的DNS解析IP地址之一。

  • 配置错误发生在6月6日,错误地将1.1.1.1解析服务的前缀与新DLS服务的前缀混合。

  • 7月14日,因对DLS服务的配置更改,导致1.1.1.1解析服务的IP地址被全球撤回,造成服务中断。

  • 在故障期间,DNS流量显著下降,UDP、TCP和DNS over TLS的查询量急剧减少。

  • Cloudflare在22:20 UTC开始恢复之前的配置,22:54 UTC时服务恢复正常。

  • Cloudflare承诺采取措施防止类似问题再次发生,包括逐步部署和淘汰遗留系统。

🔎

延伸解读

故障原因分析

此次Cloudflare 1.1.1.1服务中断的根本原因是内部配置错误,而非外部攻击或BGP劫持。这一错误源于6月6日对遗留系统的配置更改,导致服务前缀与新服务混合,最终在7月14日触发了全球性中断。

服务恢复过程

在故障发生后,Cloudflare迅速采取措施恢复服务。22:20 UTC时,团队开始恢复之前的配置,经过验证后逐步重新发布BGP前缀。到22:54 UTC,服务恢复正常,显示出快速响应的重要性。

未来改进措施

Cloudflare承诺将采取一系列措施防止类似事件再次发生,包括逐步淘汰遗留系统和实施渐进式部署方法。这些改进旨在提高服务的稳定性和可靠性,确保用户体验不再受到影响。

延伸问答

Cloudflare的1.1.1.1服务中断的原因是什么?

中断是由于维护基础设施的遗留系统配置错误导致的,而非攻击或BGP劫持。

这次中断对用户的影响有多大?

大多数1.1.1.1用户在全球范围内受到影响,无法访问互联网服务,故障持续约62分钟。

Cloudflare在故障发生后采取了哪些恢复措施?

Cloudflare在22:20 UTC开始恢复之前的配置,并在22:54 UTC时服务恢复正常。

Cloudflare的1.1.1.1解析服务是什么时候推出的?

Cloudflare于2018年推出了1.1.1.1公共DNS解析服务。

这次事件的根本原因是什么?

根本原因是6月6日的配置错误,该错误将1.1.1.1解析服务的前缀与新DLS服务的前缀混合。

Cloudflare将如何防止类似问题再次发生?

Cloudflare承诺逐步淘汰遗留系统,并实施现代的逐步部署和健康监测流程。

🏷️

标签

➡️

继续阅读