一名谷歌云工程师意外断开了该地区的所有光缆

- 谷歌云工程师在13分钟内切断了所有光纤电缆
- 故障持续了四个小时,影响了us-central1-b区域
- 流量下降了100%,虚拟机失去了外部连接
- 原因:在设备计划维护时违反了指令
谷歌云发布了关于9月1日在其基础设施区域发生的部分服务中断原因的报告。故障持续了四个小时——从太平洋时间07:41到11:52,影响了us-central1-b区域,并导致云资源的可用性出现严重问题。
根据公司的说法,事件是由于简单的人为错误引起的。进行数据中心设备计划维护的工程师意外地切断了连接路由器的所有光纤电缆。情况的特殊之处在于,过程发生得极其迅速——所有100%的光纤通信线路(VOLS)在短短13分钟内被切断,这使得监控系统和其他工程师无法及时发现问题并制止工作人员。
损坏的规模显著。当路由器失去连接时,受影响区域的流量下降了100%。位于us-central1-b区域的虚拟机完全失去了与外部网络和互联网的连接。尽管它们仍然可以相互交换数据,但用户无法访问他们的资源,甚至无法进行问题诊断。数据包丢失率自然上升到临界值。
保护系统未能启动
Google Cloud强调,us-central1-b区域的数据中心架构设计了多层冗余。公司使用路由器备份、独立电源系统和多条独立光纤线路。基础设施旨在即使在设备双重和三重故障的情况下也能保持运行。然而,所有这些工程解决方案在面对直接物理断开端口的电缆时显得无能为力。
公司明确指出,工程师违反了基本的安全技术要求和标准操作程序——在开始工作之前没有阅读说明书。错误的性质是如此明显和不寻常,以至于连谷歌自己也讽刺地将其描述为“超大规模级别的RTFM错误”(RTFM的意思是“阅读手册”,即阅读说明书)。
恢复与后果
谷歌工程师迅速识别出问题并开始恢复过程。流量被从故障路由器重定向到该地区其他部分的正常节点。然后,专家们物理恢复了所有光纤连接,并将网络恢复到初始状态。事件在当天结束时完全解决。
这一事件再次证明,人为因素仍然是全球云基础设施和数据中心故障的主要原因之一。近年来,因员工错误导致的事件屡见不鲜——从意外断开网络设备到系统配置错误。尽管数据中心的整体可靠性有所提高,但单个故障的规模和影响可能非常显著,涉及成千上万的用户和关键服务。
Google Cloud 指出需要加强控制程序和提高计划工作的纪律,以最小化未来类似事件的可能性。公司还考虑引入额外的技术障碍,以防止所有备用通信线路同时断开。
来源:3DNews



