Ein Google Cloud-Ingenieur hat versehentlich alle optischen Kabel in der Region getrennt

- Ein Google Cloud-Ingenieur hat alle optischen Kabel in 13 Minuten abgeschaltet
- Der Ausfall dauerte vier Stunden und betraf die Region us-central1-b
- Der Verkehr fiel um 100%, virtuelle Maschinen verloren die externe Verbindung
- Grund: Verstoß gegen die Anweisungen während der planmäßigen Wartung der Ausrüstung
Google Cloud hat einen Bericht über die Ursachen des teilweisen Ausfalls veröffentlicht, der am 1. September in einer ihrer Infrastrukturzonen aufgetreten ist. Der Ausfall dauerte vier Stunden – von 07:41 bis 11:52 Uhr pazifischer Zeit, betraf die Region us-central1-b und verursachte erhebliche Probleme mit der Verfügbarkeit von Cloud-Ressourcen.
Laut dem Unternehmen wurde der Vorfall durch einen einfachen menschlichen Fehler verursacht. Ein Ingenieur, der planmäßige Wartungsarbeiten an der Ausrüstung des Rechenzentrums durchführte, schaltete versehentlich alle optischen Kabel ab, die die Router verbanden. Das Besondere an der Situation war, dass der Prozess kritisch schnell ablief – alle hundert Prozent der Glasfaserverbindungen (VDSL) wurden in nur 13 Minuten abgeschaltet, was es den Überwachungssystemen und anderen Ingenieuren nicht ermöglichte, das Problem rechtzeitig zu bemerken und den Mitarbeiter zu stoppen.
Der Umfang der Schäden war erheblich. Als die Router die Verbindung verloren, fiel das Verkehrsaufkommen in der betroffenen Zone um 100 Prozent. Virtuelle Maschinen, die in einer der Unterzonen der Region us-central1-b gehostet wurden, verloren vollständig die Verbindung zum externen Netzwerk und zum Internet. Dabei konnten sie weiterhin Daten untereinander austauschen, aber die Benutzer konnten nicht auf ihre Ressourcen zugreifen, selbst nicht zur Diagnose des Problems. Der Paketverlust stieg natürlich auf kritische Werte.
Das Schutzsystem hat nicht funktioniert.
Google Cloud betonte, dass die Architektur des Rechenzentrums in der Region us-central1-b mit mehrstufiger Redundanz entworfen wurde. Das Unternehmen verwendet Router-Redundanz, separate Stromversorgungssysteme und mehrere unabhängige optische Kommunikationsleitungen. Die Infrastruktur ist darauf ausgelegt, auch bei doppelten und dreifachen Ausfällen von Geräten funktionsfähig zu bleiben. Doch all diese ingenieurtechnischen Lösungen waren machtlos gegenüber der direkten physischen Trennung von Kabeln aus den Ports.
Das Unternehmen wies ausdrücklich darauf hin, dass der Ingenieur eine grundlegende Sicherheitsanforderung und die Standardarbeitsanweisungen verletzt hat – er hat die Anleitung vor Beginn der Arbeiten nicht gelesen. Die Art des Fehlers war so offensichtlich und ungewöhnlich, dass sogar Google selbst ihn etwas ironisch als "RTFM-Fehler auf Hyperscale-Niveau" beschrieb (RTFM steht für "Read The Manual", lies die Anleitung).
Wiederherstellung und Folgen
Die Ingenieure von Google identifizierten schnell das Problem und begannen mit dem Wiederherstellungsprozess. Der Datenverkehr wurde von ausgefallenen Routern auf funktionierende Knoten in anderen Teilen der Region umgeleitet. Anschließend stellten die Spezialisten alle optischen Verbindungen physisch wieder her und brachten das Netzwerk in den ursprünglichen Zustand zurück. Der Vorfall war bis zum Ende des Tages vollständig behoben.
Dieser Fall bestätigt erneut, dass der menschliche Faktor eine der Hauptursachen für Ausfälle von Cloud-Infrastrukturen und Rechenzentren weltweit bleibt. In den letzten Jahren gab es zahlreiche Vorfälle, die durch menschliche Fehler verursacht wurden – von versehentlichen Abschaltungen von Netzwerkgeräten bis hin zu falschen Konfigurationen von Systemen. Obwohl die allgemeine Zuverlässigkeit von Rechenzentren verbessert wurde, können das Ausmaß und die Auswirkungen einzelner Ausfälle erheblich sein und Tausende von Nutzern sowie kritische Dienste betreffen.
Google Cloud hat auf die Notwendigkeit hingewiesen, die Kontrollverfahren zu verschärfen und die Disziplin bei der Durchführung geplanter Arbeiten zu erhöhen, um die Wahrscheinlichkeit ähnlicher Vorfälle in der Zukunft zu minimieren. Das Unternehmen erwägt auch die Einführung zusätzlicher technischer Barrieren, die das gleichzeitige Abschalten aller Backup-Kommunikationsleitungen verhindern.
Quelle: 3DNews



