Inżynier Google Cloud przypadkowo odłączył wszystkie kable optyczne w regionie

- Inżynier Google Cloud wyłączył wszystkie kable optyczne w ciągu 13 minut
- Awaria trwała cztery godziny i dotknęła region us-central1-b
- Ruch spadł o 100%, maszyny wirtualne straciły zewnętrzne połączenie
- Przyczyna: naruszenie instrukcji podczas planowanej konserwacji sprzętu
Google Cloud opublikowała raport o przyczynach częściowej awarii, która miała miejsce 1 września w jednej z jej stref infrastrukturalnych. Awaria trwała cztery godziny — od 07:41 do 11:52 czasu pacyficznego, dotykając region us-central1-b i powodując poważne problemy z dostępnością zasobów chmurowych.
Według firmy, incydent był spowodowany zwykłym błędem ludzkim. Inżynier, który przeprowadzał planowaną konserwację sprzętu centrum danych, przypadkowo wyłączył wszystkie kable optyczne łączące routery. Szczególność sytuacji polegała na tym, że proces przebiegał krytycznie szybko — wszystkie sto procent włókien optycznych (WOL) zostały wyłączone w zaledwie 13 minut, co uniemożliwiło systemom monitorowania i innym inżynierom zauważenie problemu na czas i zatrzymanie pracownika.
Skala uszkodzeń okazała się znacząca. Gdy routery straciły połączenie, objętość ruchu w dotkniętej strefie spadła o 100 procent. Wirtualne maszyny umieszczone w jednej z podstref regionu us-central1-b całkowicie straciły kontakt z zewnętrzną siecią i internetem. Mimo to zachowały możliwość wymiany danych między sobą, ale użytkownicy nie mogli uzyskać dostępu do swoich zasobów nawet w celu diagnozy problemu. Straty pakietów danych, oczywiście, wzrosły do krytycznych wartości.
System ochrony nie zadziałał
Google Cloud podkreśliło, że architektura centrum danych regionu us-central1-b została zaprojektowana z wielopoziomową redundancją. Firma wykorzystuje rezerwację routerów, oddzielne systemy zasilania i kilka niezależnych linii optycznych. Infrastruktura jest zaprojektowana tak, aby zachować funkcjonalność nawet przy podwójnych i potrójnych awariach sprzętu. Jednak wszystkie te rozwiązania inżynieryjne okazały się bezsilne wobec bezpośredniego fizycznego odłączenia kabli z portów.
Firma wyraźnie wskazała, że inżynier naruszył podstawowe wymagania dotyczące bezpieczeństwa i standardowe procedury operacyjne — nie przeczytał instrukcji przed rozpoczęciem prac. Charakter błędu był na tyle oczywisty i nietypowy, że sama Google opisała go z pewną ironią jako „błąd RTFM na poziomie hiperskalowym” (RTFM oznacza „Read The Manual”, przeczytaj instrukcję).
Przywracanie i konsekwencje
Inżynierowie Google szybko zidentyfikowali problem i rozpoczęli proces przywracania. Ruch został przekierowany z uszkodzonych routerów na działające węzły w innych częściach regionu. Następnie specjaliści fizycznie przywrócili wszystkie połączenia optyczne i przywrócili sieć do pierwotnego stanu. Incydent został całkowicie rozwiązany do końca dnia.
Ten przypadek ponownie potwierdza, że czynnik ludzki pozostaje jedną z głównych przyczyn awarii infrastruktury chmurowej i centrów danych na całym świecie. W ostatnich latach miało miejsce wiele incydentów spowodowanych błędami personelu — od przypadkowego wyłączenia sprzętu sieciowego po niewłaściwą konfigurację systemów. Chociaż ogólna niezawodność centrów danych poprawiła się, skala i wpływ poszczególnych awarii mogą być znaczne, dotykając tysiące użytkowników i krytyczne usługi.
Google Cloud wskazała na konieczność zaostrzenia procedur kontroli i zwiększenia dyscypliny podczas przeprowadzania prac planowych, aby zminimalizować prawdopodobieństwo podobnych incydentów w przyszłości. Firma rozważa również wprowadzenie dodatkowych barier technicznych, które uniemożliwią jednoczesne wyłączenie wszystkich zapasowych linii komunikacyjnych.
Źródło: 3DNews



