Перейти к содержимому
Новости » Hi-Tech, Техника

Инженер Google Cloud случайно отключил все оптические кабели региона

Инженер Google Cloud случайно отключил все оптические кабели регионаКоротко
  • Инженер Google Cloud отключил все оптические кабели за 13 минут
  • Сбой длился четыре часа и затронул регион us-central1-b
  • Трафик упал на 100%, виртуальные машины потеряли внешнюю связь
  • Причина: нарушение инструкций при плановом обслуживании оборудования

Google Cloud опубликовала отчёт о причинах частичного отказа в обслуживании, произошедшего 1 сентября в одной из своих инфраструктурных зон. Сбой длился четыре часа — с 07:41 до 11:52 по тихоокеанскому времени, затронув регион us-central1-b и вызвав серьёзные проблемы с доступностью облачных ресурсов.

По словам компании, инцидент был вызван банальной ошибкой человеческого фактора. Инженер, проводивший плановое техническое обслуживание оборудования дата-центра, случайно отключил все оптические кабели, соединяющие маршрутизаторы. Особенность ситуации заключалась в том, что процесс происходил критически быстро — все сто процентов волоконно-оптических линий связи (ВОЛС) были отключены всего за 13 минут, что не позволило системам мониторинга и другим инженерам своевременно заметить проблему и остановить работника.

Масштаб повреждений оказался существенным. Когда маршрутизаторы потеряли соединение, объём трафика в пострадавшей зоне упал на 100 процентов. Виртуальные машины, размещённые в одной из подзон региона us-central1-b, полностью потеряли связь с внешней сетью и интернетом. При этом они сохранили возможность обмениваться данными друг с другом, но пользователи не могли получить доступ к своим ресурсам даже для диагностики проблемы. Потери пакетов данных, разумеется, возросли до критических значений.

Система защиты не сработала

Google Cloud подчеркнула, что архитектура дата-центра региона us-central1-b была спроектирована с многоуровневой избыточностью. Компания использует резервирование маршрутизаторов, раздельные системы питания и несколько независимых оптических линий связи. Инфраструктура рассчитана на сохранение работоспособности даже при двойных и тройных отказах оборудования. Однако все эти инженерные решения оказались бессильны перед прямым физическим отключением кабелей из портов.

Компания прямо указала на то, что инженер нарушил базовое требование техники безопасности и стандартные операционные процедуры — не прочитал инструкцию перед началом работ. Характер ошибки был настолько очевиден и необычен, что даже сама Google несколько иронично описала его как «RTFM-ошибку гиперскейл-уровня» (RTFM расшифровывается как «Read The Manual», прочитай инструкцию).

Восстановление и последствия

Инженеры Google быстро выявили проблему и начали процесс восстановления. Трафик был перенаправлен с вышедших из строя маршрутизаторов на функционирующие узлы в других частях региона. Затем специалисты физически восстановили все оптические соединения и вернули сеть в исходное состояние. Инцидент был полностью разрешён к концу дня.

Данный случай вновь подтверждает, что человеческий фактор остаётся одной из главных причин сбоев облачной инфраструктуры и дата-центров по всему миру. В последние годы произошло немало инцидентов, вызванных ошибками персонала — от случайного отключения сетевого оборудования до неправильной конфигурации систем. Хотя общая надёжность дата-центров улучшилась, масштаб и влияние отдельных сбоев могут быть весьма значительными, затрагивая тысячи пользователей и критические сервисы.

Google Cloud указала на необходимость ужесточения процедур контроля и повышения дисциплины при проведении плановых работ, чтобы минимизировать вероятность подобных инцидентов в будущем. Компания также рассматривает введение дополнительных технических барьеров, препятствующих одновременному отключению всех резервных линий связи.

Источник: 3DNews

Поделиться

Информация

Посетители, находящиеся в группе Гости, не могут оставлять комментарии в данной новости.
Реклама

На какие запросы отвечает эта страница

Канал в TelegramПодписаться
Разделы
Сервисы