Un ingénieur de Google Cloud a accidentellement déconnecté tous les câbles optiques de la région

- L'ingénieur de Google Cloud a déconnecté tous les câbles optiques en 13 minutes
- La panne a duré quatre heures et a touché la région us-central1-b
- Le trafic a chuté de 100 %, les machines virtuelles ont perdu leur connexion externe
- Raison : non-respect des instructions lors de la maintenance planifiée de l'équipement
Google Cloud a publié un rapport sur les causes de l'interruption partielle de service survenue le 1er septembre dans l'une de ses zones d'infrastructure. La panne a duré quatre heures — de 07:41 à 11:52, heure du Pacifique, touchant la région us-central1-b et provoquant de graves problèmes d'accessibilité des ressources cloud.
Selon l'entreprise, l'incident a été causé par une simple erreur humaine. L'ingénieur effectuant la maintenance technique planifiée de l'équipement du centre de données a accidentellement déconnecté tous les câbles optiques reliant les routeurs. La particularité de la situation était que le processus s'est déroulé de manière critique rapide — 100 % des lignes de communication en fibre optique (VOLS) ont été déconnectées en seulement 13 minutes, ce qui a empêché les systèmes de surveillance et d'autres ingénieurs de détecter le problème à temps et d'arrêter le travailleur.
L'ampleur des dommages s'est révélée substantielle. Lorsque les routeurs ont perdu la connexion, le volume de trafic dans la zone touchée a chuté de 100 pour cent. Les machines virtuelles hébergées dans l'une des sous-zones de la région us-central1-b ont complètement perdu le contact avec le réseau externe et Internet. Cependant, elles ont conservé la possibilité d'échanger des données entre elles, mais les utilisateurs n'ont pas pu accéder à leurs ressources même pour diagnostiquer le problème. Les pertes de paquets de données, bien sûr, ont augmenté jusqu'à des valeurs critiques.
Le système de protection n'a pas fonctionné
Google Cloud a souligné que l'architecture du centre de données de la région us-central1-b avait été conçue avec une redondance multicouche. L'entreprise utilise la redondance des routeurs, des systèmes d'alimentation séparés et plusieurs lignes de communication optiques indépendantes. L'infrastructure est conçue pour maintenir son fonctionnement même en cas de pannes doubles et triples de l'équipement. Cependant, toutes ces solutions d'ingénierie se sont révélées impuissantes face à la déconnexion physique directe des câbles des ports.
L'entreprise a clairement indiqué que l'ingénieur avait enfreint une exigence fondamentale de sécurité et des procédures opérationnelles standard — il n'a pas lu le manuel avant de commencer le travail. La nature de l'erreur était si évidente et inhabituelle que même Google elle-même l'a décrite avec un certain ironie comme une « erreur RTFM de niveau hyperscale » (RTFM signifie « Read The Manual », lis le manuel).
Récupération et conséquences
Les ingénieurs de Google ont rapidement identifié le problème et ont commencé le processus de récupération. Le trafic a été redirigé des routeurs défaillants vers des nœuds fonctionnels dans d'autres parties de la région. Ensuite, les spécialistes ont physiquement restauré toutes les connexions optiques et ont remis le réseau dans son état d'origine. L'incident a été complètement résolu à la fin de la journée.
Ce cas confirme une fois de plus que le facteur humain reste l'une des principales causes des pannes d'infrastructure cloud et des centres de données à travers le monde. Au cours des dernières années, de nombreux incidents ont été causés par des erreurs du personnel - allant de la déconnexion accidentelle d'équipements réseau à une mauvaise configuration des systèmes. Bien que la fiabilité globale des centres de données se soit améliorée, l'ampleur et l'impact des pannes individuelles peuvent être très significatifs, affectant des milliers d'utilisateurs et des services critiques.
Google Cloud a souligné la nécessité de renforcer les procédures de contrôle et d'améliorer la discipline lors des travaux planifiés, afin de minimiser la probabilité de tels incidents à l'avenir. L'entreprise envisage également d'introduire des barrières techniques supplémentaires pour empêcher la coupure simultanée de toutes les lignes de communication de secours.
Source : 3DNews



