Saltar al contenido
Alta tecnología, Tecnología

Un ingeniero de Google Cloud desconectó accidentalmente todos los cables ópticos en la región

AutorEquipo editorial 7-09-2026, 00:36 90
Un ingeniero de Google Cloud desconectó accidentalmente todos los cables ópticos en la región
Publicidad
En breve
  • Un ingeniero de Google Cloud desconectó todos los cables ópticos en 13 minutos
  • La interrupción duró cuatro horas y afectó a la región us-central1-b
  • El tráfico cayó un 100%, las máquinas virtuales perdieron la conexión externa
  • Causa: violación de instrucciones durante el mantenimiento programado del equipo

Google Cloud publicó un informe sobre las causas de la interrupción parcial del servicio que ocurrió el 1 de septiembre en una de sus zonas de infraestructura. La interrupción duró cuatro horas, desde las 07:41 hasta las 11:52, hora del Pacífico, afectando a la región us-central1-b y causando serios problemas de disponibilidad de recursos en la nube.

Según la empresa, el incidente fue causado por un simple error humano. Un ingeniero que realizaba el mantenimiento técnico programado del equipo del centro de datos desconectó accidentalmente todos los cables ópticos que conectan los enrutadores. La particularidad de la situación fue que el proceso ocurrió de manera críticamente rápida: el 100 por ciento de las líneas de comunicación de fibra óptica (VOLS) fueron desconectadas en solo 13 minutos, lo que impidió que los sistemas de monitoreo y otros ingenieros notaran el problema a tiempo y detuvieran al trabajador.

La magnitud de los daños resultó ser significativa. Cuando los enrutadores perdieron la conexión, el volumen de tráfico en la zona afectada cayó un 100 por ciento. Las máquinas virtuales alojadas en una de las subzonas de la región us-central1-b perdieron completamente la conexión con la red externa y con Internet. Sin embargo, mantuvieron la capacidad de intercambiar datos entre sí, pero los usuarios no pudieron acceder a sus recursos ni siquiera para diagnosticar el problema. Las pérdidas de paquetes de datos, por supuesto, aumentaron a niveles críticos.

El sistema de protección no funcionó

Google Cloud subrayó que la arquitectura del centro de datos de la región us-central1-b fue diseñada con redundancia en múltiples niveles. La empresa utiliza la reserva de enrutadores, sistemas de alimentación separados y varias líneas de comunicación ópticas independientes. La infraestructura está diseñada para mantener la operatividad incluso ante fallos dobles y triples del equipo. Sin embargo, todas estas soluciones de ingeniería resultaron impotentes ante la desconexión física directa de los cables de los puertos.

La empresa señaló directamente que el ingeniero violó un requisito básico de seguridad y los procedimientos operativos estándar: no leyó las instrucciones antes de comenzar a trabajar. La naturaleza del error fue tan obvia y inusual que incluso Google lo describió irónicamente como un "error RTFM de nivel hiperescalable" (RTFM significa "Read The Manual", lee el manual).

Recuperación y consecuencias

Los ingenieros de Google identificaron rápidamente el problema y comenzaron el proceso de recuperación. El tráfico fue redirigido desde los enrutadores fallidos a nodos funcionales en otras partes de la región. Luego, los especialistas restauraron físicamente todas las conexiones ópticas y devolvieron la red a su estado original. El incidente se resolvió por completo al final del día.

Este caso vuelve a confirmar que el factor humano sigue siendo una de las principales causas de fallos en la infraestructura de la nube y en los centros de datos en todo el mundo. En los últimos años, ha habido numerosos incidentes causados por errores del personal, desde el apagado accidental de equipos de red hasta la configuración incorrecta de sistemas. Aunque la fiabilidad general de los centros de datos ha mejorado, la magnitud y el impacto de fallos individuales pueden ser bastante significativos, afectando a miles de usuarios y servicios críticos.

Google Cloud señaló la necesidad de endurecer los procedimientos de control y aumentar la disciplina en la realización de trabajos programados, para minimizar la probabilidad de incidentes similares en el futuro. La empresa también está considerando la introducción de barreras técnicas adicionales que impidan la desconexión simultánea de todas las líneas de comunicación de respaldo.

Fuente: 3DNews

¿Qué tan útil es el material?La evaluación nos ayuda a elegir temas
00 evaluaciones
Analítica

Estadísticas de la historia

90vistas
0comentarios
2min de lectura
46 / 53rango en sección, últimos 30 días

Discusión

Aún nadie se ha pronunciado — sé el primero.

Los comentarios son escritos por los participantes Inicie sesión en el sitio: es gratis y toma un minuto. Los comentarios pasan por moderación.
Iniciar sesión
Publicidad

A qué búsquedas responde esta página