Salta al contenuto
Hi-Tech, Tecnologia

Un ingegnere di Google Cloud ha disconnesso accidentalmente tutti i cavi ottici nella regione

AutoreTeam editoriale 7-09-2026, 00:36 90
Un ingegnere di Google Cloud ha disconnesso accidentalmente tutti i cavi ottici nella regione
Pubblicità
In breve
  • Un ingegnere di Google Cloud ha disattivato tutti i cavi ottici in 13 minuti
  • Il guasto è durato quattro ore e ha interessato la regione us-central1-b
  • Il traffico è diminuito del 100%, le macchine virtuali hanno perso la connessione esterna
  • Causa: violazione delle istruzioni durante la manutenzione programmata dell'attrezzatura

Google Cloud ha pubblicato un rapporto sulle cause del parziale guasto del servizio, avvenuto il 1° settembre in una delle sue zone infrastrutturali. Il guasto è durato quattro ore — dalle 07:41 alle 11:52 ora del Pacifico, interessando la regione us-central1-b e causando gravi problemi di disponibilità delle risorse cloud.

Secondo l'azienda, l'incidente è stato causato da un banale errore umano. L'ingegnere che stava effettuando la manutenzione programmata dell'attrezzatura del data center ha accidentalmente disattivato tutti i cavi ottici che collegano i router. La particolarità della situazione era che il processo è avvenuto in modo critico veloce — il 100% delle linee di comunicazione in fibra ottica (WDM) è stato disattivato in soli 13 minuti, il che non ha permesso ai sistemi di monitoraggio e ad altri ingegneri di notare tempestivamente il problema e fermare il lavoratore.

L'entità dei danni si è rivelata significativa. Quando i router hanno perso la connessione, il volume di traffico nella zona colpita è sceso del 100 percento. Le macchine virtuali ospitate in una delle sottoregioni della regione us-central1-b hanno completamente perso il contatto con la rete esterna e Internet. Tuttavia, hanno mantenuto la possibilità di scambiarsi dati tra di loro, ma gli utenti non potevano accedere alle proprie risorse nemmeno per diagnosticare il problema. Le perdite di pacchetti dati, ovviamente, sono aumentate a valori critici.

Il sistema di protezione non ha funzionato

Google Cloud ha sottolineato che l'architettura del data center della regione us-central1-b è stata progettata con ridondanza multilivello. L'azienda utilizza il backup dei router, sistemi di alimentazione separati e diverse linee ottiche indipendenti. L'infrastruttura è progettata per mantenere la funzionalità anche in caso di guasti doppi e tripli dell'hardware. Tuttavia, tutte queste soluzioni ingegneristiche si sono rivelate impotenti di fronte a un'interruzione fisica diretta dei cavi dalle porte.

L'azienda ha chiaramente indicato che l'ingegnere ha violato un requisito fondamentale di sicurezza e le procedure operative standard: non ha letto le istruzioni prima di iniziare il lavoro. La natura dell'errore era così ovvia e insolita che persino Google l'ha descritta con un certo sarcasmo come un 'errore RTFM di livello iperscalabile' (RTFM sta per 'Read The Manual', leggi il manuale).

Ripristino e conseguenze

Gli ingegneri di Google hanno rapidamente identificato il problema e avviato il processo di ripristino. Il traffico è stato reindirizzato dai router guasti a nodi funzionanti in altre parti della regione. Successivamente, gli specialisti hanno fisicamente ripristinato tutte le connessioni ottiche e riportato la rete allo stato originale. L'incidente è stato completamente risolto entro la fine della giornata.

Questo caso conferma ancora una volta che il fattore umano rimane una delle principali cause di guasti nell'infrastruttura cloud e nei data center in tutto il mondo. Negli ultimi anni si sono verificati numerosi incidenti causati da errori del personale, dall'interruzione accidentale dell'attrezzatura di rete alla configurazione errata dei sistemi. Sebbene l'affidabilità complessiva dei data center sia migliorata, la portata e l'impatto di singoli guasti possono essere piuttosto significativi, interessando migliaia di utenti e servizi critici.

Google Cloud ha sottolineato la necessità di inasprire le procedure di controllo e di aumentare la disciplina durante le operazioni pianificate, per minimizzare la probabilità di incidenti simili in futuro. L'azienda sta anche considerando l'introduzione di ulteriori barriere tecniche che impediscano la disconnessione simultanea di tutte le linee di comunicazione di riserva.

Fonte: 3DNews

Quanto è utile il materiale?La valutazione ci aiuta a scegliere i temi
00 valutazioni
Analisi

Statistiche delle storie

90visualizzazioni
0commenti
2minuti di lettura
46 / 53posizione nella sezione, ultimi 30 giorni

Discussione

Finora nessuno si è espresso - sii il primo.

I commenti sono scritti dai partecipanti Accedi al sito — è gratuito e richiede un minuto. I commenti sono soggetti a moderazione.
Accedi
Pubblicità

A quali ricerche risponde questa pagina