एक Google Cloud इंजीनियर ने गलती से क्षेत्र में सभी ऑप्टिकल केबलों को डिस्कनेक्ट कर दिया

- गूगल क्लाउड के इंजीनियर ने 13 मिनट में सभी ऑप्टिकल केबल्स को बंद कर दिया
- बिगड़ने की अवधि चार घंटे थी और इसने क्षेत्र us-central1-b को प्रभावित किया
- ट्रैफिक 100% गिर गया, वर्चुअल मशीनों ने बाहरी कनेक्शन खो दिया
- कारण: उपकरणों की नियोजित सेवा के दौरान निर्देशों का उल्लंघन
गूगल क्लाउड ने 1 सितंबर को अपनी एक बुनियादी ढांचा क्षेत्र में हुई आंशिक सेवा विफलता के कारणों पर एक रिपोर्ट प्रकाशित की। विफलता चार घंटे तक चली - 07:41 से 11:52 तक प्रशांत समय में, क्षेत्र us-central1-b को प्रभावित किया और क्लाउड संसाधनों की उपलब्धता में गंभीर समस्याएं उत्पन्न कीं।
कंपनी के अनुसार, यह घटना एक साधारण मानव त्रुटि के कारण हुई। डेटा सेंटर के उपकरणों की नियोजित तकनीकी सेवा कर रहे इंजीनियर ने गलती से सभी ऑप्टिकल केबल्स को बंद कर दिया, जो राउटरों को जोड़ते हैं। स्थिति की विशेषता यह थी कि प्रक्रिया अत्यधिक तेजी से हुई - सभी सौ प्रतिशत फाइबर-ऑप्टिक संचार लाइनों (VOLS) को केवल 13 मिनट में बंद कर दिया गया, जिससे निगरानी प्रणालियों और अन्य इंजीनियरों को समय पर समस्या का पता लगाने और कर्मचारी को रोकने का अवसर नहीं मिला।
नुकसान का पैमाना महत्वपूर्ण था। जब राउटर ने कनेक्शन खो दिया, तो प्रभावित क्षेत्र में ट्रैफ़िक की मात्रा 100 प्रतिशत गिर गई। क्षेत्र us-central1-b में स्थित वर्चुअल मशीनें पूरी तरह से बाहरी नेटवर्क और इंटरनेट से संपर्क खो बैठीं। हालांकि, वे एक-दूसरे के साथ डेटा का आदान-प्रदान करने में सक्षम रहीं, लेकिन उपयोगकर्ता अपनी संसाधनों तक पहुंच नहीं प्राप्त कर सके, यहां तक कि समस्या का निदान करने के लिए भी। डेटा पैकेटों की हानि, स्वाभाविक रूप से, गंभीर स्तरों तक बढ़ गई।
सुरक्षा प्रणाली काम नहीं आई
Google Cloud ने जोर देकर कहा कि क्षेत्र us-central1-b के डेटा सेंटर की वास्तुकला बहु-स्तरीय अधिशेषता के साथ डिज़ाइन की गई थी। कंपनी राउटर का बैकअप, अलग-अलग पावर सिस्टम और कई स्वतंत्र ऑप्टिकल संचार लाइनों का उपयोग करती है। बुनियादी ढांचा उपकरणों की दोहरी और त्रैतीय विफलताओं के बावजूद कार्यशीलता बनाए रखने के लिए डिज़ाइन किया गया है। हालाँकि, ये सभी इंजीनियरिंग समाधान पोर्ट से केबलों के सीधे भौतिक डिस्कनेक्ट के सामने बेकार साबित हुए।
कंपनी ने स्पष्ट रूप से बताया कि इंजीनियर ने सुरक्षा तकनीक और मानक संचालन प्रक्रियाओं की मूल आवश्यकता का उल्लंघन किया - काम शुरू करने से पहले निर्देशिका नहीं पढ़ी। त्रुटि का स्वरूप इतना स्पष्ट और असामान्य था कि खुद Google ने इसे कुछ विडंबना के साथ "RTFM-त्रुटि हाइपरस्केल स्तर" के रूप में वर्णित किया (RTFM का अर्थ है "Read The Manual", निर्देशिका पढ़ें)।
पुनर्प्राप्ति और परिणाम
गूगल के इंजीनियरों ने जल्दी ही समस्या का पता लगाया और पुनर्प्राप्ति प्रक्रिया शुरू की। ट्रैफिक को खराब हुए राउटर से कार्यशील नोड्स की ओर पुनर्निर्देशित किया गया। फिर विशेषज्ञों ने सभी ऑप्टिकल कनेक्शनों को भौतिक रूप से पुनर्स्थापित किया और नेटवर्क को उसकी प्रारंभिक स्थिति में वापस लाया। घटना दिन के अंत तक पूरी तरह से हल हो गई।
यह मामला फिर से पुष्टि करता है कि मानव कारक दुनिया भर में क्लाउड इंफ्रास्ट्रक्चर और डेटा सेंटर में विफलताओं के प्रमुख कारणों में से एक बना हुआ है। पिछले कुछ वर्षों में कई घटनाएँ हुई हैं, जो स्टाफ की गलतियों के कारण हुई हैं - नेटवर्क उपकरणों के आकस्मिक बंद होने से लेकर सिस्टम की गलत कॉन्फ़िगरेशन तक। हालांकि डेटा सेंटर की कुल विश्वसनीयता में सुधार हुआ है, लेकिन व्यक्तिगत विफलताओं का पैमाना और प्रभाव काफी महत्वपूर्ण हो सकता है, जो हजारों उपयोगकर्ताओं और महत्वपूर्ण सेवाओं को प्रभावित करता है।
गूगल क्लाउड ने भविष्य में ऐसे घटनाओं की संभावना को कम करने के लिए नियंत्रण प्रक्रियाओं को सख्त करने और योजना के कामों के दौरान अनुशासन बढ़ाने की आवश्यकता पर जोर दिया। कंपनी सभी बैकअप संचार लाइनों के एक साथ बंद होने से रोकने के लिए अतिरिक्त तकनीकी बाधाओं को लागू करने पर भी विचार कर रही है।
स्रोत: 3DNews



