مايكروسوفت تكشف سبب انقطاع خدمة “365” الواسع: خلل في نظام الصيانة الآلي

مايكروسوفت تكشف سبب انقطاع خدمة "365" الواسع: خلل في نظام الصيانة الآلي

عمان – المنصة

مايكروسوفت تكشف سبب انقطاع خدمة “365” الواسع: خلل في نظام الصيانة الآلي

كشفت شركة مايكروسوفت أن خللاً برمجياً في نظام طلبات الصيانة الآلي لشبكتها كان السبب وراء الانقطاع الواسع الذي أصاب خدماتها يوم الخميس الماضي، بعدما أدى الخلل إلى إزالة مسارات عناوين IP من عدد من الأجهزة يفوق ما كان مقصوداً، ما تسبب في تعطّل خدمتي Azure وMicrosoft 365.

بداية العطل ونطاقه

بدأ الانقطاع عند الساعة 10:44 صباحاً بتوقيت شرق الولايات المتحدة يوم الخميس 23 تموز، وأثّر بشكل رئيس على المستخدمين الذين يصلون إلى خدمات Microsoft 365 عبر بنية تحتية شبكية مرتبطة بمنطقة Azure في غرب الولايات المتحدة.

وبحلول الساعة 11:11 صباحاً، سجّلت منصة “داون ديتكتور” 2,403 بلاغاً عن انقطاع الخدمة، وهو رقم أعلى بكثير من المعدل الطبيعي البالغ 29 بلاغاً فقط. وشكّلت شكاوى منصة “شير بوينت” النسبة الأكبر بواقع 78% من إجمالي البلاغات، تلتها “إكسل” بنسبة 11%، ثم مركز إدارة Microsoft 365 بنسبة 6%.

الخدمات المتأثرة

وصنّفت مايكروسوفت الحادثة تحت الرقم التعريفي MO1437424، مؤكدة تأثر عدد من خدماتها الرئيسة، من بينها:

OneDrive: تعطّل متقطع في الوصول إلى الملفات
SharePoint Online: ظهور رسائل خطأ “حدث خطأ ما” للمستخدمين
Microsoft Teams: تراجع أداء المحادثات، بما في ذلك تعذّر تحميل الصور
مركز إدارة Microsoft 365: بطء شديد أو تعذّر التحميل بالكامل
Power Automate: تعذّر تحميل مسارات العمل الآلية
Copilot Chat: تأخيرات وأعطال متقطعة عند تنفيذ الاستعلامات والمهام
Microsoft Loop: تعذّر فتح أو تحميل الصفحات

كما شملت الخدمات المتأثرة كلاً من Fabric وPower BI، وPower Apps، وCopilot Studio، وWindows 365، وMicrosoft Defender، حيث واجه بعض عملاء “ديفندر” تأخيرات في تلقي الردود من فريق الخبراء، إضافة إلى احتمال فشل عمليات التحقيق ومسارات العمل والإجراءات العلاجية التي تُشغَّل عبر أدوات Threat Explorer وAdvanced Hunting.

محاولات الاحتواء الأولى

وحاولت مايكروسوفت في البداية احتواء الانقطاع عبر إعادة توجيه حركة البيانات عبر مسارات شبكية بديلة، وهو ما ساعد بعض العملاء لكن العديد من الخدمات ظلت متأثرة. وقبل أن تتوصل إلى السبب الجذري للعطل، حذّرت الشركة عملاءها من ضرورة مراجعة خطط استمرارية الأعمال والتعافي من الكوارث الخاصة بهم، واتخاذ الإجراءات المناسبة لبيئاتهم التشغيلية.

تحديد السبب وإصلاحه

لاحقاً، حدّدت مايكروسوفت أن التغيير الأخير الذي أُجري على الشبكة هو السبب وراء العطل، وبدأت بالتراجع عنه. واكتمل التراجع عن التغيير عند الساعة 2:26 ظهراً بتوقيت شرق الولايات المتحدة، وأكدت الشركة، عبر بيانات المراقبة التقنية وبلاغات العملاء، أن عطل Microsoft 365 قد عولج بالكامل.

خلل في نظام الصيانة وراء الحادثة

وفي مراجعة أولية لما بعد الحادثة (Post Incident Review) خاصة بعطل Azure، أوضحت مايكروسوفت أن الانقطاع وقع خلال عملية صيانة روتينية لأجهزة الشبكة في منطقة Azure بغرب الولايات المتحدة، حيث كان يجري عزل مسارات شبكية محددة.

وبحسب الشركة، تقوم عملية الصيانة عادة بتحويل هذا النوع من الطلبات إلى تعليمات يمكن للنظام قراءتها، مع التحقق من سلامة واحد على الأقل من مسارين احتياطيين متكررين قبل بدء العمل. غير أن خللاً في نظام تحويل الطلبات أدى إلى تصنيف أجهزة شبكية إضافية بشكل خاطئ كجزء من عملية الصيانة، ما أسفر عن إزالة مسارات عناوين IP من عدد من الأجهزة أكبر مما كان مخططاً له، بين مركز بيانات الشركة في غرب الولايات المتحدة وشبكتها الواسعة النطاق.

وأدت إزالة هذه المسارات إلى تعطّل حركة البيانات الداخلة إلى منطقة غرب الولايات المتحدة أو الخارجة منها، إلا أن الشركة أوضحت أن حركة البيانات التي تبقى بالكامل داخل المنطقة لم تتأثر.

نطاق واسع من الخدمات السحابية المتأثرة

وتسبب عطل Azure في فشل الاتصال، وزيادة زمن الاستجابة، ومشاكل في الوصول إلى العديد من الخدمات السحابية، من بينها: Azure App Service، وApplication Gateway، وAzure AD B2C، وAzure AI Search، وAzure API Management، وAzure Cosmos DB، وAzure Databricks، وAzure Firewall، وAzure Kubernetes Service، وAzure Monitor، وAzure Virtual Desktop، وExpressRoute، وLog Analytics، وMicrosoft Graph، وMicrosoft Sentinel، وPower BI Embedded، وVirtual WAN، وVPN Gateway.

التسلسل الزمني للتعافي

وذكرت مايكروسوفت أن فريقها الهندسي بدأ التحقيق في المشكلة فور بدء الانقطاع عند الساعة 10:44 صباحاً. وظهرت المشكلة في البداية على هيئة تغييرات واسعة النطاق في مسارات الشبكة الواسعة (WAN)، قبل أن يتمكن المهندسون من تتبع سبب إزالة المسارات إلى مركز بيانات في منطقة غرب الولايات المتحدة، وربطه بنشاط الصيانة الأخير.

وبدأت الشركة عملية التراجع عن تغيير الصيانة عند الساعة 1:45 ظهراً، واكتملت هذه العملية عند الساعة 2:26 ظهراً، ما أدى إلى استعادة البنية التحتية الشبكية المتأثرة وتعافي خدمات Microsoft 365. واستمرت بعض خدمات Azure في التعافي التدريجي بعد تطبيق الإصلاح، وأفادت مايكروسوفت بأن جميع الخدمات المتأثرة استعادت عملها بالكامل بحلول الساعة 3:41 عصراً.

مراجعة داخلية شاملة

وتُجري مايكروسوفت حالياً مراجعة داخلية شاملة تركّز على إجراءات الفحص الأمني والعمليات الآلية المستخدمة في تنفيذ طلبات الصيانة. وأوضحت الشركة أنها ستُجري تحليلاً كاملاً يركّز على فحوصات السلامة، وعملية تغيير طلبات الصيانة الآلية، وجوانب أخرى، في إطار المراجعة الداخلية اللاحقة لمعالجة الحادثة.

وذكرت الشركة أنها ستنشر تقرير مراجعة نهائياً لما بعد الحادثة (Post Incident Review) بعد استكمال تحقيقها، والذي عادة ما يستغرق 14 يوماً.

Scroll to Top