خرابی سوئیچ اصلی AMS1 — شبکهسازی کاهشیافته، ۴ ساعت و ۱۲ دقیقه
خلاصه. در ساعت 03:17 UTC، سوئیچ اصلی روی رک در رک AMS1 از هدایت ترافیک روی 22 از 48 پورت بازایستاد. حدود ٪40 از نمونههای VPS آمستردام اتصال خارجی خود را از دست دادند؛ بقیه با تأخیر بیش از حد و از دست رفتن بسته روی مسیر پشتیبان مواجه شدند. تمام سرویسها تا ساعت 07:29 UTC بهطور کامل بازیابی شدند. هیچ دادهای از دست نرفت و هیچ لایه ذخیرهسازی تحت تأثیر قرار نگرفت.
علت ریشهای. یک ASIC خراب در کارت خط سوئیچ اصلی، ناشی از یک باگ فریمور در واحد مدیریت بافر (مشاوره فروشنده PSIRT-2026-041، پس از رویداد ما منتشر شد). Failover خودکار به سوئیچ ثانویه فعال شد، اما یک هش LACP اشتباه پیکربندیشده در یک گروه تجمیع، ۲۲ پورت را به واحد مرده متصل نگه داشت.
اقدام اصلاحی. کارت خط معیوب در ساعت 07:12 UTC از قطعات یدکی موجود در محل تعویض شد و گروههای LACP دوباره متوازن شدند. از آن زمان، وصله فریمافزار سازنده را روی تمام سوئیچهای AMS1 و ZRH1 اعمال کردهایم، یک تمرین خودکار سهماهه برای failover اضافه کردهایم که هر گروه پورت را بررسی میکند نه فقط لینک اصلی را، و پایش تلهمتری هدایت دادهها را برای هر پورت مستقر کردهایم تا یک سوئیچ نیمهمرده ظرف 60 ثانیه به ما هشدار دهد بهجای تکیه بر وضعیت تجمیعی لینک.
اعتبارات. این رویداد SLA ماهانه ٪99.9 ما را برای مشتریان متأثر آمستردام نقض کرد. اعتبارات SLA بهطور خودکار برای تمام سرویسهای AMS1 که در آن بازه فعال بودند اعمال شد — بدون نیاز به تیکت، طبق SLA ما.
- ۰۳:۱۷ UTC — مانیتورینگ از دست رفتن بسته را در ۳ هایپروایزر AMS1 علامتگذاری میکند. فرد کشیک صفحهبندی شد.
- ۰۳:۲۴ UTC — تأیید شد: سوئیچ اصلی ToR در ۲۲/۴۸ پورت ارسال نمیکند. Failover تا حدی فعال شد.
- ۰۳:۴۱ UTC — وضعیت صفحه به «عملکرد کاهشیافته» برای هلند بهروزرسانی شد. ترافیک به مسیر ثانویه منتقل شد.
- 05:02 UTC — تکنسینهای دیتاسنتر برای تعویض کارت خط به رک اعزام شدند.
- 07:12 UTC — کارت خط تعویض شد، گروههای LACP متوازن شدند، مسیریابی کامل بازیابی شد.
- 07:29 UTC — همه بررسیها سبز هستند. حادثه بهعنوان حلشده ثبت شد. تأثیر کل: ۴ ساعت و ۱۲ دقیقه.
- 2026-06-16 — وصله سیستمافزار در محیط آزمایشی تأیید شد و به AMS1 و ZRH1 اعمال شد.
- 2026-06-21 — این بازبینی منتشر شد. اعتبارات SLA اعمال شد.