Awaria przełącznika rdzeniowego AMS1 — degradacja sieci, 4 h 12 min
Podsumowanie. O 03:17 UTC podstawowy przełącznik top-of-rack w naszej szafie AMS1 przestał przekazywać ruch na 22 z 48 portów. Około 40% instancji VPS w Amsterdamie utraciło łączność zewnętrzną; pozostałe odnotowały podwyższone opóźnienia i utratę pakietów na ścieżce redundantnej. Wszystkie usługi zostały w pełni przywrócone do 07:29 UTC. Nie utracono żadnych danych i żadna warstwa storage nie została naruszona.
Przyczyna źródłowa. Uszkodzony ASIC na karcie liniowej głównego przełącznika, wywołany błędem firmware w jednostce zarządzania buforem (zalecenie producenta PSIRT-2026-041, opublikowane po naszym incydencie). Automatyczne przełączenie na zapasowy przełącznik zadziałało, ale błędnie skonfigurowany hash LACP w jednej grupie agregacji pozostawił 22 porty przypięte do martwej jednostki.
Naprawa. Uszkodzona karta liniowa została wymieniona z zapasów na miejscu o 07:12 UTC, a grupy LACP zostały ponownie zbalansowane. Od tego czasu zastosowaliśmy łatkę firmware’u producenta na wszystkich przełącznikach AMS1 i ZRH1, dodaliśmy kwartalny, zautomatyzowany test failover, który weryfikuje każdą grupę portów, a nie tylko łącze główne, oraz wdrożyliśmy telemetrię przekazywania ruchu per port, dzięki czemu częściowo uszkodzony przełącznik wygeneruje nam page’a w ciągu 60 sekund, zamiast polegać na zagregowanym stanie łącza.
Kredyty. Zdarzenie naruszyło nasze miesięczne SLA na poziomie 99,9% dla klientów w Amsterdamie. Środki SLA zostały naliczone automatycznie na wszystkie usługi AMS1 aktywne w tym oknie — bez konieczności zgłoszenia ticketu, zgodnie z naszym SLA.
- 03:17 UTC — Monitoring sygnalizuje utratę pakietów na 3 hiperwizorach AMS1. Dyżurny powiadomiony.
- 03:24 UTC — Potwierdzone: główny przełącznik ToR nie przekazuje ruchu na 22/48 portów. Przełączenie awaryjne częściowo zadziałało.
- 03:41 UTC — Strona statusu zaktualizowana do „obniżona wydajność” dla Holandii. Ruch przekierowany na ścieżkę zapasową.
- 05:02 UTC — Personel techniczny centrum danych wysłany do szafy rack w celu wymiany karty liniowej.
- 07:12 UTC — Karta liniowa wymieniona, grupy LACP zrównoważone, pełne przekazywanie ruchu przywrócone.
- 07:29 UTC — Wszystkie kontrole zielone. Incydent oznaczony jako rozwiązany. Łączny wpływ: 4h12m.
- 2026-06-16 — Poprawka oprogramowania układowego zweryfikowana w środowisku testowym, wdrożona na AMS1 i ZRH1.
- 2026-06-21 — Opublikowano retrospektywę. Przyznano kredyty SLA.