AMS1-Core-Switch-Ausfall — beeinträchtigtes Netzwerk, 4h12m
Zusammenfassung. Um 03:17 UTC stellte der primäre Top-of-Rack-Switch in unserem AMS1-Rack die Weiterleitung auf 22 von 48 Ports ein. Etwa 40 % der Amsterdamer VPS-Instanzen verloren die externe Konnektivität; die übrigen verzeichneten erhöhte Latenz und Paketverluste auf dem redundanten Pfad. Alle Dienste wurden bis 07:29 UTC vollständig wiederhergestellt. Es gingen keine Daten verloren, und keine Speicherschicht war betroffen.
Ursache. Ein defekter ASIC auf der Linecard des primären Switches, ausgelöst durch einen Firmware-Bug in der Pufferverwaltungseinheit (Herstellerhinweis PSIRT-2026-041, nach unserem Vorfall veröffentlicht). Automatisches Failover auf den sekundären Switch griff, aber ein falsch konfigurierter LACP-Hash auf einer Aggregationsgruppe ließ 22 Ports an der toten Einheit hängen.
Behebung. Die defekte Linecard wurde um 07:12 UTC aus dem lokalen Ersatzteillager getauscht und die LACP-Gruppen neu ausgewogen. Seitdem haben wir den Firmware-Patch des Herstellers auf allen Switches in AMS1 und ZRH1 eingespielt, ein vierteljährliches automatisiertes Failover-Training ergänzt, das jede Portgruppe und nicht nur den Master-Link prüft, und eine Weiterleitungs-Telemetrie pro Port eingerichtet, damit ein teilweise ausgefallener Switch uns innerhalb von 60 Sekunden alarmiert, statt sich auf den aggregierten Link-Status zu verlassen.
Gutschriften. Der Vorfall verletzte unsere monatliche SLA von 99.9 % für betroffene Amsterdamer Kunden. SLA-Gutschriften wurden automatisch auf alle während des Zeitraums aktiven AMS1-Dienste angewendet — ohne Ticket, gemäß unserer SLA.
- 03:17 UTC — Monitoring meldet Paketverluste auf 3 AMS1-Hypervisoren. Bereitschaftspersonal alarmiert.
- 03:24 UTC — Bestätigt: Primärer ToR-Switch leitet auf 22/48 Ports nicht weiter. Failover teilweise aktiviert.
- 03:41 UTC — Statusseite auf "verminderte Leistung" für Niederlande aktualisiert. Verkehr auf sekundären Pfad umgeleitet.
- 05:02 UTC — Rechenzentrum-Fernhände zum Rack entsandt, um Line-Card auszutauschen.
- 07:12 UTC — Line-Card ersetzt, LACP-Gruppen neu ausbalanciert, vollständige Weiterleitung wiederhergestellt.
- 07:29 UTC — Alle Checks grün. Vorfall als behoben markiert. Gesamtauswirkung: 4h12m.
- 2026-06-16 — Firmware-Patch in Staging validiert, auf AMS1 und ZRH1 ausgerollt.
- 2026-06-21 — Dieses Retrospektiv veröffentlicht. SLA-Gutschriften angewendet.