Guasto switch core AMS1 — rete degradata, 4h12m
Sintesi. Alle 03:17 UTC, lo switch top-of-rack primario del nostro rack AMS1 ha smesso di inoltrare traffico su 22 delle 48 porte. Circa il 40% delle istanze VPS di Amsterdam ha perso la connettività esterna; le rimanenti hanno riscontrato latenza elevata e perdita di pacchetti sul percorso ridondante. Tutti i servizi sono stati completamente ripristinati entro le 07:29 UTC. Nessun dato è andato perso e nessun livello storage è stato interessato.
Causa principale. Un ASIC guasto sulla line card dello switch primario, innescato da un bug del firmware nel modulo di gestione del buffer (avviso del fornitore PSIRT-2026-041, pubblicato dopo il nostro incidente). Il failover automatico allo switch secondario si è attivato, ma un hash LACP mal configurato su un gruppo di aggregazione ha lasciato 22 porte bloccate sull'unità guasta.
Rimedio. La line card difettosa è stata sostituita con ricambi disponibili in loco alle 07:12 UTC e i gruppi LACP sono stati riequilibrati. Da allora abbiamo applicato la patch firmware del vendor su tutti gli switch AMS1 e ZRH1, aggiunto una verifica trimestrale automatica di failover che controlla ogni port group anziché solo il link master, e implementato la telemetria di forwarding per porta, così uno switch parzialmente guasto ci invia una page entro 60 secondi invece di basarsi sullo stato aggregato del link.
Crediti. L’evento ha violato il nostro SLA mensile del 99,9% per i clienti di Amsterdam interessati. Gli accrediti SLA sono stati applicati automaticamente a tutti i servizi AMS1 attivi durante la finestra — nessun ticket richiesto, secondo i il nostro SLA.
- 03:17 UTC — Il monitoraggio segnala perdita di pacchetti su 3 hypervisor AMS1. On-call contattato.
- 03:24 UTC — Confermato: switch ToR primario non inoltra su 22/48 porte. Failover parzialmente attivato.
- 03:41 UTC — Pagina di stato aggiornata a "prestazioni degradate" per i Paesi Bassi. Traffico deviato sul percorso secondario.
- 05:02 UTC — Personale remoto del datacenter inviato al rack per la sostituzione della line-card.
- 07:12 UTC — Line-card sostituita, gruppi LACP ribilanciati, inoltro completo ripristinato.
- 07:29 UTC — Tutti i controlli verdi. Incidente chiuso. Impatto totale: 4h12m.
- 2026-06-16 — Patch del firmware validata in staging, distribuita su AMS1 e ZRH1.
- 2026-06-21 — Retrospettiva pubblicata. Crediti SLA applicati.