Panne du commutateur principal AMS1 — réseau dégradé, 4 h 12
Résumé. À 03:17 UTC, le switch principal top-of-rack de notre baie AMS1 a cessé de forwarder le trafic sur 22 de ses 48 ports. Environ 40 % des instances VPS d'Amsterdam ont perdu toute connectivité externe ; les autres ont subi une latence élevée et des pertes de paquets sur le chemin redondant. Tous les services ont été pleinement rétablis à 07:29 UTC. Aucune donnée n'a été perdue et aucune couche de stockage n'a été affectée.
Cause racine. Une puce ASIC défaillante sur la carte de ligne du commutateur principal, déclenchée par un bug du firmware dans l'unité de gestion des tampons (avis du fournisseur PSIRT-2026-041, publié après notre incident). Le basculement automatique vers le commutateur secondaire s'est engagé, mais un hash LACP mal configuré sur un groupe d'agrégation a laissé 22 ports épinglés à l'unité défaillante.
Remédiation. La carte de ligne défectueuse a été remplacée par une pièce de rechange sur site à 07:12 UTC et les groupes LACP ont été rééquilibrés. Nous avons depuis appliqué le correctif firmware du fournisseur sur tous les switches AMS1 et ZRH1, ajouté un exercice automatisé de bascule trimestriel qui vérifie chaque groupe de ports plutôt que seulement le lien maître, et déployé une télémétrie de forwarding par port pour qu'un switch partiellement défaillant nous alerte en moins de 60 secondes au lieu de s'appuyer sur l'état agrégé des liens.
Crédits. L'événement a enfreint notre SLA mensuel de 99.9 % pour les clients d'Amsterdam concernés. Les crédits SLA ont été appliqués automatiquement à tous les services AMS1 actifs pendant la fenêtre — aucun ticket nécessaire, conformément aux notre SLA.
- 03:17 UTC — La surveillance signale une perte de paquets sur 3 hyperviseurs AMS1. L'astreinte est notifiée.
- 03:24 UTC — Confirmé : le commutateur ToR principal ne transmet pas sur 22/48 ports. Basculement partiellement engagé.
- 03:41 UTC — Page de statut mise à jour : « performances dégradées » pour les Pays-Bas. Trafic basculé sur le chemin secondaire.
- 05:02 UTC — Techniciens du datacenter dépêchés sur site pour remplacement de la carte de ligne.
- 07:12 UTC — Carte de ligne remplacée, groupes LACP rééquilibrés, transfert intégral rétabli.
- 07:29 UTC — Tous les contrôles sont au vert. Incident clôturé. Impact total : 4h12m.
- 2026-06-16 — Correctif firmware validé en préproduction, déployé sur AMS1 et ZRH1.
- 2026-06-21 — Cette rétrospective publiée. Crédits SLA appliqués.