Fallo del switch central AMS1 — red degradada, 4h12m
Resumen. A las 03:17 UTC, el switch principal top-of-rack de nuestro rack AMS1 dejó de reenviar tráfico en 22 de sus 48 puertos. Aproximadamente el 40 % de las instancias VPS de Ámsterdam perdieron conectividad externa; el resto experimentó latencia elevada y pérdida de paquetes en la ruta redundante. Todos los servicios quedaron completamente restablecidos a las 07:29 UTC. No se perdió ningún dato y ninguna capa de almacenamiento se vio afectada.
Causa raíz. Un ASIC defectuoso en la tarjeta de línea del switch principal, provocado por un bug de firmware en la unidad de gestión de búfer (aviso del proveedor PSIRT-2026-041, publicado después de nuestro incidente). La conmutación automática al switch secundario se activó, pero un hash LACP mal configurado en un grupo de agregación dejó 22 puertos fijados a la unidad muerta.
Remediación. La tarjeta de línea defectuosa fue sustituida con repuestos del sitio a las 07:12 UTC y los grupos LACP se reequilibraron. Desde entonces hemos aplicado el parche de firmware del proveedor en todos los switches AMS1 y ZRH1, añadido una prueba trimestral automatizada de conmutación por error que verifica cada grupo de puertos en lugar de solo el enlace maestro, y desplegado telemetría de reenvío por puerto para que un switch parcialmente caído nos alerte en menos de 60 segundos en lugar de depender del estado agregado del enlace.
Créditos. El evento incumplió nuestro SLA mensual del 99.9 % para los clientes de Ámsterdam afectados. Los créditos SLA se aplicaron automáticamente a todos los servicios AMS1 activos durante la ventana — sin necesidad de ticket, conforme a los nuestro SLA.
- 03:17 UTC — El monitoreo marca pérdida de paquetes en 3 hipervisores AMS1. Se notifica al guardia de turno.
- 03:24 UTC — Confirmado: el switch ToR principal no reenvía en 22/48 puertos. La conmutación se activó parcialmente.
- 03:41 UTC — Estado de la página actualizado a "rendimiento degradado" para Países Bajos. Tráfico redirigido a ruta secundaria.
- 05:02 UTC — Técnico remoto del centro de datos enviado al rack para reemplazo de tarjeta de línea.
- 07:12 UTC — Tarjeta de línea reemplazada, grupos LACP rebalanceados, reenvío completo restaurado.
- 07:29 UTC — Todas las comprobaciones en verde. Incidente marcado como resuelto. Impacto total: 4h12m.
- 2026-06-16 — Parche de firmware validado en staging, desplegado en AMS1 y ZRH1.
- 2026-06-21 — Esta retrospectiva publicada. Créditos SLA aplicados.