Falha do switch central AMS1 — rede degradada, 4h12m
Resumo. Às 03:17 UTC, o switch principal top-of-rack do nosso rack AMS1 deixou de encaminhar tráfego em 22 das suas 48 portas. Cerca de 40 % das instâncias VPS de Amesterdão perderam conectividade externa; as restantes registaram latência elevada e perda de pacotes no caminho redundante. Todos os serviços foram totalmente restaurados às 07:29 UTC. Não se perderam dados e nenhuma camada de armazenamento foi afetada.
Causa raiz. Um ASIC com falha na placa de linha do switch principal, acionado por um bug de firmware no módulo de gerenciamento de buffer (aviso do fornecedor PSIRT-2026-041, publicado após nosso incidente). O failover automático para o switch secundário foi ativado, mas um hash LACP mal configurado em um grupo de agregação deixou 22 portas presas à unidade morta.
Remediação. A placa de linha defeituosa foi substituída por uma peça de reposição no local às 07:12 UTC e os grupos LACP foram reequilibrados. Desde então, aplicámos a correção de firmware do fornecedor em todos os switches AMS1 e ZRH1, adicionámos um exercício trimestral automatizado de failover que verifica cada grupo de portas em vez de apenas a ligação mestre, e implementámos telemetria de encaminhamento por porta para que um switch parcialmente avariado nos alerte em menos de 60 segundos em vez de depender do estado agregado da ligação.
Créditos. O evento violou o nosso SLA mensal de 99.9 % para os clientes de Amesterdão afetados. Os créditos SLA foram aplicados automaticamente a todos os serviços AMS1 ativos durante a janela — sem necessidade de ticket, de acordo com os nosso SLA.
- 03:17 UTC — Monitoramento sinaliza perda de pacotes em 3 hipervisores AMS1. Plantão acionado.
- 03:24 UTC — Confirmado: switch ToR primário não encaminhando em 22/48 portas. Failover parcialmente ativado.
- 03:41 UTC — Página de status atualizada para "desempenho degradado" nos Países Baixos. Tráfego redirecionado para caminho secundário.
- 05:02 UTC — Equipe remota do datacenter enviada ao rack para substituição da placa de linha.
- 07:12 UTC — Placa de linha substituída, grupos LACP rebalanceados, encaminhamento completo restaurado.
- 07:29 UTC — Todas as verificações em verde. Incidente marcado como resolvido. Impacto total: 4h12m.
- 2026-06-16 — Patch de firmware validado em staging, implantado em AMS1 e ZRH1.
- 2026-06-21 — Esta retrospectiva publicada. Créditos de SLA aplicados.