AMS1 코어 스위치 장애 — 네트워크 성능 저하, 4시간 12분
요약. 03:17 UTC에 AMS1 랙의 기본 톱 오브 랙 스위치가 48개 포트 중 22개 포트에서 트래픽 전달을 중단했습니다. 암스테르담 VPS 인스턴스의 약 40%가 외부 연결을 잃었고, 나머지는 이중화 경로에서 지연 증가와 패킷 손실이 발생했습니다. 모든 서비스는 07:29 UTC까지 완전히 복구되었습니다. 데이터 손실은 없었으며 스토리지 계층도 영향을 받지 않았습니다.
근본 원인. 기본 스위치 라인 카드의 ASIC 결함으로, 버퍼 관리 유닛의 펌웨어 버그로 인해 발생했습니다(벤더 권고 PSIRT-2026-041, 당사 장애 이후 게시). 보조 스위치로의 자동 장애 조치가 작동했지만, 하나의 집계 그룹에서 잘못 구성된 LACP 해시로 인해 22개 포트가 장애 유닛에 고정되었습니다.
조치. 07:12 UTC에 현장 예비 부품으로 고장 난 라인 카드를 교체하고 LACP 그룹을 재조정했습니다. 이후 벤더 펌웨어 패치를 AMS1 및 ZRH1 스위치 전체에 적용했고, 마스터 링크만이 아닌 모든 포트 그룹을 검증하는 분기별 자동 페일오버 훈련을 추가했으며, 포트별 전달 원격 측정을 배포했습니다. 이제 부분적으로 다운 상태의 스위치는 집계 링크 상태에 의존하는 대신 60초 이내에 페이지로 알려줍니다.
크레딧. 이 사건은 영향을 받은 암스테르담 고객에 대한 월 99.9% SLA를 위반했습니다. SLA 크레딧은 해당 기간 동안 활성 상태였던 모든 AMS1 서비스에 자동으로 적용되었습니다 — 티켓 없이도 됩니다. 자세한 내용은 당사 SLA.
- 03:17 UTC — 모니터링이 3개 AMS1 하이퍼바이저에서 패킷 손실을 감지. 온콜 호출.
- 03:24 UTC — 확인: 기본 ToR 스위치가 22/48 포트에서 전달 중단. 장애 조치 부분 작동.
- 03:41 UTC — 상태 페이지가 네덜란드에 대해 "성능 저하"로 업데이트되었습니다. 트래픽이 보조 경로로 전환되었습니다.
- 05:02 UTC — 데이터센터 원격 핸즈가 라인 카드 교체를 위해 랙에 파견되었습니다.
- 07:12 UTC — 라인 카드 교체 완료, LACP 그룹 재조정, 전체 포워딩 복구 완료.
- 07:29 UTC — 모든 점검 정상. 사건 종결 처리. 총 영향 시간: 4시간 12분.
- 2026-06-16 — 펌웨어 패치가 스테이징에서 검증되어 AMS1 및 ZRH1에 배포되었습니다.
- 2026-06-21 — 이 회고가 게시되었습니다. SLA 크레딧이 적용되었습니다.