Lỗi switch lõi AMS1 — mạng suy giảm, 4h12m
Tóm tắt. Vào 03:17 UTC, switch top-of-rack chính trong rack AMS1 của chúng tôi đã ngừng chuyển tiếp lưu lượng trên 22 trong 48 cổng. Khoảng 40% instance VPS Amsterdam mất kết nối bên ngoài; phần còn lại gặp độ trễ cao và mất gói trên đường dự phòng. Mọi dịch vụ đã được khôi phục hoàn toàn lúc 07:29 UTC. Không mất dữ liệu và không có lớp lưu trữ nào bị ảnh hưởng.
Nguyên nhân gốc. Một ASIC lỗi trên line card của switch chính, kích hoạt bởi lỗi firmware trong đơn vị quản lý bộ đệm (khuyến cáo từ nhà cung cấp PSIRT-2026-041, công bố sau sự cố của chúng tôi). Chuyển đổi dự phòng tự động sang switch phụ đã kích hoạt, nhưng một hash LACP cấu hình sai trên một nhóm tổng hợp khiến 22 cổng bị khóa vào thiết bị chết.
Khắc phục. Thẻ line bị lỗi đã được thay từ linh kiện dự phòng tại chỗ lúc 07:12 UTC và các nhóm LACP đã được cân bằng lại. Kể từ đó, chúng tôi đã áp dụng bản vá firmware của nhà cung cấp trên tất cả switch AMS1 và ZRH1, thêm bài diễn tập failover tự động theo quý kiểm tra từng nhóm cổng thay vì chỉ liên kết chính, và triển khai telemetry forwarding theo từng cổng để một switch bị lỗi một phần gửi cảnh báo page cho chúng tôi trong vòng 60 giây thay vì dựa vào trạng thái liên kết tổng hợp.
Bồi thường. Sự cố này đã vi phạm SLA tháng 99.9% của chúng tôi đối với khách hàng Amsterdam bị ảnh hưởng. Khoản tín dụng SLA đã được áp dụng tự động cho tất cả dịch vụ AMS1 đang hoạt động trong khoảng thời gian đó — không cần gửi ticket, theo SLA của chúng tôi.
- 03:17 UTC — Giám sát phát hiện mất gói trên 3 hypervisor AMS1. Trực ca được gọi.
- 03:24 UTC — Xác nhận: switch ToR chính không chuyển tiếp trên 22/48 cổng. Dự phòng kích hoạt một phần.
- 03:41 UTC — Trang trạng thái được cập nhật thành "hiệu năng suy giảm" cho Hà Lan. Lưu lượng được chuyển sang đường dự phòng.
- 05:02 UTC — Kỹ thuật viên trung tâm dữ liệu được cử đến rack để thay thế line-card.
- 07:12 UTC — Line-card đã được thay, nhóm LACP cân bằng lại, chuyển tiếp dữ liệu khôi phục hoàn toàn.
- 07:29 UTC — Mọi kiểm tra đều xanh. Sự cố được đánh dấu đã xử lý. Tổng thời gian ảnh hưởng: 4h12m.
- 2026-06-16 — Bản vá firmware được xác nhận trong môi trường staging, triển khai đến AMS1 và ZRH1.
- 2026-06-21 — Báo cáo hậu sự cố này được công bố. Tín dụng SLA đã được áp dụng.