AMS1核心交换机故障 — 网络性能降级,持续4小时12分
摘要。 UTC 03:17,AMS1 机柜的主用架顶交换机(TOR)在 48 个端口中的 22 个端口上停止转发流量。约 40% 的阿姆斯特丹 VPS 实例失去外部连接,其余实例在冗余路径上出现延迟升高和丢包。所有服务已于 UTC 07:29 前完全恢复。未丢失任何数据,存储层未受影响。
根本原因。 主交换机线卡上的ASIC故障,由缓冲区管理单元中的固件缺陷触发(供应商公告PSIRT-2026-041,在我们事件后发布)。自动故障转移已切换到备用交换机,但一个聚合组上LACP哈希配置错误,导致22个端口仍绑定在故障单元上。
修复措施。 UTC 07:12,我们用现场备件更换了故障线卡,并重新平衡了 LACP 组。此后,我们在所有 AMS1 和 ZRH1 交换机上应用了厂商固件补丁,新增了每季度一次的自动故障切换演练(验证每个端口组而非仅主链路),并部署了按端口的转发遥测。这样,部分失效的交换机不再依赖聚合链路状态,而是会在 60 秒内通过寻呼告警通知我们。
积分。 该事件违反了我们面向受影响阿姆斯特丹客户的月度 99.9% SLA。SLA 补偿已自动应用于该时间窗口内处于活动状态的所有 AMS1 服务 — 无需提交工单。详见 我们的SLA.
- 03:17 UTC — 监控在3台AMS1虚拟机监控程序上标记数据包丢失。值班人员已收到通知。
- 03:24 UTC — 已确认:主ToR交换机在22/48端口上未转发数据。故障转移部分生效。
- 03:41 UTC — 状态页面已更新为荷兰“性能降级”。流量已切换至备用路径。
- 05:02 UTC — 数据中心远程运维人员已派往机架更换线卡。
- 07:12 UTC — 线卡已更换,LACP 组已重新平衡,完全转发已恢复。
- 07:29 UTC — 所有检查通过。事件已标记为已解决。总影响时间:4小时12分钟。
- 2026-06-16 — 固件补丁已在预发布环境验证,并已部署至 AMS1 和 ZRH1。
- 2026-06-21 — 本回顾已发布。SLA 积分已应用。