สวิตช์หลัก AMS1 ขัดข้อง — เครือข่ายเสื่อมสภาพ, 4 ชั่วโมง 12 นาที
สรุป. เมื่อ 03:17 UTC สวิตช์ top-of-rack หลักในแร็ค AMS1 ของเราหยุดส่งต่อทราฟฟิกบนพอร์ต 22 จาก 48 พอร์ต อินสแตนซ์ VPS อัมสเตอร์ดัมราว 40% สูญเสียการเชื่อมต่อภายนอก ส่วนที่เหลือพบความหน่วงสูงและ packet loss บนเส้นทางสำรอง บริการทั้งหมดกลับมาใช้งานได้เต็มรูปแบบเมื่อ 07:29 UTC ไม่มีข้อมูลสูญหายและไม่มีเลเยอร์จัดเก็บข้อมูลใดได้รับผลกระทบ
สาเหตุต้นตอ. ASIC เสื่อมบนไลน์การ์ดของสวิตช์หลัก เกิดจากบั๊กเฟิร์มแวร์ในหน่วยจัดการบัฟเฟอร์ (คำแนะนำจากผู้ผลิต PSIRT-2026-041 เผยแพร่หลังเหตุการณ์ของเรา) การเฟลโอเวอร์อัตโนมัติไปยังสวิตช์สำรองทำงาน แต่แฮช LACP ที่ตั้งค่าผิดบนกลุ่มรวมหนึ่งกลุ่มทำให้ 22 พอร์ตติดอยู่กับยูนิตที่เสีย
การแก้ไข. เมื่อ 07:12 UTC การ์ด line ที่ชำรุดถูกเปลี่ยนจากอะไหล่ในสถานที่และกลุ่ม LACP ถูกปรับสมดุลใหม่ นับแต่นั้น เราได้ปรับใช้แพตช์เฟิร์มแวร์จากผู้ผลิตบนสวิตช์ AMS1 และ ZRH1 ทั้งหมด เพิ่มการซ้อม failover อัตโนมัติรายไตรมาสที่ตรวจสอบทุกพอร์ตกรุปแทนที่จะเป็นเพียงลิงก์หลัก และใช้งาน telemetry การส่งต่อรายพอร์ต เพื่อให้สวิตช์ที่ล้มเหลวบางส่วนส่ง page ถึงเราภายใน 60 วินาที แทนที่จะพึ่งพาสถานะลิงก์รวม
เครดิต. เหตุการณ์นี้ละเมิด SLA รายเดือน 99.9% ของเราสำหรับลูกค้าอัมสเตอร์ดัมที่ได้รับผลกระทบ เครดิต SLA ถูกใช้โดยอัตโนมัติกับบริการ AMS1 ทั้งหมดที่ใช้งานอยู่ในช่วงเวลาดังกล่าว — ไม่จำเป็นต้องเปิด ticket ตาม SLA ของเรา.
- 03:17 UTC — การตรวจสอบพบการสูญเสียแพ็กเก็ตบนไฮเปอร์ไวเซอร์ AMS1 จำนวน 3 เครื่อง เรียกทีมปฏิบัติการ
- 03:24 UTC — ยืนยัน: สวิตช์ ToR หลักไม่ส่งต่อบน 22/48 พอร์ต เฟลโอเวอร์ทำงานบางส่วน
- 03:41 UTC — สถานะอัปเดตเป็น "ประสิทธิภาพลดลง" สำหรับเนเธอร์แลนด์ ปริมาณการใช้งานถูกเปลี่ยนเส้นทางไปยังเส้นทางสำรอง
- 05:02 UTC — เจ้าหน้าที่ภาคสนามที่ศูนย์ข้อมูลถูกส่งไปยังแร็คเพื่อเปลี่ยนไลน์การ์ด
- 07:12 UTC — เปลี่ยนไลน์การ์ดแล้ว ปรับสมดุล LACP groups ใหม่ คืนค่าการส่งข้อมูลเต็มรูปแบบ
- 07:29 UTC — การตรวจสอบทั้งหมดผ่านเกณฑ์ เหตุการณ์ถูกปิด ผลกระทบรวม: 4 ชั่วโมง 12 นาที
- 2026-06-16 — แพตช์เฟิร์มแวร์ผ่านการตรวจสอบใน staging แล้ว ถูกนำไปใช้กับ AMS1 และ ZRH1
- 2026-06-21 — บทสรุปย้อนหลังนี้ถูกเผยแพร่ เครดิต SLA ถูกนำไปใช้