Azure美西宕机5小时根因公布:维护Bug误删路由
微软近日发布初步事后审查报告(PIR),披露7月23日Azure美西(West US)区域重大宕机的根本原因:一次例行网络设备维护中,维护请求转换软件存在Bug,从远超预期数量的设备上删除了IP路由,导致进出该区域的流量被阻断。
时间线:近5小时不可用
故障自7月23日14:44 UTC开始,至19:41 UTC恢复,持续近5小时。期间客户遭遇间歇性连接失败、延迟升高或无法访问Azure及其他微软云服务;完全运行在美西区域内部的工作负载未受影响,但所有进出该区域的流量均被波及。工程团队在定位到受影响的数据中心路径后回滚了维护变更,服务随之恢复。
波及20余项云服务与微软全家桶
据微软状态页与PIR,受影响服务包括应用网关、AKS(Azure Kubernetes服务)、Cosmos DB、ExpressRoute、Azure虚拟桌面、Sentinel、Azure防火墙等20余项;Outlook、Teams、SharePoint、OneDrive乃至Xbox Live等办公与消费服务也出现大面积访问异常,大量下游SaaS随之"躺枪"。
今年第二起重大宕机
值得注意的是,这是微软今年第二起重大区域性故障——今年2月,美西与美东区域曾发生长达约10小时的服务中断。接连的事故再次凸显单区域部署的集中性风险。
再强大的云也无法承诺永不宕机,跨区域、跨云的容灾架构才是业务连续性的根本保障。SellBGP在中国香港、美国、日本、韩国等6大地区提供云服务器与物理服务器,支持跨机房容灾部署,帮助企业把"单点风险"降到最低。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。