微软Azure美国西部区域发生近5小时云服务故障
微软Azure美国西部区域近日发生大范围网络连接故障,部分客户在访问Azure及其他托管于该区域的微软云服务时,出现连接失败、访问延迟升高或服务无法正常使用等情况。根据微软Azure状态历史页面披露,此次故障影响时间为2026年7月23日14时44分至19时41分(UTC),持续接近5个小时。受影响范围主要涉及进入或离开美国西部区域的数据流量,而完全在该区域内部传输的流量未受到相同程度影响。
多项Azure核心服务受到影响
微软公布的受影响服务包括Azure App Service、Application Gateway、Azure API Management、Azure AI Search、Azure Cosmos DB、Azure Kubernetes Service、Azure Firewall、Azure Monitor、Azure Virtual Desktop、ExpressRoute、VPN Gateway、Microsoft Sentinel以及Power BI Embedded等。
从受影响服务名单来看,此次事件并非单一虚拟机或存储节点故障,而是涉及区域网络出入口的连接问题。对于依赖Azure美国西部区域运行网站、数据库、API、容器平台以及企业远程桌面的客户而言,业务可能出现访问速度下降、请求超时或跨区域连接失败。
维护请求转换错误导致路由被意外移除
微软表示,故障发生前,运维团队正在执行例行网络设备维护。正常情况下,维护系统会将操作请求转换为机器可读取的指令,并检查两条冗余网络路径中至少有一条保持健康。但此次维护过程中,请求转换系统出现程序错误,将额外的网络设备错误标记为维护对象,导致数据中心与广域网之间的部分IP路由从超出预期数量的设备中被移除。工程团队最初观察到广域网出现大规模路由变化,随后将问题定位至美国西部区域的数据中心。微软于17时45分启动维护变更回滚,18时26分完成网络恢复,并在19时41分确认所有受影响服务全部恢复。
云服务器用户应重新评估单区域部署风险
此次故障说明,即便云服务商拥有冗余网络和自动化安全检查,维护系统、路由配置及变更流程仍可能形成区域级风险。
对于使用美国云服务器开展跨境电商、在线游戏、SaaS平台、API接口或企业应用的用户,不应仅依靠同一个云区域内的多台服务器。因为当故障发生在区域出口网络时,同一区域内增加虚拟机数量并不能完全解决外部访问问题。
更稳妥的架构包括:
- 在不同云区域部署业务副本;
- 使用全球流量调度或DNS故障切换;
- 将数据库备份保存到其他区域;
- 为核心接口配置独立监控;
- 定期测试跨区域故障切换流程;
- 对关键业务保留第二家云服务商或独立服务器资源。
本次Azure故障的重点不只是持续时间,而是自动化维护错误可以同时影响多个网络设备和区域出口路由。企业选择云服务器或服务器租用方案时,除了关注CPU、内存、带宽和价格,还应重点确认数据中心区域、上游网络、备用线路、故障切换能力以及服务商是否能够提供多区域资源。对于访问来源覆盖北美、亚洲和欧洲的全球业务,单一区域架构可能节省短期成本,却会增加区域故障发生时的业务中断风险。多区域部署、BGP线路优化和异地备份应逐步成为核心业务的基础配置。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。