Azure East US故障 ChatGPT/Claude/Grok罕见同时宕机90分钟
据 The Register 报道,2026年9月3日(周四),微软 Azure East US 区域发生基础设施故障,持续约90分钟,罕见地同时击穿了三家相互竞争的 AI 实验室——OpenAI 的 ChatGPT、Anthropic 的 Claude 与 xAI 的 Grok 在同一时间段出现大面积报障。这是2026年以来首次出现三家独立 AI 厂商同时可见宕机的事件。
故障位于共享基础设施深层
值得注意的是,微软自家的 Copilot 同样在当天上午出现稳定性与宕机问题。分析指出,如果 Azure 的第一方 AI 产品都无法幸免,说明故障发生在共享基础设施的深层(区域网络、负载均衡等),而非某个客户的配置问题。OpenAI 因与微软深度绑定 Azure,正常运行时间与 Azure 区域健康高度耦合;Anthropic 虽然长期采用横跨 AWS、Google Cloud 与 Azure 的多云策略,但报障峰值表明其相当比例的生产流量仍经由 Azure 相关链路。谷歌 Gemini 则是结构性的例外——其从自研芯片到数据中心网络全部自持,不存在绑定第三方云的单点故障。
SpaceX为孟菲斯算力中心断电致歉
同日还有一个插曲:SpaceX 发文为其孟菲斯算力中心当天上午的断电事故道歉,称"对 Grok 用户造成的问题表示歉意,同时也向受影响的算力合作伙伴致歉"。这解释了 Grok 部分故障的来源。
行业观察人士指出,2026年对所有主流云厂商而言都是"可靠性艰难之年",此次事件延续了一个一致的规律:出问题的很少是 AI 模型本身,而是模型脚下的云区域、边缘网络或流量调度层。
连年营收数千亿美元的超大规模云厂商也无法承诺单区域永不宕机,这正是"多活架构"从可选项变为必选项的原因。对出海业务而言,务实的做法是:核心业务落在独立物理服务器保证确定性,弹性流量交给云,并跨机房/跨区域做灾备。SellBGP 在中国香港、美国、日本、韩国、新加坡等地提供 物理服务器 与 云服务器 混合部署方案,帮助企业把"单区域依赖"降到最低。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。