谷歌云荷兰数据中心电力冷却故障,europe-west4中断近15小时
据谷歌云发布的事故报告,其位于荷兰的europe-west4可用区在7月中旬发生一起电力与冷却故障,导致多项服务中断,总时长达14小时55分钟。该事件再次提醒企业:即便是头部云厂商,单一可用区的物理故障也可能造成长时间的服务不可用。
3毫秒电压跌落引发连锁反应
根据谷歌的复盘,事故根因是来自公用事业供电方的一次约3毫秒电压跌落,以及随后市电断路器的保护性动作。该区域数据中心的两路市电馈线(A、B)断路器均跳闸,随后启动向后备电源DRUPS(柴油旋转不间断电源)的切换。在切换过程中,承载服务的主机与网络交换机因热保护被断电,最终导致客户失去连接。
受影响的服务包括谷歌云VMware引擎(GCVE)、裸金属方案(Bare Metal Solution)与NetApp Volumes:GCVE客户失去了对其私有云与工作负载的连接,裸金属方案客户失去了对数据存储系统的连接。故障由数据中心团队修复失效系统、谷歌工程团队随后恢复服务后解除。
物理故障仍是云可用性的现实挑战
这起事件表明,尽管云平台在软件与调度层面高度冗余,电力、冷却等物理基础设施的故障依然是影响可用性的现实因素。谷歌表示将与数据中心团队一同复查事件处置SLA与操作手册、建立联合应急演练机制,并评估NetApp集群恢复流程能否进一步加速。
无独有偶,近期多家云厂商均出现过区域性故障,说明单一可用区、单一云厂商的部署方式在极端情况下都存在业务中断的风险。
对云服务器租用客户的建议
对于服务器租用与云服务器客户,此类事件凸显了容灾架构的重要性。建议关键业务采用多可用区甚至多云部署,将核心数据与服务分散在不同的物理机房与供电域,以降低单点物理故障带来的影响。
在选型时,可关注机房的供电冗余(如双路市电、UPS/DRUPS后备)、制冷可靠性与SLA承诺。SellBGP的香港云服务器与美国云服务器部署于T3+级数据中心,配合合理的备份与异地容灾策略,可帮助企业在突发故障中保持业务连续。对企业而言,"不把鸡蛋放在同一个篮子里",依然是应对云中断最有效的策略之一。
声明:本文由SellBGP编辑部依据谷歌云事故报告及公开渠道信息独立撰写。转载请注明出处。