Namecheap全球宕机30小时复盘:机房冷却故障,5000+服务器被迫关停
一场风暴、一套冷却系统,瘫痪了全球最大域名注册商之一的核心业务。美国域名与主机服务巨头 Namecheap 于8月13日10:28 UTC起遭遇重大故障:其核心基础设施所在的 凤凰城 RadiusDC 数据中心(2026年初从 PhoenixNAP 收购)因风暴导致冷却系统瘫痪,机房温度快速攀升。为避免硬件被"烤毁",Namecheap选择主动关停 超过5000台服务器,直至8月14日17:00 UTC宣告恢复,全程 30小时32分钟。
为什么影响远超一次普通宕机
此次事故的杀伤力在于"单点故障"叠加:
共享主机、EasyWP、VPS等托管业务 全线下线;权威DNS服务器与故障机房处于同一故障域——即使网站托管在别处,只要 NS 指向 Namecheap,同样无法解析;
Private Email 企业邮箱 中断,恢复初期还出现"能登录但邮箱为空"的分阶段恢复现象;
官网、控制台与客服工单系统 也在同一机房,用户连提交工单都做不到,官方被迫临时把客户支持转移到 Microsoft Teams。
Namecheap表示邮件不会丢失(发送方服务器会自动排队重试),且本次事故无数据损失。恢复按三阶段推进:物理网络设备→虚拟网络设备→客户服务。
官方澄清:不是DDoS攻击
事故期间,部分媒体将此次宕机报道为"DDoS攻击+断电"。但核查Namecheap状态页、官方X账号、CEO公开声明及RadiusDC状态页,所有一手信源均指向 设施级冷却/电力故障,并未提及任何攻击行为——"DDoS"说法系与该公司2024年2月一次已确认的DDoS事件混淆。
CEO Hillan Klein 全程公开发布进展,并罕见直言公司"辜负了客户",承诺发布完整复盘报告,并在美国、欧洲与亚洲数据中心之间 增加冗余架构,避免控制平面再次集中于单一机房。
这次事故给所有站长上了一课:托管、DNS、邮箱、客服系统不要押在同一个故障域。选择服务商时,多地域机房与异地备份能力比价格更重要。SellBGP 在中国香港、美国、日本、韩国、新加坡等地运营多节点机房,香港云服务器 支持定时快照与异地备份策略,配合 高存储服务器 可实现核心数据一键回滚,帮助业务在极端故障下快速恢复。
声明:本文由SellBGP编辑部依据公开渠道信息独立撰写。转载请注明出处。