NHN Cloud 7656张B200集群受关注,AI数据中心竞争转向运营能力
随着各国争相建设大型GPU集群,AI数据中心竞争正在出现一个明显变化:拥有GPU只是第一步,能否长期稳定、高效地把GPU运行起来正在成为新的竞争门槛。
韩国专业IT媒体DataNet 8月7日以“AI数据中心竞争力不只取决于GPU,而取决于运营能力”为主题关注NHN Cloud大型AI基础设施。
NHN Cloud此前已经在首尔FactoryX Seoul部署 7656张NVIDIA B200 GPU,形成韩国目前具有代表性的大规模GPU云基础设施之一。
7656张B200背后是高密度数据中心工程
GPU服务器与普通Web服务器最大的区别之一是功耗和散热密度。
根据NHN Cloud公开资料,FactoryX Seoul不仅部署7656张B200,还建设了由 4080张GPU组成的大型单一集群,整体AI算力规模达到约27.4EF。
为了运行这种规模的GPU服务器,数据中心采用最高约75kW级机架高密度设计以及液冷系统。
传统数据中心主要依靠空气把服务器产生的热量带走,但随着GPU功耗持续增加,单纯扩大风量会让制冷效率和机房设计越来越困难。
液冷通过冷却液更直接地带走服务器热量,因此正在成为新一代AI数据中心的重要基础设施。
NHN Cloud此前表示,其液冷架构能够降低制冷能源使用,并提升大规模GPU长期运行的稳定性。
GPU云竞争已经从“买显卡”进入“运营集群”
AI服务器市场过去两年的讨论经常围绕一个数字展开:有多少张GPU。
但对于真正运行大型模型的企业而言,GPU数量并不等于可实际使用的算力。
如果高速网络出现瓶颈,数千张GPU之间的数据交换会受到限制;如果资源调度效率不足,大量昂贵GPU可能处于空闲状态;如果制冷、电力或存储系统设计不合理,则可能出现降频甚至服务器故障。
因此,大型GPU云服务器平台实际需要同时解决计算、网络、存储、电力、冷却、资源调度和故障处理。
这也是越来越多云服务商开始强调GPUaaS运营能力,而不只是公布GPU采购数量的原因。
GPUaaS降低企业自建AI集群门槛
NHN Cloud已经把部分GPU资源通过GPUaaS方式提供给公共部门、企业、大学及科研机构使用。
这类模式对AI创业公司尤其有吸引力。
企业如果自行采购数十甚至数百张高端GPU,还需要同步建设高速网络、存储系统、电力和散热环境,并招聘专业运维团队。采用GPU云服务器或GPUaaS,则可以把部分基础设施建设成本转化为按需计算支出。
随着B200、Blackwell Ultra以及后续GPU不断提高单机功耗,大型AI计算越来越可能集中到专业数据中心,而企业通过云端获得计算资源。
对于GPU服务器租用用户来说,选择服务商时不建议只比较“GPU型号”和“每张卡多少钱”。
真正影响模型训练效率的因素还包括GPU之间的网络带宽、存储吞吐、CPU与内存配置、资源是否独享、任务调度机制以及机房的电力和冷却能力。
小规模推理任务可能一两张GPU就足够,而大模型训练需要多服务器协同,此时网络和集群架构的重要性会快速上升。
未来GPU服务器市场的核心卖点,很可能从“拥有最新GPU”进一步转向“能够稳定运行大规模GPU集群”。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。