租用香港显卡服务器要注意什么?供卡、电费与验收是关键
租香港的普通服务器和租香港的显卡服务器,决策顺序完全不一样。普通服务器先看线路和带宽,配置基本是可选项;显卡服务器有三件事必须排在线路前面——你要的那张卡机房到底能不能交付、电费怎么算、你拿到的是整卡还是切片。这三件事没问清楚,线路再好也没意义。
下面按这个顺序说。
先确认能不能拿到卡,再谈型号怎么选
这是香港 GPU 服务器区别于其他地区最关键的一点,也是大多数同类文章完全不提的一点:香港在美国出口管制体系里长期与中国内地同等对待,高端 AI 加速卡向这一地区出口需要许可。
管制范围比很多人以为的宽。除了 A100、H100、H200 这一类数据中心卡,连消费级的 RTX 4090 都曾被卷进去过——NVIDIA 因此专门推出了面向中国市场的 4090D 版本,后续型号也有类似安排。规则近几年调整过多次,还在变。
实际影响很具体:香港机房官网列出的型号清单,和它这个月真能交付的型号,经常是两回事。所以询价时要问的不是"你们有没有 H100",而是"现在在库能立刻上架的是哪些卡、几张、什么形态、交付周期多久、如果到期交付不了怎么处理"。让对方给具体数量和时间承诺,比看型号列表有用得多。
至于型号本身,按业务反推比按性能排序靠谱:
- 做 LLM 推理、对外提供 API 服务的,显存容量决定你能装下多大的模型,显存带宽决定出词速度,算力往往不是瓶颈。
- 做微调、小规模训练的,24GB 起步,能上 48GB 或 80GB 会省掉大量 offload 和梯度检查点的折腾。
- 做视频渲染、转码、云游戏的,编解码单元的数量和代际比通用算力更重要,专业卡在这方面未必比消费级卡有优势。
- 做多机分布式训练的,先看机器之间有没有 InfiniBand,这个后面单独说。
显存要看两个数字,很多人只看了一个
显存容量好理解,装不下模型就跑不起来。但显存带宽同样关键,尤其在推理场景下它几乎直接决定吞吐。
大致的量级差别是这样:RTX 4090 的 24GB GDDR6X 带宽在 1TB/s 上下,A100 80GB 的 HBM2e 大约 2TB/s,H100 80GB 的 HBM3 大约 3.35TB/s,H200 的 141GB HBM3e 接近 4.8TB/s。也就是说从 4090 换到 H100,纯算力提升是一档,带宽提升又是另一档,而自回归推理主要吃的是后者。
反过来说,如果你的任务是批量图像生成、渲染、转码这类计算密集但不需要反复搬运大权重的活,带宽的边际收益就小很多,把预算花在多张便宜卡上通常更划算。
PCIe 还是 SXM,决定多卡能不能真的一起用
同一个型号的 A100 或 H100 有 PCIe 和 SXM 两种形态,报价单上常常只写型号不写形态,但差别很大。
SXM 版本通过 NVLink/NVSwitch 互联,卡间带宽是几百 GB/s 量级;PCIe 版本走 PCIe 通道,即使是 Gen5 也只有几十 GB/s 量级,而且多卡之间还要竞争。单卡任务两者没区别,多卡张量并行的训练任务上,PCIe 版本会被卡间通信拖住,实际加速比可能远低于卡的数量。
跨机器就更是另一回事。多机训练需要 InfiniBand 或 RoCE,香港租用市场以单机为主,能提供 IB 组网的机房不多、价格也高。如果你的规划里有"以后再加几台机器一起训练",这件事要在租第一台的时候就问,不能等到需要时再说。
消费级卡便宜,代价落在两个地方
RTX 4090、5090 这类卡在香港市场供应相对充足、单位算力成本明显低于数据中心卡,很多人自然会选它。但有两个成本是隐性的。
一个是没有 ECC 显存。GeForce 系列不带显存纠错,短时任务无所谓,但连续跑几十小时的训练如果遇到显存位翻转,表现不是报错崩掉,而是静默地算出错误结果——你可能训练完才发现 loss 曲线不对,重来一遍。专业卡和数据中心卡带 ECC,多花的钱一部分就是买这个。
另一个是驱动许可条款。NVIDIA 的 GeForce 驱动许可对数据中心部署场景有限制,这也是为什么用消费级卡做租用业务的服务商在合规上一直处于灰色区间。对你的实际影响主要是:这类资源的长期稳定性不如数据中心卡,把关键业务完全压在上面要有心理准备。
电和散热才是香港这边的真成本
普通服务器的报价里电费基本可以忽略,GPU 服务器不行。
一张 4090 的 TDP 是 450W,H100 SXM 单卡最高 700W。一台八卡的 4090 整机满载在 5kW 左右,八卡 H100 整机在 10kW 上下。而传统机房的单柜供电常见是 3 到 6kW——这意味着高密度 GPU 机柜要么单独收费,要么机房根本没有。香港的电价在亚太主要机房市场里属于偏高的一档,很多 GPU 报价会把电费单列,或者按机柜功率上限计费。这一项在合同里怎么写,比带宽单价重要得多。
由此衍生出一个非常常见的坑:机房为了控制功耗和散热,会把卡的功率上限调低。你租到的确实是 4090,但 power limit 被从 450W 压到 350W,长时间负载下性能掉一截。这件事不看就不知道,验收命令后面给。
散热同理。有些机房的机柜风道撑不住满负载,卡跑到一定温度就降频。跑十分钟测不出来,要持续压。
"是否支持 CUDA" 是个假问题
同类文章里常见一条"确认服务器是否支持 CUDA、cuDNN",这条基本是外行话——所有 NVIDIA 显卡都支持 CUDA,问这个相当于问一台服务器是否支持 TCP/IP。
真正会出问题的是版本矩阵:显卡的计算能力(compute capability)、驱动版本、CUDA Toolkit 版本、cuDNN 版本、框架版本,这几层要对得上。较新的卡需要足够新的驱动才能识别,而某些老框架又只编译了旧 CUDA 的算子。Blackwell 一代刚出来那段时间,大量项目卡在框架还没跟上新架构上,跟机房无关。
所以要问的是:机器交付时预装什么驱动版本、能不能自己换、有没有现成的容器镜像、装不装 NVIDIA Container Toolkit。实践上最省事的做法是宿主机只装驱动,其余全部跑在容器里,框架和 CUDA 版本随镜像走,避免在生产机器上折腾环境。
操作系统方面,Ubuntu 24.04 LTS 或更新的 LTS 是目前最稳妥的选择,NVIDIA 官方文档和大部分镜像都以它为基准。20.04 的标准支持已经结束,CentOS 7 也在 2024 年 6 月停止维护,还在推荐这两个的教程都是旧稿。只有确实要跑 IIS、DirectX 相关渲染管线或某些云游戏方案时,Windows Server 才是必要的。
带宽要分开算:传数据和对外服务不是一回事
GPU 服务器的流量结构有两段,需求完全不同。
一段是数据和模型的上传下载,一次性大流量。这里可以直接算:1TB 数据在 100Mbps 的链路上传完要接近 23 小时。如果你的数据集是几个 TB,或者要反复上传检查点,带宽就是实实在在的时间成本。
另一段是推理服务对外,持续但通常不大。一个文本类 API 服务,几十 Mbps 就能支撑相当高的并发。
把这两段混在一起谈"选 100Mbps 不限流量"是不成立的,尤其在香港——CN2 GIA 这类回国优化线路通常按小带宽卖,单价高,100Mbps 不限流量的优化线路要么不存在,要么价格超过 GPU 本身。合理的组合往往是:国际大带宽或按流量套餐负责数据搬运,另配一条小带宽优化线路负责国内访问入口。
如果你的用户主要在境外,那香港的优势就不在回国线路,而在到东南亚、日韩的低延迟和相对宽松的接入环境,选线思路要跟着改。
机器到手先跑这几条命令
验收比选型更容易被忽略。开机能 ping 通不等于配置对,下面几条花十几分钟,能挡掉大部分交付不符。
先确认卡的数量、型号和形态:
nvidia-smi -L
lspci | grep -i nvidia
再看功率上限有没有被调低、ECC 状态、显存实际容量:
nvidia-smi -q -d POWER,ECC,MEMORY | grep -i -E "Power Limit|Ecc Mode|Total"
重点看 Current Power Limit 和 Default Power Limit / Max Power Limit 是否一致。不一致说明被限了,可以拿这个去和服务商谈。
确认是整卡独享还是被切分共享,以及有没有别人的进程在跑:
nvidia-smi
nvidia-smi mig -lgi
最后是持续压测,至少半小时,边跑边看时钟、温度和降频原因:
nvidia-smi --query-gpu=clocks.sm,temperature.gpu,power.draw,clocks_throttle_reasons.active \
--format=csv -l 5
部分新版驱动里最后那个字段名改成了 clocks_event_reasons.active,报错就换一下。如果压到十几分钟后 SM 时钟明显往下走,同时出现温度或功率相关的降频标记,说明散热或供电有问题,这台机器的长期训练表现会比跑分难看得多。
选香港 GPU 服务器,真正需要判断的是三件事:这家机房现在能不能稳定拿到你要的卡、报价里电费和功率上限怎么约定、交付后你能不能验证到手的东西和说好的一致。型号参数在各家官网上都查得到,这三件事只能问和验。签之前把报价单上单列的项目逐条对一遍——卡、CPU 与内存、存储类型和容量、带宽与线路、IP、电费或功率上限、软件授权、是否含运维。GPU 机器的总价里,非显卡部分的占比往往超出预期。