IBM与Together AI签2.4亿美元B300 GPU云集群大单
GPU算力租赁市场再添一笔标志性订单。据Data Center Dynamics 8月12日报道,IBM与AI加速云公司Together AI签署了一份价值2.4亿美元的多年期协议,将在IBM Cloud上部署一个"大规模"Nvidia HGX B300集群,采用Nvidia Spectrum-X以太网互联。这是IBM Cloud上首个基于HGX B300、面向推理场景构建的大规模集群,预计2027年第一季度投入使用。
押注推理:低Token成本成为选型第一标准
Together AI方面表示,选择IBM与Nvidia的核心原因是二者能"以AI快速扩张所需的节奏交付GPU容量,并实现最低的Token成本"。该公司CEO Vipul Ved Prakash称,企业既想要前沿模型的性能,又不想承担闭源模型的价格,这就要求底层基础设施在规模化条件下既快又稳,新集群将帮助其把生产级推理服务更快推向更多企业客户。
从行业角度看,这笔订单印证了两个趋势:一是AI基础设施的竞争重心正从训练转向推理,单位Token成本取代峰值算力成为客户选型的第一指标;二是Spectrum-X以太网正在超大规模推理集群中替代传统InfiniBand方案,网络互联的选择直接影响推理吞吐与成本。
"算力二房东"模式跑通:租、转租、自建三线并行
Together AI成立于2022年,其商业模式颇具代表性——既从其他云厂商租入GPU再转租给开发者,也自购服务器放入数据中心对外出租。今年7月,该公司刚完成8亿美元C轮融资,投后估值达83亿美元;6月还与算力供应商Rumble签署了多年期B300专属容量协议。可以看到,在GPU长期供不应求的背景下,"算力二房东"已从套利生意演变为有资本市场背书的正式业态,云巨头、Neocloud与中间商之间的容量互租正在成为常态。
推理时代的GPU选型逻辑与训练时代不同:显存容量、节点间网络吞吐和单位Token成本比单卡峰值算力更重要。对于模型微调、实时渲染、中小规模推理等场景,并不一定要追逐B300级旗舰,香港GPU服务器搭配就近部署往往能在时延与成本之间取得更好的平衡;Web前端、数据库等常规负载则建议与GPU节点分离部署到普通云服务器,避免为用不上的算力付费。
声明:本文由SellBGP编辑部依据Data Center Dynamics等公开渠道信息独立撰写。转载请注明出处。