英伟达Groq 3 LPX全面量产 单机架256颗LPU
英伟达在2026年8月24日的 Hot Chips 大会上宣布,面向交互式 AI 推理的 Groq 3 LPX 机架平台正式进入全面量产,相关系统将于年内上线交付。这也意味着英伟达去年12月以约200亿美元收购 Groq 资产这笔史上最大规模并购,终于从技术整合走到了商业化落地。
这是一台被"延迟"重新定义的机器。
LPX 采用全液冷设计,单机架塞进256颗 Groq 3 LPU(语言处理单元),提供315 PFLOPS 的推理算力。真正决定它性能特征的不是算力数字,而是内存架构——每颗 LPU 自带500MB 片上 SRAM,带宽高达150 TB/s;整机架 SRAM 总容量128GB,聚合带宽达到惊人的40 PB/s,另配12TB DDR5 内存承载大模型权重。芯片之间通过直连链路构成640 TB/s 的 scale-up 互联。
这套配置的取向非常明确:用极高的片上带宽换取确定性的低延迟,而不是追求峰值吞吐。机架内部还整合了 BlueField-4 DPU、Vera CPU 机架、Vera BlueField-4 STX 存储服务器,并由新一代 Spectrum-6 SPX 以太网串联,整体基于 MGX ELT 机架标准,可与现有 Vera Rubin 部署共用同一套基础设施设计。
英伟达特别强调,LPX 不是旗舰平台 NVL72 的替代者。两者的分工是:NVL72 继续承担 prefill 与 decode attention 等通用负载,LPX 专攻解码环节中对延迟最敏感的部分,比如 FFN 与 MoE 专家执行,二者组合成一条异构服务路径。
在英伟达引用的行业基准中,LPX 在 Gemma 4 31B 模型、10万 token 上下文窗口下达到每秒3400个输出 token。官方称这可以让智能体类任务的响应速度提升约4倍,把原本需要数小时的多步骤任务压缩至几分钟。
首批客户名单已经明确:欧洲 AI 云厂商 Nebius 成为首家采用 Groq 3 LPX 的云平台,Groq 自身也计划成为最早的部署者之一。优先落地 AI 云而非企业自建机房,逻辑并不复杂——对推理服务商而言,"每用户每秒生成多少 token"就是产品竞争力本身。
LPX 量产传递出的信号很清晰:算力竞争的重心正在从训练转向推理,而推理的胜负手是延迟,不是峰值算力。
这个转向会往下传导两件事。第一是机房侧的液冷改造节奏会明显加快,256颗加速器的单机架功率密度早已超出风冷承载区间,液冷配套很快会从"加分项"变成"入场券"。第二件事更贴近实际业务:当芯片端把单次推理延迟压到毫秒级,网络回程那几十毫秒的抖动就成了整条链路上最刺眼的短板。
对面向中国大陆及亚太用户的 AI 应用来说,选一条好线路带来的体验收益,常常高于把硬件配置再往上堆一档。SellBGP 的香港云服务器与香港 GPU 服务器标配 CTGNet/CN2 GIA 优化回国专线,香港本地访问时延低至10ms,适合承载对交互延迟敏感的推理前端与 API 网关。
声明:本文由SellBGP编辑部依据公开渠道信息独立撰写。转载请注明出处。