Cerebras发布CS-4系统 750 PFLOPS推理比GPU快至30倍
AI芯片公司Cerebras于2026年8月19日在旧金山Supernova大会上发布新一代机架级AI系统CS-4。这是其今年5月完成纳斯达克上市(募资55.5亿美元)后推出的首款硬件,也是新"Nexus"机架平台架构的首个产品,主攻大模型推理场景,直接对标英伟达GPU服务器方案。
一个机架三片"晶圆级"芯片
CS-4在单机架内集成三颗全新的WSE-3 Turbo(WSE-3T)晶圆级处理器。单颗WSE-3T包含4万亿个晶体管、90万个AI优化核心和44GB片上SRAM,由台积电5nm工艺制造,提供250 PFLOPS(稀疏FP16)算力与43.2 PB/s内存带宽。
整机层面,CS-4合计提供750 PFLOPS AI算力、129.6 PB/s内存带宽和7.2 Tbps系统I/O带宽,片间互连延迟从上代的5微秒降至最低2微秒,官方称可支撑超过50万亿参数的模型集群。在GPT-OSS-120B同等提示词对比测试中,CS-4实现每用户每秒4400个以上token的输出速度,Cerebras称最高可达GPU方案的30倍。
工程设计上,CS-4采用模块化"背包"结构,将电源转换、液冷与高速I/O集成在紧贴晶圆(约0.5毫米)的可拆卸模块中,整机部件数量比上代减少约一半,部署时间从数天缩短到数小时。首批系统预计本季度开始交付。
亮眼参数背后的"冷静解读"
第三方分析指出,WSE-3T与上代WSE-3在晶体管数、核心数、SRAM容量和制程上完全一致,本质是通过供电架构革新将主频翻倍(约1.4GHz提升至2.8GHz);750 PFLOPS为稀疏FP16数值,对大模型推理更具参考意义的稠密FP16算力约为每片25 PFLOPS。不过其内存带宽优势确实显著,且整机架功耗估算约120-140kW,约为同级GPU机架的一半,对电力紧张的数据中心是实际利好。
Cerebras同时表示,计划到2027年底部署总计600MW的推理算力。在英伟达主导的AI服务器市场,晶圆级路线正在推理端撕开一道口子。
CS-4的真正看点不是"快30倍"的营销口径,而是"一半功耗跑同级推理"——在电价上行的当下(参见本站TVA电价报道),每瓦性能正在取代峰值算力成为AI服务器采购的第一指标。对绝大多数企业而言,这类超大规模系统仍是云端消费品而非采购对象;中小规模的AI推理、模型微调与实时渲染业务,用香港GPU服务器按需部署即可满足需求,无需为顶级硬件的稀缺性买单。
资料来源:Cerebras官方发布及HPCwire、Data Center Dynamics、The Register/The Next Web分析(8月19-20日)。
声明:本文由SellBGP编辑部依据主办方及公开渠道信息独立撰写。转载请注明出处。