发生了什么
Cerebras Systems于8月18日在旧金山发布第四代晶圆级AI系统CS-4。该系统由三颗全新的WSE-3 Turbo晶圆级处理器驱动,每颗集成约4万亿晶体管和90万个AI优化核心,覆盖46225平方毫米硅面积,AI算力达750 PFLOPS,内存带宽达129.6 PB/s。Cerebras称CS-4是业界最快的AI加速器,在测试中单用户每秒可生成超过4400个Token,推理速度最高达到基于GPU方案的30倍;在超过10万亿参数的大模型上,借助低至2微秒的晶圆间互联延迟,仍可保持每秒1000 Token以上的解码速度。
关键设计
- CS-4是Cerebras新一代Nexus机架级平台的首款产品,计算、供电、散热与I/O协同升级,面向交互式推理和规模化部署,而非模型训练
- 与上代CS-3相比,CS-4带来约10倍的词元容量和2倍的推理速度,每瓦吞吐量最高提升10倍,以SRAM片上缓存替代传统DRAM方案
- 原生支持分离式推理:可由GPU或ASIC平台(如AMD Helios、AWS Trainium)负责预填充,CS-4专注超低延迟解码,构成异构推理系统
为什么重要
推理正在成为AI基础设施成本与体验的主战场。Cerebras以晶圆级架构正面挑战英伟达GPU在推理市场的地位,其宣称的30倍速度与10倍能效若在真实负载中兑现,将直接影响数据中心运营商和云厂商的算力采购决策。同时,分离式推理的提出表明,行业正从单一加速器竞争转向异构算力协同的体系竞争,这为企业在预填充与解码两个环节分别选择最优平台提供了新的架构选项。
尚待观察
目前CS-4仅向少量客户提供样品,量产与大规模供货计划于今年第三季度晚些时候推进。官方性能数据主要来自内部基准测试与人工分析,30倍推理速度等指标在不同工作负载、配置和模型下的实际表现仍有待第三方独立验证。此外,晶圆级方案的产能、良率与价格能否支撑其从样品走向超大规模部署,也是市场关注的焦点。

