返回行业动态
算力与基础设施

华为发布昇腾960超节点:业界首个采用近封装光学的超节点,单节点4096卡、面向10万亿参数模型

9月17日华为全联接大会2026在上海开幕,华为副董事长、轮值董事长汪涛发布昇腾960超节点,称其为业界首个采用NPO(近封装光学)技术的超节点。单节点最大支持4096卡,提供8 EFLOPS FP8与16 EFLOPS FP4算力、1PB HBM容量。华为自研NPO光引擎Hi-ONE单引擎传输容量7.2T,用5500个模块替代原本需要的4.8万颗800G光模块,功耗降低超550千瓦,系统可用度99.8%。这意味着国产算力竞争从单芯片指标转向系统级互联效率,企业算力采购的评估口径需要相应调整。

来源:华为(全联接大会 2026 官方发布)原标题:华为全联接大会2026今天启幕,发布业界首个使用NPO的昇腾960超节点查看原文
数据中心液冷机房内成排深色机柜沿纵深延伸,机柜之间由青色发光光纤束连成网状互联结构,画面中央悬浮由密集光点聚合而成的算力集群模型

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

在9月17日于上海开幕的华为全联接大会2026上,华为副董事长、轮值董事长汪涛发布昇腾960超节点,称这是业界首个采用NPO(近封装光学)光互联技术的超节点,面向10万亿参数级别大模型的训练与推理。单个昇腾960超节点最大支持4096卡,可提供8 EFLOPS FP8与16 EFLOPS FP4算力,HBM容量达到1PB。

这项发布的核心变化在互联层。华为自研的NPO光引擎Hi-ONE单引擎传输容量达到7.2T,是华为称业界首个实现量产的NPO产品,也是唯一内置光源的产品。在昇腾960超节点中,5500个Hi-ONE替代了原本需要的4.8万颗800G光模块,整机功耗降低超过550千瓦,系统无故障运行时间提升一倍,可用度达到99.8%。

  • 互联协议:基于灵衢UnifiedBus,节点内RTT时延低至2微秒
  • 集群规模:多超节点经灵衢网络或RoCE互联,最大集群达51.2万卡;结合多轨道拓扑技术可扩展至100万卡
  • 芯片节奏:昇腾960DT比原计划提前三个季度,2027年一季度就绪;960PR提前一个季度,2027年三季度就绪;昇腾970、980分别定档2028年与2029年
  • 产品形式:风冷超节点与液冷超节点分别计划于2027年二季度、三季度上市

为什么值得关注

华为把这次发布的重点放在系统级架构创新而非单芯片性能上。汪涛表示,单芯片性能的提升已远远无法满足十万亿级模型的训练推理需求,依靠简单规模堆叠的传统路径面临边际收益递减,因此需要用高速互联把成百上千张算力卡像一台计算机一样协同工作。

与AI超节点同步,华为还把这一架构推向通用计算与存储。鲲鹏超节点基于灵衢全光组网,最大支持4096节点并形成256TB统一内存池,华为称在Agent沙箱场景下十万级沙箱启动速度相比传统服务器提升30倍,沙箱密度可再提升25%;新发布的OceanStor M900则是基于灵衢总线、支持一跳直连的L3.5层PB级KV缓存集群,目标是缓解长上下文推理的缓存瓶颈。

  • 商用基数:昇腾超节点累计部署超过1000套,昇腾950超节点已实现商用,华为称其为国内唯一训练出SOTA模型的超节点
  • 生态规模:昇腾已携手3000多家行业合作伙伴,孵化7000多个行业解决方案
  • 标准动作:华为已在全球光互联标准组织OIF提出NPO标准立项建议

仍需观察

昇腾960超节点目前只有规格与时间表,风冷、液冷版本分别计划于2027年二、三季度上市,尚无第三方实测数据。华为宣称的100万卡集群属于理论扩展能力,能否在供电容量、制冷、网络运维与故障域控制上真正落地,仍需观察。对企业的现实意义是:国产算力竞争已从单卡指标转向系统级协同效率,采购评估口径中的互联带宽、统一内存与KV缓存分层,正在变得和芯片算力同样重要。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。