发生了什么
在 2026 人工智能计算大会(AICC2026)上,浪潮信息发布元脑 SD200 Ultra 超节点 AI 服务器与元脑 HC2000 多元算力机组,分别面向「能力型智算」与「容量型智算」两类需求。公司首席 AI 战略官刘军给出的判断是:智能体从对话工具走向生产实践后,计算瓶颈已从单一算力环节延伸至存储、互连、调度与软件栈,产业衡量标尺也从「有多少算力」转向「能支撑多强的智能、以多低的成本生产多少智能」。
元脑 SD200 Ultra 的定位是单机承载前沿规模模型。它基于本土 AI 芯片,以开放系统设计紧耦合 128 颗芯片,采用 3D Hyper Mesh 架构,提供 8TB 统一编址显存与 64TB 内存,官方称单机可运行 2.8 万亿参数的 Kimi K3,Token 生成时延首次降到 5.85 毫秒以内,折算单用户速度约 170 tokens/s,为业界平均水平的 5 倍,并具备支持 10 万亿参数规模模型单机运行的余量。
- 互连与寻址:全局统一寻址、对称直连,官方称内存语义通信时延低至 0.69 微秒,AllReduce 时间较此前路径缩短约 3.5 倍(厂商标称)
- 算子层优化:针对 Kimi K3 的 KDA、gated MLA 与 MoE 环节做算子融合,官方称算子数量约降至十分之一、推理性能提升 3 倍以上(厂商标称)
- 芯片来源:官方与媒体报道均只描述为「本土 AI 芯片」,未公开具体供应商与型号,128 颗芯片的构成仍无法核实
- 配套机型元脑 HC2000:全液冷设计,采用 DirectCom 2.0 架构,单柜最多承载 256 张 AIPU,算力密度提升 4 倍,柜内聚合带宽最高 200Tbps
- 软件栈 MCIS:覆盖请求路由、P/D 分离推理、算力动态调整与 KV Cache 管理,兼容主流本土 AI 芯片及 SGLang、vLLM 等推理框架
- 收益口径:同等投资下 Token 产能提升 10 倍;多元算力间点对点小数据量传输性能最高提升约 5 倍,节点内本地磁盘 IO 性能提升约 32 倍(均为厂商标称)
为什么重要
第一,竞争维度已经换位。SD200 Ultra 与 HC2000 的组合传递出明确信号:在先进制程受限的前提下,厂商试图用系统级工程——互连拓扑、统一显存编址、算子融合与推理软件栈——来补单芯片差距,而不是继续比拼制程与单卡算力。第二,能力型与容量型的分工对企业选型有直接参考价值:需要跑长上下文、多轮推理与多智能体协作的重负载,看的是单机可承载的模型规模与时延;而批处理、摘要、信息抽取这类高频任务,看的是同等投资下的 Token 产能与能耗。两类需求对应的采购逻辑、机房形态与散热方案并不相同。
第三,单机承载万亿参数级模型对部署形态的影响被低估。它减少了跨机通信与组网层级,意味着中型企业可以用更小的机房面积与更简单的网络拓扑部署前沿级模型服务,这对风冷机房占比高、改造预算有限的国内存量数据中心而言,是比峰值算力更现实的变量。同期大会上,神州鲲泰等厂商也发布了基于鲲鹏与昇腾技术路线的新一代产品矩阵,覆盖从双机 16 卡全互联到液冷大规模超节点的多个档位,国内 AI 基础设施的供给正在向「按场景分层」演进。
“衡量计算系统价值的标尺,也从『有多少算力』转向『能支撑多强的智能、以多低的成本生产多少智能』。”——浪潮信息首席 AI 战略官刘军
不确定之处
其一,上述时延、吞吐与加速比均为厂商口径,缺少第三方复现结果,Kimi K3 在实际并发与长上下文场景下的表现仍需独立验证;其二,128 颗芯片的具体型号与是否单柜交付未披露,供应链可得性与交付周期直接影响落地节奏;其三,5.85 毫秒是 Token 生成时延的下限值,官方与媒体表述在「首次突破」与「降至以内」之间存在差异,实际业务负载下的稳态指标应以现场测试为准;其四,HC2000 宣称的十倍 Token 产能以「同等投资、匹配服务水平约束」为前提,该前提的边界条件未公开。

