返回行业动态
企业AI落地

智谱上线 GLM-5.3-FlashX:推理提速至 200 tokens/s 并涨价 2.5 倍,10 万张国产芯片集群被用满

9月18日智谱上线 GLM-5.3-FlashX,推理速度最高200 tokens/s,较 GLM-5.3-Flash 提升5倍,定价同时上调至原版本的2.5倍;由10万张国产芯片组成的推理集群上线即被用户用满。智谱官方博客同时披露,GLM-5.3驱动的 Infra Agent 在超10万张国产加速器集群上从零搭建生产级推理服务,端到端吞吐提升约3倍,单token成本接近主流NVIDIA GPU水平。公司已与头部云服务商签署收入分成协议,年末ARR指引由24亿美元上调至30亿美元。

来源:智谱(Z.ai)官方博客原标题:Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure查看原文
夜晚数据中心园区航拍视角,多栋机房顶部呈现细密网格状散热鳍片,园区之间由青色发光光缆轨迹连接,一道白色光流从左下向右上加速攀升

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

9月18日,智谱正式上线 GLM-5.3-FlashX 并全面开放API。新版本推理速度最高可达200 tokens/s,较 GLM-5.3-Flash 提升5倍,定价同时上调至原版本的2.5倍。智谱称,由10万张国产芯片组成的推理集群上线即被用户用满,因此不得不同步扩大算力规模并推出速度更快、价格更高的 FlashX 版本来承接需求。

为什么这一点不寻常

这是国产大模型竞争逻辑切换的一个明确信号:从单纯追求能力上限,转向在同等智能水平下比拼推理效率与用户体验。此前 GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 上线,6天token调用量超过62万亿,一周内成为双平台调用量最大的模型。智谱用需求远超预期来解释这次提价与扩容。

更值得注意的是智谱披露的工程细节。据其官方博客,GLM-5.3驱动的 Infra Agent 在超过10万张国产AI加速器的集群上,从零搭建了一套生产级推理服务,把端到端吞吐提升到初始基线的约3倍,硬件利用效率与单token成本达到接近主流NVIDIA GPU的水平,并支持1M上下文与多模态请求,从模型适配到生产就绪用了不到两周。

  • 技术栈:线性注意力的节点内张量并行、团队称为 ReplaySSM 的机制、W8A8量化、INT8/FP8/BF16混合精度缓存量化、Layer Split,以及 Encode-Prefill-Decode 分离式架构
  • 人机分工:Agent负责分析、提出性能假设、修改底层代码并持续迭代;人类工程师定义目标、划定系统边界并复核关键改动
  • 边界声明:智谱明确系统尚未达到完全自主设计与训练下一代模型的阶段,所有调整都在人工设定的沙盒与验证标准内进行,并保留可回滚记录

商业含义

  • 收入结构:智谱已与海内外头部云服务商签署收入分成协议,相关收入将从10月起确认
  • 指引上调:年末ARR指引由24亿美元上调至30亿美元,幅度25%;全业务口径ARR当前为18亿美元
  • 算力乘数:2026年上半年该指标同比增长14倍;公司7月与9月分别完成40亿美元、50亿美元再融资,用于扩容算力
  • 市场反应:港股智谱当日股价上涨约5.34%

仍需观察

提价能否被市场接受是最直接的检验。推理速度翻五倍对交互式Agent与代码补全场景价值明显,但对批处理类任务,2.5倍的单价上调会直接改变成本模型。另外,10万张国产芯片集群的稳定运行时长、故障率与真实单token成本口径,目前都只有厂商单方面披露,缺少第三方复测。智谱把这次实践称为递归自我改进(RSI)的早期形态,但其自述的边界同样重要:模型优化的是服务自己的推理系统,而不是自己的权重。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

智谱 GLM-5.3-FlashX:200 tokens/s,涨价 2.5 倍|北京拓实科技