发生了什么
9月18日,智谱正式上线 GLM-5.3-FlashX 并全面开放API。新版本推理速度最高可达200 tokens/s,较 GLM-5.3-Flash 提升5倍,定价同时上调至原版本的2.5倍。智谱称,由10万张国产芯片组成的推理集群上线即被用户用满,因此不得不同步扩大算力规模并推出速度更快、价格更高的 FlashX 版本来承接需求。
为什么这一点不寻常
这是国产大模型竞争逻辑切换的一个明确信号:从单纯追求能力上限,转向在同等智能水平下比拼推理效率与用户体验。此前 GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 上线,6天token调用量超过62万亿,一周内成为双平台调用量最大的模型。智谱用需求远超预期来解释这次提价与扩容。
更值得注意的是智谱披露的工程细节。据其官方博客,GLM-5.3驱动的 Infra Agent 在超过10万张国产AI加速器的集群上,从零搭建了一套生产级推理服务,把端到端吞吐提升到初始基线的约3倍,硬件利用效率与单token成本达到接近主流NVIDIA GPU的水平,并支持1M上下文与多模态请求,从模型适配到生产就绪用了不到两周。
- 技术栈:线性注意力的节点内张量并行、团队称为 ReplaySSM 的机制、W8A8量化、INT8/FP8/BF16混合精度缓存量化、Layer Split,以及 Encode-Prefill-Decode 分离式架构
- 人机分工:Agent负责分析、提出性能假设、修改底层代码并持续迭代;人类工程师定义目标、划定系统边界并复核关键改动
- 边界声明:智谱明确系统尚未达到完全自主设计与训练下一代模型的阶段,所有调整都在人工设定的沙盒与验证标准内进行,并保留可回滚记录
商业含义
- 收入结构:智谱已与海内外头部云服务商签署收入分成协议,相关收入将从10月起确认
- 指引上调:年末ARR指引由24亿美元上调至30亿美元,幅度25%;全业务口径ARR当前为18亿美元
- 算力乘数:2026年上半年该指标同比增长14倍;公司7月与9月分别完成40亿美元、50亿美元再融资,用于扩容算力
- 市场反应:港股智谱当日股价上涨约5.34%
仍需观察
提价能否被市场接受是最直接的检验。推理速度翻五倍对交互式Agent与代码补全场景价值明显,但对批处理类任务,2.5倍的单价上调会直接改变成本模型。另外,10万张国产芯片集群的稳定运行时长、故障率与真实单token成本口径,目前都只有厂商单方面披露,缺少第三方复测。智谱把这次实践称为递归自我改进(RSI)的早期形态,但其自述的边界同样重要:模型优化的是服务自己的推理系统,而不是自己的权重。

