发生了什么
OpenAI 于 9 月 4 日推出新的推理模式 Ultrafast,借助与 Cerebras 的 100 亿美元合作,将 GPT-5.6 Sol 的输出速度推到最高每秒 750 token。据第三方评测,这相当于此前标准模式速度的约 14 倍,让生成式模型首次把「毫秒级响应」作为明确的卖点推向企业市场。
在 Ultrafast 之外,OpenAI 同时保留 Standard 与 Fast 两档模式,形成三档推理产品线。不同档位面向不同场景:标准模式适合长链路复杂推理,Fast 平衡成本与速度,Ultrafast 则主打高吞吐实时交互与批量处理。
- Ultrafast 模式最高 750 token/秒,由 Cerebras 专用硬件提供算力支撑
- 三档定价结构让推理速度成为独立可选的付费维度
- 面向客服、编程辅助、实时 Agent 等高吞吐场景有明显价值
对企业而言,推理速度产品化意味着同样的模型可以按响应时延分级采购:高 SLA 的核心业务可选用 Ultrafast 档,成本敏感的大批量任务继续走 Standard 档,按场景精细控制单次调用成本。

