发生了什么
OpenAI 于2026年9月10日宣布将 GPT-Live-1 引入 API。该模型是2026年7月随 ChatGPT 新一代语音模式一同亮相的全双工语音模型,本次开放意味着第三方开发者可以把同一套对话能力嵌入自有应用与业务流程。前端语音层计价为每分钟0.05美元,按秒计费;后端模型与智能体工具的费用另行结算。
与传统「语音识别—大语言模型—语音合成」的级联架构不同,GPT-Live-1 在单一模型内同时对输入与输出语音进行推理,因此打断处理、停顿与背景噪声场景下的稳定性明显改善。OpenAI 公布的第三方或自研评测显示,其轮次切换延迟为0.798秒,此前 GPT-Realtime-2.1 为1.41秒;在 Full Duplex Bench 上的表现较 GPT-Realtime-2.1 高出约30个百分点。
能力与工程特性
- 同时听取与输出:支持说话中途打断、附和与话题转向,无需等待模型完成上一轮回复。
- 推理与工具调用的委派:复杂推理、检索与工具调用交由后端文本模型(如 GPT-6 Astra)或第三方模型执行,语音会话不中断;应用侧掌握权限与任务状态。
- 与 Codex 的联动:官方示例展示了应用把会话上下文传递给 Codex 线程、再将结果返回当前语音会话的写法。
- 接入方式:浏览器侧使用 WebRTC,服务端音频使用 WebSockets,电话智能体支持 Telephony 与 SIP。
- 工程能力:原生提供语音识别转写与回复文本、关键词偏置、显式轮次检测,并改善了静音与背景噪声处理及长会话的上下文保持。
- 12款新增实时音色:Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder,官方称后续将继续扩充音色与语言支持。
为什么对企业读者重要
语音智能体长期受制于两个工程问题:延迟与打断。级联架构的多次衔接会累积延迟,而轮次制模型在用户思考停顿处的误打断会显著拉低体验。GPT-Live-1 把这两点作为主要卖点,并以按分钟计费的定价把语音交互变成可预算的接口成本。OpenAI 披露的早期使用者包括 Yelp、Speak 与 Fin,分别用于电话预订、客服与语言辅导;其中 Speak 称学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近80%。
更值得关注的是架构含义:语音层与推理层解耦后,语音会话的性质从「对话界面」转向「智能体调度入口」。一个通话过程中,前端负责自然交互,后端可以并行执行检索、系统查询与动作,用户听到的仍是一段连续对话。这为企业把语音入口接入既有业务系统提供了新的集成范式。
尚待确认的部分
目前绝大多数性能数字来自 OpenAI 自报口径,尚缺少完整的独立复现。企业评估时应重点验证三项指标:自身业务语料下的任务成功率、噪声环境中的误打断率,以及与既有后端系统的工具调用成功率。此外,0.05美元每分钟仅为前端语音层单价,一旦引入高频检索或多步工具调用,后端 token 成本可能成为总成本的主要部分,需要在容量规划阶段一并测算。

