返回行业动态
模型与产品

谷歌发布 Gemini 3.8 Live 双模型:语音代理可边推理边说话,后台工具调用不再打断对话

谷歌在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。标准版面向低延迟与规模化,Extended Thinking 面向多步复杂任务,二者均把工具调用与 API 请求放到后台执行,对话不因等待而中断。Extended Thinking 在 Artificial Analysis 语音对话质量榜以 82.6 分居首,但在银行业务场景的智能体任务成功率仅 35.1%,语音质量与任务完成度仍是两件事。

来源:Google(The Keyword 官方博客)原标题:Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking查看原文
实时语音智能体交互场景示意:会话界面波形与后台推理并行的抽象画面

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

谷歌于 9 月 15 日在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,二者同属基于 Gemini 3 Pro 构建的 Gemini 3.8 Audio 系列。两款模型接受文本、图像、音频与视频输入,可输出文本或音频,上下文窗口为 128K 输入词元与 64K 输出词元。

标准版 Gemini 3.8 Live 定位低延迟与成本效率,面向规模化语音代理;Extended Thinking 定位高复杂度任务,在持续流式输出语音的同时执行后台推理与异步工具调用。谷歌给出的定价口径为音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元。

  • 两款模型即日起在 Gemini API 与 Google AI Studio 向开发者开放,企业侧在 Gemini Enterprise 进入私测
  • Gemini 3.8 Live 已面向所有用户在 Search Live 上线;Extended Thinking 开始在 Gemini Live 与 Docs、Gmail、Keep 等 Workspace 场景出现
  • 上一代 Gemini 3.1 Flash Live 被标记为 legacy,官方文档建议直接迁移至 3.8 Live
  • 所有生成音频均嵌入 SynthID 不可感知水印,用于溯源 AI 生成内容

关键变化在哪里

这两款模型针对的是语音代理长期存在的「静默空窗」问题。文本代理调用一个耗时四秒的工具时,界面可以显示加载状态;语音代理沉默四秒,通话另一端的人通常会认为连接已经中断。谷歌的做法是把函数调用与 API 请求改为纯异步执行,模型先用一句口头提示接住提问,随后在后台推进多步任务,并以实时进度播报交代进展。谷歌官方文档同时提示,收到 turnComplete 信号并不意味着服务端已经空闲,客户端需要持续监听后续音频、推理更新与工具调用,直到服务端报告空闲状态。

官方公布的成绩集中在语音质量与任务完成度两个维度:Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位列总榜第一,Big Bench Audio 得分 97.7%,τ-Voice 智能体任务完成率 68.6%;标准版 Gemini 3.8 Live 在 Speech Agent Arena 排名第二,每小时的实测运行成本明显低于 Extended Thinking 版本。

对企业选型意味着什么

  • 语音质量领先不等同于任务可靠:同一模型在 Sierra 运营的 τ-Voice-banking 银行场景基准上成功率仅 35.1%,多数银行类语音业务仍无法闭环完成
  • 官方模型卡列出知识截止时间为 2025 年 1 月,并说明未发现相对 Gemini 3.7 Flash 的实质性新能力或显著性能提升
  • Extended Thinking 不支持缓存、代码执行、文件检索、结构化输出、URL 上下文与地图接地等能力,工程上需要单独设计降级路径
  • 承载模型的 Live API 整体仍标注为 Preview,正式产品可以接入,但接口后续仍有调整空间
  • 全部评测数字来自谷歌自身发布材料,实际体验还取决于网络延迟、打断处理、麦克风质量与外部工具的可靠性

从落地角度看,这批模型把语音代理的集成复杂度从「自己搭实时媒体链路」前移到了「客户端状态机怎么管」。谷歌同时列出了 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 与 Vision Agents 等实时媒体基础设施合作方,开发者不必自建底层传输。企业若计划用于客服、预约或远程技术支持,建议先按自身业务流程做小范围对照测试,重点验证多轮打断恢复与工具调用失败后的兜底行为,而不是直接以榜单排名作为选型依据。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。