返回行业动态
模型与产品

谷歌发布 Gemini 3.8 Flash TTS:用自然语言设计音色,30 秒样本克隆声音并强制同意校验

谷歌于 9 月 23 日发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,把语音生成从固定音色预设变为可创作的工作流:用户可用自然语言描述角色、口音与音色特征,从零设计新声音,覆盖 100 多种语言与方言,并从 2000 多条现成音色中挑选。Flash TTS 支持用 30 秒样本复刻音色,但需声音所有者提供匹配的口头同意录音;所有生成音频嵌入 SynthID 水印,复刻音色附带 C2PA 凭证。

来源:Google DeepMind 官方博客:Gemini 3.8 文生语音模型发布原标题:Gemini 3.8 text-to-speech says hello查看原文
专业录音棚内部,前景为电容麦克风特写,中景为声学吸音板墙面与弧形声波可视化光带,远景为调音台剪影与暖色灯带,深蓝与青色为主色调

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

当地时间 9 月 23 日,谷歌发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文生语音模型,并将其定位为语音生成方式的转变——从挑选静态预设音色,转为在提示词里描述声音。Flash TTS 面向游戏、有声书、播客等需要角色塑造的创作场景,Flash-Lite TTS 面向批量配音、音频内容生产与语音智能体等高频、低成本场景。两款模型即日起在 Gemini API 与 Google AI Studio 上线,Flash TTS 同步进入 Gemini Notebook,Flash-Lite TTS 进入 Google Vids,面向企业的 Gemini Enterprise API 通道标为「即将推出」。

核心能力集中在三处。其一是音色设计:用户用自然语言描述角色、口音与声音特征即可生成全新声音,覆盖 100 多种语言与方言;语音库提供 2000 多条可直接使用的音色,包含墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体,谷歌称音色规模已从早期 30 个扩展到近乎无限。其二是表演控制:两款模型都支持逐行舞台指示,可在单一脚本内生成双人对话并保持自然轮次,支持持续数小时的长音频,以及笑声、叹气与「嗯」「对」这类语气词与应和声。其三是声音复刻:Flash TTS 可用 30 秒音频样本重建稳定的音色轮廓。

  • 复刻的同意机制:用户必须提供声音所有者本人的口头同意录音,系统校验其与参考说话人匹配后才会创建音色
  • 溯源与合规:所有 Gemini Audio 模型输出的音频都嵌入 SynthID 不可感知水印,复刻音色额外附带 C2PA 内容凭证
  • 第三方基准:谷歌称 Flash TTS 在 Hume AI 的 Voice Design Benchmark 综合排名第一(71.4 分),口音建模同样第一(60.8 分);Flash 与 Flash-Lite 分列 Hume 综合质量指数的第一与第二名
  • 盲测表现:在 Voice Arena 的盲测偏好中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语与印地语等语种位居前列(以上均为谷歌自述数据)
  • 生态接入:Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等公司正在接入;Agora、LiveKit、Pipecat、Vercel 等开发者平台用于搭建语音接口
  • 地域限制:通过 AI Studio 进行的声音复刻在伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士与印度不可用;官方公告未公布两款模型的定价

为什么重要

第一,语音合成的竞争焦点从「像不像真人」转向「能不能被当作演员来调度」。过去的模型解决的是音质与自然度,而逐行舞台指示、单脚本双人对话与长音频一致性这三项能力,直接决定 AI 语音能否进入有声书、游戏配音与播客这类按项目结算的内容生产流程,这也是 ElevenLabs 等专业厂商与通用模型厂商正面交集的区间。第二,多语言与区域口音的覆盖,把配音本地化从稀缺服务变成可按量调用的一环:跨国企业的培训材料、客服语音与广告本地化,过去受限于配音人才与录音棚排期,现在可以按脚本批量生成。

第三,声音复刻的合规设计正在形成事实标准。谷歌本次把口头同意录音校验、SynthID 水印与 C2PA 凭证三者打包为默认配置,而不是可选功能。对企业而言,这一组合提供了在内部审计与对外授权中可举证的技术链条;同时也意味着语音类应用的身份与授权管理需要并入既有的数据合规流程,尤其是涉及真人代言、客服录音与历史素材复用等场景。

“我们把语音生成从静态预设转变为一个动态的创作工作室。”——谷歌官方博客对 Gemini 3.8 TTS 定位的表述

不确定之处

其一,基准成绩由谷歌引用 Hume AI 等机构结果,未经过独立第三方复核,且口音建模与综合质量指数均为厂商自选口径;其二,官方公告未给出两款模型的 API 定价,Flash-Lite 的成本优势只能按「高频低成本」的定位推断,实际单位成本需等价格表公布;其三,用 Flash TTS 设计的自定义音色能否由 Flash-Lite TTS 渲染,公告未作说明,这直接影响混合使用的可行性;其四,声音复刻在多个司法辖区被禁用,跨区域业务部署时需要先确认可用范围;其五,音色重混(调整音色、音高、语速与口音)功能仍标注为「即将推出」,未给出时间表。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

谷歌发布 Gemini 3.8 Flash TTS:自然语言设计音色,30 秒样本复刻声音|北京拓实科技