返回行业动态
模型与产品

谷歌 Gemini 3.8 Live 加入实时虚拟形象:语音智能体开始「有脸」

谷歌云于 9 月 24 日宣布 Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 正式可用,在原生语音到语音能力之上加入实时生成的虚拟人物层,提供同步语音、口型与表情,支持 97 种语言与异步工具调用,音视频输出嵌入 SynthID 水印,自定义形象需通过企业白名单验证。

来源:Google Cloud Blog原标题:Power your agents: Gemini 3.8 Live with Live Avatar is now generally available查看原文
企业客服中心纵深通道,两侧成排半透明工位舱体,中央由同心圆环与光点勾勒的抽象人形轮廓,顶部为一行白色中文标题 数字员工走上前台

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

谷歌云于 9 月 24 日宣布,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中正式可用,从此前的预览状态转为面向企业生产环境。该功能在原有原生语音到语音能力之上加入实时生成的虚拟人物层,提供同步的语音、口型与表情,可用于网页、移动端与线下互动终端。

关键能力

  • 异步工具调用:智能体可在持续对话的同时在后台调用工具与拉取数据。以酒店入住为例,智能体可一边回答问题一边完成登记,不必为了执行任务而中断对话。
  • 97 种语言:支持自动语言识别与对话中切换语言,口型与表情随之动态调整,避免画面漂移。
  • 实时视觉理解:可同时处理摄像头画面、屏幕共享与音频,对用户侧变化即时响应,无需手动上传图片。
  • 身份与水印:企业可从预置形象库中选择,自定义形象需通过企业白名单与验证流程;生成的音视频均嵌入 SynthID 隐形水印。
  • 区域与合规:目前提供美国与欧盟端点,配套预置吞吐、企业合规与数据治理要求;Gemini 3.8 Live Extended Thinking 仍处私有预览。

为什么重要

语音智能体此前主要比拼延迟与单价,Live Avatar 把竞争维度推向交互质量与视觉一致性,谷歌给出的落地方向包括客服、互动导览与酒店接待。已披露案例包括 Cox Automotive 旗下 Autotrader 的对话式购车助手,以及印度企业 Equal AI——其每天处理逾百万通电话、覆盖九种印度语言。

对企业采购方来说,异步工具调用是与可编程数字员工最相关的一项能力,它决定智能体能否在对话之外真正推进事务,而不是只做问答。SynthID 水印与白名单门槛则指向另一面:虚拟形象一旦大规模用于对外服务,身份核验与合成内容溯源就必须同步建设。

不确定之处

  • 终端体验仍待观察:已有科技媒体提示,接近真人但未达真人水准的虚拟形象可能引发用户不适,实际接受度需要长期数据验证。
  • 自定义能力受限:品牌专属形象的创建与验证流程尚未公布细则。
  • 定价未披露:官方公告未给出计费方式与单价。
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。