发生了什么
谷歌云于 9 月 24 日宣布,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中正式可用,从此前的预览状态转为面向企业生产环境。该功能在原有原生语音到语音能力之上加入实时生成的虚拟人物层,提供同步的语音、口型与表情,可用于网页、移动端与线下互动终端。
关键能力
- 异步工具调用:智能体可在持续对话的同时在后台调用工具与拉取数据。以酒店入住为例,智能体可一边回答问题一边完成登记,不必为了执行任务而中断对话。
- 97 种语言:支持自动语言识别与对话中切换语言,口型与表情随之动态调整,避免画面漂移。
- 实时视觉理解:可同时处理摄像头画面、屏幕共享与音频,对用户侧变化即时响应,无需手动上传图片。
- 身份与水印:企业可从预置形象库中选择,自定义形象需通过企业白名单与验证流程;生成的音视频均嵌入 SynthID 隐形水印。
- 区域与合规:目前提供美国与欧盟端点,配套预置吞吐、企业合规与数据治理要求;Gemini 3.8 Live Extended Thinking 仍处私有预览。
为什么重要
语音智能体此前主要比拼延迟与单价,Live Avatar 把竞争维度推向交互质量与视觉一致性,谷歌给出的落地方向包括客服、互动导览与酒店接待。已披露案例包括 Cox Automotive 旗下 Autotrader 的对话式购车助手,以及印度企业 Equal AI——其每天处理逾百万通电话、覆盖九种印度语言。
对企业采购方来说,异步工具调用是与可编程数字员工最相关的一项能力,它决定智能体能否在对话之外真正推进事务,而不是只做问答。SynthID 水印与白名单门槛则指向另一面:虚拟形象一旦大规模用于对外服务,身份核验与合成内容溯源就必须同步建设。
不确定之处
- 终端体验仍待观察:已有科技媒体提示,接近真人但未达真人水准的虚拟形象可能引发用户不适,实际接受度需要长期数据验证。
- 自定义能力受限:品牌专属形象的创建与验证流程尚未公布细则。
- 定价未披露:官方公告未给出计费方式与单价。
