返回行业动态
企业AI落地

腾讯混元发布 Hy ASR 3.0 preview:语音识别从“逐字转写”迈向“理解语境”

8 月 4 日,腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。该模型基于自研 Hy3 大语言模型的语义理解能力,融合高精度声学识别,在开源评测集上普通话、英语、粤语词错误率均控制在 3% 左右;已上线腾讯云 API,腾讯元宝首发接入并免费开放,可应用于智能客服、内容理解、语音搜索等场景。

来源:腾讯混元官方原标题:腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview查看原文
蓝紫色渐变背景上,声波波形从简洁的耳朵轮廓中扩散并幻化成城市天际线剪影,象征语音识别与语义理解

图片来源:北京拓实科技原创(AI生成)

发生了什么

腾讯混元于 8 月 4 日正式发布新一代语音识别模型 Hy ASR 3.0 preview,并已上线腾讯云官网对外提供 API 服务。与此前以“逐字转写”为核心的语音识别模型不同,该模型首次将大语言模型 Hy3 的深度语义理解能力融入识别链路,实现从声学特征到语义意图的联合建模,官方称其完成了从“逐字转写、单点优化”到“理解语境、兼容场景、一键直出”的跨越。

核心能力与评测表现

  • 通用识别与方言覆盖:在开源评测集上,中文普通话词错误率(WER)3.34%、英语 2.62%、粤语 3.12%,整体约 3% 水平,多语种表现领先
  • 上下文感知:结合上下文捕捉用户语境,支持自动纠错,从孤立转写演进为理解意图的输出
  • 场景鲁棒性:针对专业场景与复杂环境(噪音、口音、多人对话)优化,提升稳定性
  • 产品落地:腾讯元宝深度参与共研并完成首发上线,语音输入功能免费开放;WorkBuddy 等产品陆续接入

为何重要

语音识别是智能客服、会议转写、语音搜索、呼叫中心质检等企业场景的基础能力。Hy ASR 3.0 preview 展示了一条新路线:以大模型语义能力重构传统 ASR,使识别系统能结合上下文修正方言、同音字和口误,直接输出接近用户意图的文本,减少企业后续的文本后处理成本。对采购语音能力的国内企业而言,方言覆盖和中文场景鲁棒性是其选型的两个关键维度,该模型的评测数据提供了横向比较的参照。

局限与观察

需要指出的是,本次发布为 preview(预览)版本,评测数据主要来自开源与自建评测集,真实场景下的长尾表现仍需企业实测验证。模型已通过腾讯云 API 提供商用接入,具体定价与并发能力尚未全面公开。后续正式版本的迭代节奏、是否开放本地部署,值得持续关注。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。