发生了什么
腾讯混元于 8 月 4 日正式发布新一代语音识别模型 Hy ASR 3.0 preview,并已上线腾讯云官网对外提供 API 服务。与此前以“逐字转写”为核心的语音识别模型不同,该模型首次将大语言模型 Hy3 的深度语义理解能力融入识别链路,实现从声学特征到语义意图的联合建模,官方称其完成了从“逐字转写、单点优化”到“理解语境、兼容场景、一键直出”的跨越。
核心能力与评测表现
- 通用识别与方言覆盖:在开源评测集上,中文普通话词错误率(WER)3.34%、英语 2.62%、粤语 3.12%,整体约 3% 水平,多语种表现领先
- 上下文感知:结合上下文捕捉用户语境,支持自动纠错,从孤立转写演进为理解意图的输出
- 场景鲁棒性:针对专业场景与复杂环境(噪音、口音、多人对话)优化,提升稳定性
- 产品落地:腾讯元宝深度参与共研并完成首发上线,语音输入功能免费开放;WorkBuddy 等产品陆续接入
为何重要
语音识别是智能客服、会议转写、语音搜索、呼叫中心质检等企业场景的基础能力。Hy ASR 3.0 preview 展示了一条新路线:以大模型语义能力重构传统 ASR,使识别系统能结合上下文修正方言、同音字和口误,直接输出接近用户意图的文本,减少企业后续的文本后处理成本。对采购语音能力的国内企业而言,方言覆盖和中文场景鲁棒性是其选型的两个关键维度,该模型的评测数据提供了横向比较的参照。
局限与观察
需要指出的是,本次发布为 preview(预览)版本,评测数据主要来自开源与自建评测集,真实场景下的长尾表现仍需企业实测验证。模型已通过腾讯云 API 提供商用接入,具体定价与并发能力尚未全面公开。后续正式版本的迭代节奏、是否开放本地部署,值得持续关注。

