发生了什么
9 月 15 日,阶跃星辰发布新一代语音大模型 StepAudio 3 系列,一次性推出五款模型,全部上线阶跃星辰开放平台。与以往围绕语音识别或语音合成单项能力展开的产品不同,这一系列把实时交互、语音理解、语音生成与内容创作纳入同一套模型矩阵,目标是覆盖听、说、理解、推理与创作的完整链路。
五款模型的定位
- StepAudio 3 Realtime:支持原生全双工实时对话,可判断何时回应与等待、处理临时打断,并加入语音推理与任务执行能力。
- StepAudio 3 ASR:将高精度识别与大模型上下文理解结合,支持中文、英文、方言与中英混说,并针对低声、快速语音、含糊连读与背景音乐优化。
- StepAudio 3 TTS:面向真人级语音生成,除音色、语调、节奏与情绪外,还能生成笑声、迟疑、重复、改口等副语言表现,采用流式生成架构。
- StepAudio 3 Gen:以自然语言描述与参考音频为输入,统一生成人声、音效、环境音与背景音乐,并可编排各类声音出现的时间与顺序。
- StepAudio 3 Music:支持从零生成与基于 ABC 记谱法的多轮交互创作,覆盖歌曲创作、清唱配乐与歌曲翻唱。
第三方榜单表现
在第三方评测机构 Artificial Analysis 的榜单中,StepAudio 3 Realtime 以 98.9% 的综合得分位列 Conversational Dynamics 榜单全球第一,并以 99.7% 的语音推理准确率位列 Speech Reasoning 榜单全球第一;StepAudio 3 ASR 在非流式语音识别准确性榜单中词错误率为 1.7%,并列全球第一。语音推理榜主要考察模型直接理解音频并完成复杂推理任务的能力,被业内视为评估原生语音模型的重要第三方基准。
为什么对企业场景有意义
语音正在成为智能体与用户之间的主要入口,而真实业务中的语音交互往往伴随打断、背景噪音与长任务。StepAudio 3 Realtime 将工具调用与长任务改为异步执行,使对话进行期间后台任务继续运行,这一设计与客服、外呼、车载等需要边聊边办事的场景直接相关。ASR 在低声与环境音条件下的优化,以及面向医疗、法律、金融、汽车、编程等专业领域的表达识别提升,对应的是语音数据进入企业知识库之前的转写质量要求。
尚待观察
阶跃星辰公布的成绩来自第三方榜单,但评测集与真实业务音频分布存在差距,企业仍需以自有数据验证效果。五款模型同时上线也意味着工程与成本管理复杂度上升,实际调用价格、并发能力与私有化部署选项尚未在本次发布中完整披露。

