返回行业动态
模型与产品

阿里上线原生全模态模型 Qwen3.8-Omni-Flash:1M 上下文,音视频 API 降价超九成

9月18日阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,直接接受文本、图像、音频与视频输入,支持1M长序列,基于Qwen3.8-Flash-Next架构。官方称在累计30项评测中相比上一代Qwen3.5-Omni-Plus平均得分提升超26%,音频能力整体超过Gemini 3.8 Flash。价格方面每小时音频输入价格降幅超98%,每小时音视频输入价格降幅超93%,并同步开源Qwen-MM-Plugins与Qwen-Live Harness,把全模态工作流推向按量商用的经济区间。

来源:阿里云千问(Qwen)官方模型发布记录原标题:模型发布记录:qwen3.8-omni-flash(2026年9月18日)查看原文
深蓝色空间中一条彩色音视频时间轴被拆解为文字、图像、音频、视频四条并行光带,向中央汇聚成一道明亮白色光束,橙红与青色粒子漂浮

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

9月18日,阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型直接接受文本、图像、音频与视频输入,支持1M长序列,基于Qwen3.8-Flash-Next架构。官方定位是推动全模态模型从理解内容走向规划任务、调用工具并完成创作。

官方称在累计30项评测中,Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过26%。其中音视频Agent、Coding及长程任务在 WildClawBench-MM 上提升36.5分,在 AgenticVBench 上提升22.3分,UniClawBench 取得69.6分;音频能力整体超过 Gemini 3.8 Flash,音视频能力接近该模型。

  • 输入输出:支持音频与图像输入、文本与音频输出,可解析2通道与4通道空间音频,兼容 DashScope 与 OpenAI 协议
  • 价格调整:每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%
  • 配套开源:同步开源面向长程工作流的 Qwen-MM-Plugins 与面向实时交互的 Qwen-Live Harness
  • 上线渠道:模型已上线千问AI平台

为什么值得关注

这次发布的量级变化在价格。音视频类接口价格下降九成以上,意味着长音视频理解、会议纪要生成与任务执行、音乐视频创作、短剧翻译、长电影解说等此前因 token 成本过高难以规模化的工作流,第一次具备了按量商用的经济性。阿里同时用一次模型优化模型的实验给出具体参照:Qwen3.8-Omni-Flash 在12小时内把 Qwen2.5-Omni-3B 的四川话识别字符错误率从25.79%降到15.30%。

值得对照的是同一天的国产模型节奏。智谱在同日上线 GLM-5.3-FlashX,把推理速度提到200 tokens/s并上调定价2.5倍。两家公司选择了相反的价格方向,却指向同一个判断:在Agent时代,一个项目的token消耗量级从千级跃升至百万级,竞争焦点正从参数规模与榜单分数,转向单位成本下的有效吞吐。

仍需观察

官方尚未公布 Qwen3.8-Omni-Flash 的总参数与激活参数规模,也未披露独立第三方复测结果,前述提升幅度主要来自厂商自建评测集。对企业的实际决策点有两个:一是音视频输入大幅降价后,是否把全模态模型从演示场景移入生产流程;二是1M上下文叠加音视频输入会显著抬高单次请求的显存与带宽占用,需要重新核算容量规划与并发上限。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

阿里 Qwen3.8-Omni-Flash:1M 上下文,音视频 API 降价超九成|北京拓实科技