返回行业动态
模型与产品

阿里发布Qwen3.8-Flash-Next:125B参数仅激活6B,推理成本降至Claude Opus 4.6的3%

阿里巴巴通义实验室发布并开源Qwen3.8-Flash-Next,采用全新下一代架构,125B总参数仅激活6B即可获得超越Claude Opus 4.6的前沿性能。模型支持262K原生上下文(可扩展至100万),定价仅为Claude Opus 4.6的3%,创下模型效率全球新基准。

来源:阿里通义实验室原标题:Qwen3.8-Flash-Next: A New Architecture for Efficient Inference查看原文
阿里Qwen3.8-Flash-Next模型架构,高效推理与多模态

北京拓实科技原创

架构与性能突破

阿里巴巴于8月27日发布并开源Qwen3.8-Flash-Next,这是千问系列首款采用GDN(门控DeltaNet)与QSA(量子稀疏注意力)混合注意力架构的模型。125B总参数中仅激活6B,在多项基准测试中超越Claude Opus 4.6,创下「用最少算力办最多事」的全球新纪录。

该模型支持262K原生上下文窗口,可扩展至100万tokens,原生支持图文多模态输入。在Terminal-Bench代理编程测试中得分73.0,DeepSWE 1.1达42.2,较上代提升超200%。阿里将其定位为Qwen4架构的预览版,暗示下一代旗舰模型将沿用此架构路线。

成本与效率

  • 定价0.16美元/百万输入tokens、0.47美元/百万输出tokens
  • 仅为Claude Opus 4.6成本的3%,企业部署成本大幅降低
  • 单张消费级GPU即可运行本地推理,无需数据中心
  • 开源权重已上线Hugging Face,支持Apache 2.0协议
  • API已同步上线QwenCloud,开发者可即开即用

战略意义

Qwen3.8-Flash-Next的发布标志着阿里在「模型效率」赛道上取得领先。当行业还在追逐参数规模时,阿里转向用架构创新降低推理成本——这对大规模部署AI代理的企业尤为关键,因为代理系统单次任务可能需要数十甚至数百次模型调用,延迟和成本会快速叠加。

结合本周发布的千问办公国际版(QwenWork),阿里正在构建从模型到应用的完整AI生态。对企业用户而言,这意味着可以用极低门槛获得前沿AI能力。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。