返回行业动态
模型与产品

通义千问开源 Qwen3-VL-30B-A3B:30 亿激活参数的多模态模型对标闭源旗舰

阿里云通义千问于 10 月 4 日开源 Qwen3-VL-30B-A3B 多模态模型,含 Instruct 与 Thinking 两个版本并附 FP8 权重,总规模约 300 亿、每个 token 仅激活约 30 亿。官方称其在 STEM、视觉问答、OCR、视频理解与智能体任务上对标 GPT-5-Mini 与 Claude 4-Sonnet,权重可在 Hugging Face 与魔搭免费下载。第三方榜单显示,该模型在部分视觉任务上仍落后于更大的 235B 版本与头部闭源模型。

来源:Qwen(阿里云通义千问)Hugging Face 模型卡:Qwen3-VL-30B-A3B-Instruct原标题:Qwen3-VL-30B-A3B-Instruct查看原文
以发光视觉理解网格与多模态任务图标表现的国产开源多模态大模型发布

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

阿里云通义千问团队于 10 月 4 日集中开源了一批视觉语言模型:Qwen3-VL-30B-A3B-Instruct 与 Qwen3-VL-30B-A3B-Thinking 两个版本,并同步给出 FP8 量化权重;更大的 Qwen3-VL-235B-A22B 也放出了 FP8 版本。其中 30B-A3B 是这一批的重点:名字里的 A3B 指「激活参数约 30 亿」,即模型总规模约 300 亿,但每次前向计算真正参与运算的只有约 30 亿,属于典型的混合专家(MoE)架构。这种设计让显存占用与推理速度接近一个小得多的稠密模型,同时把能力储备留在 300 亿这个量级,对希望在本地或私有环境部署多模态能力的团队尤其友好。

能力升级与部署门槛

  • 视觉代理:可识别并操作 PC 与移动端图形界面里的元素,理解其功能、调用工具并完成任务。
  • 视觉编码增强:可从图像或视频生成 draw.io 图、HTML、CSS 与 JavaScript。
  • 空间感知:能判断对象位置、视角与遮挡关系,为空间推理与具身智能提供三维基础。
  • 上下文:原生 256K,可扩展至 1M,能处理整本书与数小时视频,并带完整回忆与秒级索引。
  • OCR:支持语言由 19 种扩展到 32 种,在低光、模糊与倾斜条件下更稳,对罕见文字、古文字与专业术语的处理更好,长文档结构解析也有改进。
  • 形态:提供从边缘到云端的密集与 MoE 架构,以及 Instruct 与推理增强型 Thinking 两个版本。

硬件门槛是这一批模型最实在的变化。FP8 相比 FP16 可把内存占用与算力需求压到接近一半:以 235B 版本为例,FP16 存储约需 470GB 显存,换成 FP8 只需约 235GB,推理速度还能提升三成以上。落到 30B-A3B 这个体量,社区实测显示采用 4 位量化后大致能装进一张 24GB 显存的消费级显卡。权重在 Hugging Face 与魔搭社区免费下载,并已同步上线 Qwen Chat。

为什么值得关注

官方给出的成绩单相当硬:Qwen3-VL-30B-A3B 在 STEM 数理推理、视觉问答、OCR、文字识别、视频理解与智能体五类任务上对标 GPT-5-Mini 与 Claude 4-Sonnet,部分项目表现更优。这五个方向恰好是多模态落地最核心的战场——文档数字化与票据识别、短视频内容理解、需要「看懂再动手」的智能体、以及教育科研与工业质检。一款激活参数只有 30 亿的模型在这些任务上能与闭源旗舰掰手腕,本身比任何单项分数更有信号意义:开源权重的能力上限正在向闭源靠拢,而本地部署的成本门槛被 FP8 与量化进一步压低。

不确定之处

需要区分官方口径与第三方实测。在 RealWorldQA、Muirbench 等公开视觉榜单上,Qwen3-VL-30B-A3B 的 Thinking 版本得分明显低于更大的 Qwen3-VL-235B-A22B,也更低于头部闭源模型(例如 MMMU-Pro 约 60%,低于 Claude Sonnet 4.6 的约 76%)。也就是说,「对标闭源旗舰」是在特定任务集上的表述,跨任务泛化仍与旗舰有差距。此外,官方未公开训练数据构成与完整评测协议,开源不等于开箱即用,从模型到产品之间仍有一段工程距离,尤其是图形界面操作类任务在真实环境里的稳定性仍待验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

通义千问开源 Qwen3-VL-30B-A3B:30 亿激活参数多模态模型|北京拓实科技