返回行业动态
模型与产品

阿里发布 Qwen-Image-3.0:支持 4.5K Token 超长输入,复杂图文排版能力重大突破

阿里通义千问团队于 7 月 21 日发布第三代图像生成基础模型 Qwen-Image-3.0,支持最大 4.5K Token 超长文本输入与复杂版面生成,可原生渲染 12 国语言和 20 余款字体,在 Hacker News 获 521 分高评价。该模型在商业文档(报纸、分镜、试卷)、UI 界面仿真和小字精准渲染(10px)方面实现突破,补足了传统 AI 绘图在文字排版领域的短板。

来源:阿里巴巴通义千问团队原标题:Qwen-Image-3.0: Third Generation Image Generation Foundation Model查看原文
Qwen-Image-3.0图像生成概念图:彩色光束从文字符号中流淌而出,汇聚成精美的印刷排版图像

图片来源:北京拓实科技原创

发生了什么

7 月 21 日,阿里巴巴通义千问(Qwen)团队正式发布第三代图像生成基础模型 Qwen-Image-3.0。与此前版本相比,3.0 版的核心升级集中在复杂图文排版能力上:模型支持最大 4.5K Token 的超长文本输入,可一次性生成包含公式符号、几何图形、数据表格和多段文字融合的复杂版面。

核心技术突破

  • 超长上下文渲染:4.5K Token 的文本输入意味着模型可处理完整的商业文档、学术论文或多语种手册,并在生成图像中精确呈现所有文字内容。
  • 小字精准渲染:支持 10px 小字的清晰渲染,毛孔、发丝等细节真实还原,解决了传统 AI 绘图工具在文字区域模糊、错位的顽疾。
  • 多语种原生支持:覆盖 12 国语言和 20 余款字体,减少了企业全球化内容生产中的本地化摩擦。
  • 界面仿真能力:具备模拟主流网页、游戏 UI、直播界面等复杂界面的能力,为产品原型设计和营销素材生产提供了新的自动化路径。
  • 开源友好:延续 Qwen 系列开元策略,在 Hacker News 获得 521 分高评,社区反响积极。

企业场景意义

Qwen-Image-3.0 的发布补上了多模态 AI 在企业内容生产链条中的一块关键短板——结构化图文排版。此前 AI 生成图像在营销海报、产品说明书、数据可视化报告等场景中始终难以替代人工排版,3.0 版在文字准确性和版面控制上的进步,使 AI 辅助商业内容生产从「可用」迈向了「实用」。这也是中国大模型团队在图像生成领域首次在 Hacker News 等技术社区获得如此高的认可度。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

阿里发布Qwen-Image-3.0:4.5K超长输入,复杂图文排版重大突破|北京拓实科技