返回行业动态
模型与产品

微软自研MAI模型再扩军:图像与语音双模型发布,运行成本降85%

微软于当地时间7月23日宣布推出两款自研AI模型:MAI-Image-2.5-Pro(图像生成)和MAI-Voice-2-Flash(语音交互),均已进入公开预览阶段。这两款模型属于微软AI团队的内部训练模型系列,未依赖第三方模型蒸馏,使用经清理、可追踪的企业级数据训练。微软AI负责人Mustafa Suleyman透露,以PowerPoint为例,自研MAI模型运行成本较此前降低约85%。CEO纳德拉同日表示,MAI系列模型在Excel等多项任务上的表现已与GPT-5.6相当,且能显著降低企业AI部署成本。

来源:IT之家原标题:微软最新模型MAI-Image-2.5-Pro、MAI-Voice-2-Flash发布查看原文
微软MAI自研模型概念图:AI图像生成与语音交互双模型发布

图片来源:北京拓实科技原创

发生了什么

当地时间7月23日,微软宣布推出两款全新的自研AI模型:MAI-Image-2.5-Pro面向高质量图像生成场景;MAI-Voice-2-Flash面向高并发语音交互场景。两款模型均已进入公开预览阶段,可通过Azure AI Foundry接入。

微软明确表示,这两款模型基于内部训练流程从头开发,使用经过清理、可追踪、企业合规的数据训练,不依赖对任何第三方模型的蒸馏。这一声明在微软与OpenAI的合作关系背景下尤为值得关注——它意味着微软正在系统性地构建独立于OpenAI的AI能力栈。

关键数据

  • 成本优势:微软AI负责人Mustafa Suleyman透露,以PowerPoint场景为例,自研MAI模型运行成本较此前方案降低约85%。
  • 性能对标:CEO纳德拉表示,MAI系列在Excel任务上的表现已与GPT-5.6相当,验证了自研模型在特定企业场景中的竞争力。
  • 落地场景:MAI-Image-2.5-Pro已集成至Bing图像搜索和PowerPoint设计器;MAI-Voice-2-Flash已部署于Teams实时翻译和Azure语音服务。
  • 训练保障:所有训练数据经过清理和溯源,符合企业合规要求,这是微软面向B端客户的核心卖点。

为什么重要

微软正在推进被纳德拉称为「前沿扩散与控制」(Frontier Diffusion & Control)的战略——在继续使用OpenAI前沿模型的同时,自研专用模型覆盖高频、高性价比的企业场景。这一双轨策略一旦跑通,将对整个AI产业链产生深远影响:对OpenAI而言,最大的客户正在成为竞争对手;对企业用户而言,微软生态内的AI成本有望持续走低。

对于中国企业的启示在于:云厂商自研垂直场景模型,与顶级通用大模型形成互补,可能是降低AI部署总成本的有效路径。目前尚不明确的是,MAI系列何时将对非微软生态用户开放,以及图像与语音模型之外的更多模态覆盖时间表。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

微软自研MAI图像与语音模型发布,运行成本降85%,性能比肩GPT-5.6|北京拓实科技