发生了什么
当地时间7月23日,微软宣布推出两款全新的自研AI模型:MAI-Image-2.5-Pro面向高质量图像生成场景;MAI-Voice-2-Flash面向高并发语音交互场景。两款模型均已进入公开预览阶段,可通过Azure AI Foundry接入。
微软明确表示,这两款模型基于内部训练流程从头开发,使用经过清理、可追踪、企业合规的数据训练,不依赖对任何第三方模型的蒸馏。这一声明在微软与OpenAI的合作关系背景下尤为值得关注——它意味着微软正在系统性地构建独立于OpenAI的AI能力栈。
关键数据
- 成本优势:微软AI负责人Mustafa Suleyman透露,以PowerPoint场景为例,自研MAI模型运行成本较此前方案降低约85%。
- 性能对标:CEO纳德拉表示,MAI系列在Excel任务上的表现已与GPT-5.6相当,验证了自研模型在特定企业场景中的竞争力。
- 落地场景:MAI-Image-2.5-Pro已集成至Bing图像搜索和PowerPoint设计器;MAI-Voice-2-Flash已部署于Teams实时翻译和Azure语音服务。
- 训练保障:所有训练数据经过清理和溯源,符合企业合规要求,这是微软面向B端客户的核心卖点。
为什么重要
微软正在推进被纳德拉称为「前沿扩散与控制」(Frontier Diffusion & Control)的战略——在继续使用OpenAI前沿模型的同时,自研专用模型覆盖高频、高性价比的企业场景。这一双轨策略一旦跑通,将对整个AI产业链产生深远影响:对OpenAI而言,最大的客户正在成为竞争对手;对企业用户而言,微软生态内的AI成本有望持续走低。
对于中国企业的启示在于:云厂商自研垂直场景模型,与顶级通用大模型形成互补,可能是降低AI部署总成本的有效路径。目前尚不明确的是,MAI系列何时将对非微软生态用户开放,以及图像与语音模型之外的更多模态覆盖时间表。

