返回行业动态
模型与产品

MiniMax 开源全模态生成模型 H3:2K 直出、0.8 元/秒,多家芯片平台首日适配

8月3日,MiniMax 正式开源新一代全模态生成模型 H3。该模型可统一理解文本、图像、视频与音频构成的多模态上下文,生成最高 2K 分辨率、最长 15 秒且带原生立体声的视频,API 定价 0.8 元/秒,约为业内同类旗舰模型的三分之一。华为昇腾、摩尔线程、沐曦、海光、AMD、Intel 等多家芯片厂商及 Hugging Face、魔搭等平台完成首日适配。

来源:MiniMax 官方(Hugging Face 模型仓库)原标题:MiniMax-H3查看原文
紫色渐变科技背景中,视频播放界面与声波频谱交融,展示多模态音视频生成主题

图片来源:北京拓实科技原创

发生了什么

8月3日,MiniMax 正式开源新一代通用多模态生成模型 MiniMax H3。H3 是 MiniMax 推出的首款开源多模态生成模型,其核心生成网络 H3-Omni-Transformer 为 33B 参数的 Dense 单流 Transformer。完整的 H3 系统由 H3-Context-IR、H3-Base、H3-Regenerate-2K 三个模块组成,开发者可直接从 Hugging Face 下载,H3-Base 支持通过 SGLang、vLLM、diffusers 和 ComfyUI 等推理框架与工作流部署。

关键能力与定价

H3 不再以图片、视频、声音的生成与编辑等单一任务为边界,而是在多模态上下文中统一理解创作意图。模型支持 2K 分辨率直出、最长 15 秒音画内容生成,输出具备原生双声道音频。在效果方面,官方称其在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等能力上表现出色,适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。API 定价 0.8 元/秒,约为业内同类旗舰模型的三分之一。

  • 首款开源的全模态生成模型,支持文本、图像、视频、音频统一理解
  • 最高 2K 分辨率、15 秒原生立体声音画生成
  • API 定价 0.8 元/秒,约为同类旗舰的三分之一
  • 华为昇腾、摩尔线程、沐曦、海光、AMD、Intel 等完成 Day-0 适配

对企业读者的意义

H3 开源意味着企业可在本地灵活部署多模态生成能力,结合自身数据与业务进行优化,更好地满足安全合规要求,同时显著降低高质量视频内容的创作成本。对于内容营销、电商与广告团队而言,这是低成本试水 AI 视频生产的现实选项;芯片厂商的 Day-0 适配也降低了国产算力环境的落地门槛。

仍需观察

开源许可证的具体条款、本地部署的硬件需求与推理成本,以及多模态生成在长视频一致性、版权素材处理上的表现,仍需企业在真实业务场景中实测验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。