发生了什么
8月3日,MiniMax 正式开源新一代通用多模态生成模型 MiniMax H3。H3 是 MiniMax 推出的首款开源多模态生成模型,其核心生成网络 H3-Omni-Transformer 为 33B 参数的 Dense 单流 Transformer。完整的 H3 系统由 H3-Context-IR、H3-Base、H3-Regenerate-2K 三个模块组成,开发者可直接从 Hugging Face 下载,H3-Base 支持通过 SGLang、vLLM、diffusers 和 ComfyUI 等推理框架与工作流部署。
关键能力与定价
H3 不再以图片、视频、声音的生成与编辑等单一任务为边界,而是在多模态上下文中统一理解创作意图。模型支持 2K 分辨率直出、最长 15 秒音画内容生成,输出具备原生双声道音频。在效果方面,官方称其在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等能力上表现出色,适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。API 定价 0.8 元/秒,约为业内同类旗舰模型的三分之一。
- 首款开源的全模态生成模型,支持文本、图像、视频、音频统一理解
- 最高 2K 分辨率、15 秒原生立体声音画生成
- API 定价 0.8 元/秒,约为同类旗舰的三分之一
- 华为昇腾、摩尔线程、沐曦、海光、AMD、Intel 等完成 Day-0 适配
对企业读者的意义
H3 开源意味着企业可在本地灵活部署多模态生成能力,结合自身数据与业务进行优化,更好地满足安全合规要求,同时显著降低高质量视频内容的创作成本。对于内容营销、电商与广告团队而言,这是低成本试水 AI 视频生产的现实选项;芯片厂商的 Day-0 适配也降低了国产算力环境的落地门槛。
仍需观察
开源许可证的具体条款、本地部署的硬件需求与推理成本,以及多模态生成在长视频一致性、版权素材处理上的表现,仍需企业在真实业务场景中实测验证。

