MiniMax正式开源通用视频模型H3:多模态理解+2K分辨率,视频编辑能力全球第一
8月3日,MiniMax正式宣布开源新一代通用视频模型MiniMax H3,这是一款能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒、带有原生立体声音频视频的全模态生成系统。
H3的设计核心在于突破传统生成模型在任务和模态上的隔离。此前,图像生成往往被拆分为文生图、编辑、主体参考等多个独立模块,视频生成也细分为文生视频、图生视频、首尾帧、视频编辑等不同功能,模态之间边界清晰。MiniMax团队认为,这些隔离限制了模型的泛化能力和使用自由度,因此H3在预训练阶段便将各类数据和任务进行统一建模,让模型“自然地”学会理解复杂的多模态指令。
一个典型的应用场景是:用户提供一张人物参考图、一段希区柯克镜头运动的参考视频、一条参考歌声的音频,输入“让图里的人物按参考视频的镜头运动、用参考音频里的歌声唱歌”,H3即可一次性生成带原生双声道的2K成片。这种跨模态复合参考的能力,此前仅有极少数闭源模型能够实现。
H3系统由三个核心模块组成:
- H3-Context-IR:专门用于理解和提炼输入的多模态指令,将其转换为结构化的“上下文中间表示”
- H3-Base:基于中间表示生成768p分辨率的音视频内容,采用330亿参数的H3-Omni-Transformer架构
- H3-Regenerate-2K:将768p结果连同原始上下文重新输入模型,以2K分辨率重新生成,可还原传统超分方案难以恢复的细节(如小文字和精细纹理)
输出规格方面,H3支持4至15秒视频时长、24FPS帧率、32kHz立体声音频,以及21:9、16:9、4:3等多种宽高比,默认将较短边设为768像素。模型稳定支持11种语言,包括中文、英语、日语、韩语等。
在Artificial Analysis视频模型榜单中,MiniMax H3的视频编辑能力排名全球第一,文生视频、图生视频能力分别位居第二和第三名。MiniMax H3生成2K视频的定价为每秒0.8元人民币,约为同类旗舰视频模型的三分之一。
H3开源首日,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI等开发社区和云推理平台,均完成了相关适配支持。摩尔线程基于其AI训推一体智算卡MTT S5000及MUSA软件栈,已完成对MiniMax H3的适配与运行,H3-Base支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架进行部署。
MiniMax相关负责人表示:“我们将持续打造更加开放、通用、智能的模型,与合作伙伴携手共建繁荣的开源生态。”