MiniMax正式开源通用视频模型H3:多模态理解+2K分辨率,视频编辑能力全球第一

2026-08-03 15:29:45   |   棠糖   |   6719

8月3日,MiniMax正式宣布开源新一代通用视频模型MiniMax H3,这是一款能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒、带有原生立体声音频视频的全模态生成系统。

H3的设计核心在于突破传统生成模型在任务和模态上的隔离。此前,图像生成往往被拆分为文生图、编辑、主体参考等多个独立模块,视频生成也细分为文生视频、图生视频、首尾帧、视频编辑等不同功能,模态之间边界清晰。MiniMax团队认为,这些隔离限制了模型的泛化能力和使用自由度,因此H3在预训练阶段便将各类数据和任务进行统一建模,让模型“自然地”学会理解复杂的多模态指令。

一个典型的应用场景是:用户提供一张人物参考图、一段希区柯克镜头运动的参考视频、一条参考歌声的音频,输入“让图里的人物按参考视频的镜头运动、用参考音频里的歌声唱歌”,H3即可一次性生成带原生双声道的2K成片。这种跨模态复合参考的能力,此前仅有极少数闭源模型能够实现。

H3系统由三个核心模块组成:

- H3-Context-IR:专门用于理解和提炼输入的多模态指令,将其转换为结构化的“上下文中间表示”

- H3-Base:基于中间表示生成768p分辨率的音视频内容,采用330亿参数的H3-Omni-Transformer架构

- H3-Regenerate-2K:将768p结果连同原始上下文重新输入模型,以2K分辨率重新生成,可还原传统超分方案难以恢复的细节(如小文字和精细纹理)

输出规格方面,H3支持4至15秒视频时长、24FPS帧率、32kHz立体声音频,以及21:9、16:9、4:3等多种宽高比,默认将较短边设为768像素。模型稳定支持11种语言,包括中文、英语、日语、韩语等。

在Artificial Analysis视频模型榜单中,MiniMax H3的视频编辑能力排名全球第一,文生视频、图生视频能力分别位居第二和第三名。MiniMax H3生成2K视频的定价为每秒0.8元人民币,约为同类旗舰视频模型的三分之一。

H3开源首日,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI等开发社区和云推理平台,均完成了相关适配支持。摩尔线程基于其AI训推一体智算卡MTT S5000及MUSA软件栈,已完成对MiniMax H3的适配与运行,H3-Base支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架进行部署。

MiniMax相关负责人表示:“我们将持续打造更加开放、通用、智能的模型,与合作伙伴携手共建繁荣的开源生态。”

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

MiniMax正式开源通用视频模型H3:多模态理解+2K分辨率,视频编辑能力全球第一

2026-08-03 15:29:45 浏览量: 6719 作者: 棠糖

8月3日,MiniMax正式宣布开源新一代通用视频模型MiniMax H3,这是一款能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒、带有原生立体声音频视频的全模态生成系统。

H3的设计核心在于突破传统生成模型在任务和模态上的隔离。此前,图像生成往往被拆分为文生图、编辑、主体参考等多个独立模块,视频生成也细分为文生视频、图生视频、首尾帧、视频编辑等不同功能,模态之间边界清晰。MiniMax团队认为,这些隔离限制了模型的泛化能力和使用自由度,因此H3在预训练阶段便将各类数据和任务进行统一建模,让模型“自然地”学会理解复杂的多模态指令。

一个典型的应用场景是:用户提供一张人物参考图、一段希区柯克镜头运动的参考视频、一条参考歌声的音频,输入“让图里的人物按参考视频的镜头运动、用参考音频里的歌声唱歌”,H3即可一次性生成带原生双声道的2K成片。这种跨模态复合参考的能力,此前仅有极少数闭源模型能够实现。

H3系统由三个核心模块组成:

- H3-Context-IR:专门用于理解和提炼输入的多模态指令,将其转换为结构化的“上下文中间表示”

- H3-Base:基于中间表示生成768p分辨率的音视频内容,采用330亿参数的H3-Omni-Transformer架构

- H3-Regenerate-2K:将768p结果连同原始上下文重新输入模型,以2K分辨率重新生成,可还原传统超分方案难以恢复的细节(如小文字和精细纹理)

输出规格方面,H3支持4至15秒视频时长、24FPS帧率、32kHz立体声音频,以及21:9、16:9、4:3等多种宽高比,默认将较短边设为768像素。模型稳定支持11种语言,包括中文、英语、日语、韩语等。

在Artificial Analysis视频模型榜单中,MiniMax H3的视频编辑能力排名全球第一,文生视频、图生视频能力分别位居第二和第三名。MiniMax H3生成2K视频的定价为每秒0.8元人民币,约为同类旗舰视频模型的三分之一。

H3开源首日,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI等开发社区和云推理平台,均完成了相关适配支持。摩尔线程基于其AI训推一体智算卡MTT S5000及MUSA软件栈,已完成对MiniMax H3的适配与运行,H3-Base支持通过SGLang、vLLM、diffusers和ComfyUI等推理框架进行部署。

MiniMax相关负责人表示:“我们将持续打造更加开放、通用、智能的模型,与合作伙伴携手共建繁荣的开源生态。”

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号