MiniMax H3 开发者指南:架构、三种使用模式及2K工作流程
MiniMax H3 的技术详解:三级流水线、33B密集型H3-Base全能Transformer、T2VA与FL2VA及Ref2VA的区别,以及结合本地生成与云端再生的完整2K再生工作流程。
MiniMax H3 是一个通用的全模态视频生成系统。它将文本、图像、视频和音频作为单一上下文,理解它们之间的关系,并生成一个2K分辨率、时长15秒、原生立体声的视频。其架构是大多数用户从未见过的部分,但它解释了MiniMax在过去十二个月中做出的每一个决策。本指南将逐步介绍三级流水线、其中的33B密集型H3-Base全能Transformer、三种使用模式(T2VA、FL2VA、Ref2VA),以及结合本地生成与云端再生的完整2K工作流程。
如果您不是机器学习从业者,您可以在使用模式部分之后停止,并使用videobao进行其余操作。如果您自己集成了H3,本文的其余部分是为您准备的。
三级流水线概览
H3不是一个模型。它是三个模块的组合:H3-Context-IR、H3-Base和H3-Regenerate-2K。该流水线在左侧接收原始的多模态指令,并在右侧生成带有同步音频的2K视频。
H3-Context-IR解析用户向模型提供的任何内容。文本、图像、视频、音频或任何组合。其输出是一个结构化的上下文中间表示,下游阶段可以消费。然后H3-Base从该表示生成带有音频的768p视频,而H3-Regenerate-2K将768p输出与原始上下文重新融合,并以2K分辨率重新渲染。再生步骤是使2K感觉清晰而不是简单放大的原因,因为模型在细化时仍然有完整的原始上下文可以借鉴。
可以将其视为一个三步食谱:理解简报,草拟一个低分辨率版本,然后在仍然可以看到简报的情况下以全分辨率重新草拟。相同的模式适用于电影制作和设计。H3只是将其变成了一个单一的API调用。

H3-Base内部:33B密集型,单一流,联合视频-音频去噪
H3-Base是系统的核心。它是一个具有330亿参数的密集型Transformer,使用共享的DiT主干网络和50层来对视频和音频潜在数据进行单一流去噪。
它有三个编码器。H3编码器基于Qwen3-VL-32B的第50层,并生成文本标记。视觉VAE编码器以16x16x24的分辨率运行,具有时间因果性和2x2x1的patchify,生成视觉参考潜在数据。音频VAE编码器以d=32、立体声、32 kHz、40 Hz标记的分辨率运行。四个标记流被打包成一个上下文序列,并在生成侧附加了噪声视频和噪声音频潜在数据。这个单一序列是Transformer去噪的对象。
重要的架构选择是在共享主干网络之上的特定于模态的组件。基础DiT在视频和音频之间共享,这就是为什么模型能够在没有额外对齐模块的情况下保持两者同步。两个解码器仍然是分开的:一个视觉VAE解码器将视频潜在数据映射回RGB帧,一个音频VAE解码器将音频潜在数据映射到立体声波形。输出是一个同步的视频加立体声音频对,在一次传递中生成。

三种使用模式:T2VA、FL2VA、Ref2VA
H3发布了两个开源检查点,每个检查点都针对不同的使用模式进行了调整。两者都生成带有音频的768p视频,精度为BF16。区别在于它们接受的输入。
H3-Base-FL2VA是首尾帧模式。它接受文本加上零、一或两个参考图像。零图像意味着文本到音频视频(T2VA)。一个图像可以是首帧(从头帧的I2VA)或尾帧。两个图像意味着首尾帧插值。当用户心中有一个明确的开始和结束,并希望模型填充中间的动作时,使用FL2VA。
H3-Base-Ref2VA是参考驱动模式。它接受文本加上最多9个参考图像、3个参考视频片段(每个2-15秒,总时长不超过15秒)和3个参考音频片段(每个2-15秒,总时长不超过15秒)。音频必须与图像或视频配对 - 它不能单独存在。所有输入类型的总数上限为12个文件。Ref2VA是用于角色一致性、语音克隆、场景转换和复杂编辑的模式,您希望重用现有素材的片段。

完整的2K工作流程:本地基础加云端再生
H3-Base的768p输出是本地、完全开源的路径。2K路径结合了本地的H3-Base和两个云API:H3-Context-IR和H3-Regenerate-2K。两者均由MiniMax托管。
三个阶段与管道图一致。首先,H3-Context-IR接收用户输入并生成H3-Base和H3-Regenerate-2K将消费的扩展提示。其次,本地部署的H3-Base从该扩展提示渲染带有音频的768p视频。第三,H3-Regenerate-2K将768p结果作为base_video,重新组合它与扩展提示和原始用户上下文,并以2K分辨率重新渲染。再生步骤是将原始语义上下文带入高分辨率传递的原因,这就是为什么2K输出感觉像是一种改进而不是简单的放大。
官方模型卡中提供了三种2K案例:T2VA(仅文本,完整链)、I2VA(文本加首帧,完整链)和Ref2VA(文本加参考片段,完整链)。对于每个案例,模型卡都提供了仅限本地的768p运行和通过API的2K运行,因此开发人员可以验证本地路径与云路径在已知参考输出上是否匹配。
对于生产:在示例代码中,本地H3-Base输出被base64编码为Data URL,并传递给H3-Regenerate-2K。在实际部署中,您将768p视频上传到任何公共URL,并将URL作为base_video传递。这是示例和生产之间的唯一有意义的管道更改。
规格速查表
输出时长:4到15秒。宽高比:21:9、16:9、4:3、1:1、3:4、9:16。分辨率:默认768p;通过H3-Regenerate-2K实现2K。帧率:24 FPS。音频:32 kHz立体声,原生于模型。
稳定语言支持涵盖11种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言获得部分支持。许可证:MiniMax H3 社区许可证(开源,但不像Apache那样宽松 - 在发布商业产品之前请阅读模型卡)。
在哪里获取权重:Hugging Face,网址为huggingface.co/MiniMaxAI/MiniMax-H3 和 ModelScope,网址为modelscope.cn/models/MiniMax/MiniMax-H3。完整的请求参数、H3-Context-IR提示和再生代码都在Hugging Face模型卡中。
在videobao上:什么是实时的,接下来是什么
H3 今天已在 videobao 实装。集成模式覆盖整个 H3-Base 表面:文本到视频;首帧、尾帧或首尾帧图生视频;以及参考驱动模式(最多 5 张参考图,可选参考视频和音频片段)。挑选符合简报的模式,填入帧或参考,生成 2K 片段,即可发布。定价是每秒钟 7 个信用点用于原生 2K,时长范围为 4 到 15 秒。H3 在 videobao 上是高级层,因为 2K 生成的成本明显高于 1080p。
所有三种模式都在同一个生成流程下交付。参考驱动模式是实现跨镜头角色一致性、产品广告的语音克隆和复杂多源编辑的关键,并且它已与首/尾帧路径一起在 videobao 上实装,因此无论您今天是使用 H3 还是使用这些模式中的任何一种,相同的提示加参考的模式都有效。
本地部署、资源和接下来阅读的内容
对于本地部署,您需要一个多GPU盒子。33B密集型Transformer按2026年前沿标准来看并不大,但它仍然需要大量的VRAM。模型卡将逐步介绍确切的推理配置、vLLM风格的服务器设置和BF16精度假设。在您承诺部署目标之前,请从头到尾阅读模型卡。
资源:Hugging Face模型卡是真实来源(huggingface.co/MiniMaxAI/MiniMax-H3)。ModelScope为中国用户镜像权重(modelscope.cn/models/MiniMax/MiniMax-H3)。MiniMax平台文档涵盖了H3-2K Direct、H3-Context-IR和H3-Regenerate-2K的云API,网址为platform.minimaxi.com/docs/api-reference。对于底层实验室,hailuoai.com是面向消费者的入口点。
如果您只需要H3用于生产工作而不希望托管它,videobao集成面板是最快的路径。如果您希望完全控制本地部署,模型卡加上平台文档将在一天内让您进入2K管道。