Guide du développeur MiniMax H3 : Architecture, 3 modes d'utilisation et workflow 2K
Une présentation technique de MiniMax H3 : le pipeline en trois étapes, le transformateur omniprésent H3-Base dense de 33B, T2VA vs FL2VA vs Ref2VA, et le workflow complet de régénération 2K avec des éléments locaux et cloud.
MiniMax H3 est un système de génération vidéo universel à pleine modalité. Il prend du texte, des images, des vidéos et de l'audio comme un seul contexte, comprend les relations entre eux et produit une vidéo native stéréo-audio de 2K, 15 secondes. L'architecture est la partie que la plupart des utilisateurs ne voient jamais, mais c'est la partie qui explique chaque décision que MiniMax a prise au cours des douze derniers mois. Ce guide passe en revue le pipeline en trois étapes, le transformateur omniprésent H3-Base dense de 33B à l'intérieur, les trois modes d'utilisation (T2VA, FL2VA, Ref2VA), et le workflow complet 2K qui combine la génération locale avec la régénération cloud.
Si vous n'êtes pas un praticien de l'apprentissage automatique, vous pouvez vous arrêter après la section des modes d'utilisation et utiliser videobao pour le reste. Si vous intégrez H3 vous-même, le reste de l'article est pour vous.
Aperçu du pipeline en trois étapes
H3 n'est pas un seul modèle. Il s'agit de trois modules connectés ensemble : H3-Context-IR, H3-Base et H3-Regenerate-2K. Le pipeline prend les instructions multimodales brutes à gauche et produit une vidéo 2K avec de l'audio synchronisé à droite.
H3-Context-IR analyse tout ce que l'utilisateur envoie au modèle. Texte, image, vidéo, audio ou toute combinaison. La sortie est une représentation intermédiaire de contexte structurée que les étapes en aval peuvent consommer. H3-Base génère ensuite une vidéo 768p avec de l'audio à partir de cette représentation, et H3-Regenerate-2K prend la sortie 768p, la fusionne à nouveau avec le contexte d'origine et la restitue à 2K. L'étape de régénération est ce qui fait que le 2K semble net plutôt que mis à l'échelle, car le modèle a toujours le contexte d'origine complet pour s'appuyer tout en affinant.
Considérez cela comme une recette en trois étapes : comprendre le brief, rédiger une version basse résolution, puis réécrire en pleine résolution avec le brief toujours en vue. Le même schéma fonctionne dans la production cinématographique et le design. H3 le rend simplement en un seul appel d'API.

À l'intérieur de H3-Base : 33B dense, un flux, dé-bruitage conjoint vidéo-audio
H3-Base est le cœur du système. C'est un transformateur dense de 33 milliards de paramètres qui dé-bruite les latents vidéo et audio en un seul flux, utilisant un backbone DiT partagé avec 50 couches.
Trois encodeurs le nourrissent. L'encodeur H3 est construit sur Qwen3-VL-32B à la couche 50 et produit des jetons de texte. L'encodeur VAE visuel fonctionne à 16x16x24 avec une causalité temporelle et un découpage en patchs de 2x2x1, produisant des latents de référence visuels. L'encodeur VAE audio fonctionne à d=32, stéréo, 32 kHz, jetons de 40 Hz. Les quatre flux de jetons sont regroupés en une seule séquence en contexte, avec les latents vidéo et audio bruités ajoutés du côté de la génération. C'est cette seule séquence que le transformateur dé-bruite.
Le choix d'architecture qui compte est les composants spécifiques à la modalité sur un backbone partagé. Le DiT de base est partagé entre la vidéo et l'audio, ce qui explique pourquoi le modèle peut garder les deux synchronisés sans module d'alignement supplémentaire. Les deux décodeurs sont toujours séparés : un décodeur VAE visuel qui mappe les latents vidéo vers des trames RGB, et un décodeur VAE audio qui mappe les latents audio vers une forme d'onde stéréo. La sortie est une paire vidéo-plus-stéréo-audio synchronisée, générée en une seule passe.

Trois modes d'utilisation : T2VA, FL2VA, Ref2VA
H3 propose deux points de contrôle open source, chacun étant optimisé pour un mode d'utilisation différent. Les deux produisent une vidéo 768p avec audio en précision BF16. La différence réside dans ce qu'ils acceptent comme entrée.
H3-Base-FL2VA est le mode premier/dernier cadre. Il accepte du texte plus zéro, un ou deux images de référence. Zéro image signifie texte-à-audio-vidéo (T2VA). Une image peut être un premier cadre (I2VA à partir d'un cadre de tête) ou un cadre de queue. Deux images signifie interpolation premier-dernier cadre. Utilisez FL2VA lorsque l'utilisateur a une idée claire du début et de la fin et veut que le modèle remplisse le mouvement entre les deux.
H3-Base-Ref2VA est le mode basé sur la référence. Il accepte du texte plus jusqu'à 9 images de référence, jusqu'à 3 clips vidéo de référence (chacun de 2 à 15 secondes, le total ne dépassant pas 15 secondes), et jusqu'à 3 clips audio de référence (chacun de 2 à 15 secondes, le total ne dépassant pas 15 secondes). L'audio doit être associé à une image ou à une vidéo - il ne peut pas être seul. Le total de tous les types d'entrée est limité à 12 fichiers. Ref2VA est le mode pour la cohérence des personnages, le clonage de voix, le transfert de scène et les montages complexes où vous souhaitez réutiliser des morceaux de séquences existantes.

Le workflow complet 2K : Base locale plus régénération cloud
La sortie 768p de H3-Base est le chemin local, entièrement open source. Le chemin 2K combine le H3-Base local avec deux API cloud : H3-Context-IR et H3-Regenerate-2K. Les deux sont hébergés par MiniMax.
Les trois étapes s'alignent avec le diagramme du pipeline. Premièrement, H3-Context-IR prend l'entrée utilisateur et produit le prompt étendu que H3-Base et H3-Regenerate-2K consommeront. Deuxièmement, le H3-Base déployé localement restitue une vidéo 768p avec audio à partir de ce prompt étendu. Troisièmement, H3-Regenerate-2K prend le résultat 768p comme base_video, le recombine avec le prompt étendu et le contexte utilisateur d'origine, et restitue à 2K. L'étape de régénération est ce qui porte le contexte sémantique d'origine dans le passage haute résolution, ce qui explique pourquoi la sortie 2K semble être un affinement plutôt qu'un upscale.
Trois cas 2K sont livrés dans la carte officielle du modèle : T2VA (texte uniquement, chaîne complète), I2VA (texte plus un premier cadre, chaîne complète), et Ref2VA (texte plus clips de référence, chaîne complète). Pour chaque cas, la carte du modèle fournit à la fois une exécution locale uniquement 768p et une exécution 2K via l'API, afin que le développeur puisse vérifier que le chemin local correspond au chemin cloud sur une sortie de référence connue.
Pour la production : dans l'exemple de code, la sortie H3-Base locale est encodée en base64 en tant qu'URL de données et transmise à H3-Regenerate-2K. Dans un déploiement réel, vous téléchargez la vidéo 768p vers n'importe quelle URL publique et transmettez l'URL comme base_video à la place. C'est le seul changement de plomberie significatif entre l'exemple et la production.
Fiche technique
Durée de sortie : 4 à 15 secondes. Formats d'image : 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Résolution : 768p par défaut ; 2K via H3-Regenerate-2K. Fréquence d'images : 24 FPS. Audio : 32 kHz stéréo, natif au modèle.
Le support linguistique stable couvre 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. D'autres langues bénéficient d'un support partiel. Licence : Licence communautaire MiniMax H3 (open source, mais pas permissive au sens d'Apache - lisez la carte du modèle avant de lancer un produit commercial par-dessus).
Où obtenir les poids : Hugging Face à huggingface.co/MiniMaxAI/MiniMax-H3 et ModelScope à modelscope.cn/models/MiniMax/MiniMax-H3. Les paramètres de requête complets, le prompt H3-Context-IR et le code de régénération se trouvent dans la carte du modèle Hugging Face.
Sur videobao : Qu'est-ce qui est en direct, qu'est-ce qui est ensuite
H3 est en direct sur videobao aujourd'hui. Les modes d'utilisation intégrés couvrent toute la surface H3-Base : texte vers vidéo ; image de première image, dernière image ou première+dernière image vers vidéo ; et mode guidé par référence avec jusqu'à 5 images de référence plus clips vidéo et audio de référence optionnels. Choisissez le mode qui correspond au brief, ajoutez des images ou références, générez un clip 2K et expédiez-le. Le prix est de 7 crédits par seconde pour le 2K natif, avec une durée de 4 à 15 secondes. H3 est en niveau premium sur videobao car la génération 2K est significativement plus chère que le 1080p.
Les trois modes sont livrés derrière le même flux de génération. Le mode guidé par référence est ce qui débloque la cohérence des personnages entre les prises, le clonage de voix pour les publicités de produits et le montage multi-source complexe, et il est déjà en direct sur videobao aux côtés des chemins première/dernière image, donc le même modèle prompt-plus-références fonctionne que vous utilisiez H3 aujourd'hui ou l'un de ces modes demain.
Déploiement local, ressources et quoi lire ensuite
Pour un déploiement local, vous avez besoin d'une boîte multi-GPU. Le transformateur dense de 33B est petit selon les normes de la frontière 2026, mais il veut encore une VRAM sérieuse. La carte du modèle décrit la configuration d'inférence exacte, le paramétrage du service de style vLLM et les hypothèses de précision BF16. Lisez la carte du modèle de bout en bout avant de vous engager sur une cible de déploiement.
Ressources : la carte du modèle Hugging Face est la source de vérité (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope reflète les poids pour les utilisateurs en Chine (modelscope.cn/models/MiniMax/MiniMax-H3). Les documents de la plateforme MiniMax couvrent les API cloud pour H3-2K Direct, H3-Context-IR et H3-Regenerate-2K sur platform.minimaxi.com/docs/api-reference. Pour le laboratoire sous-jacent, hailuoai.com est le point d'entrée grand public.
Si vous n'avez besoin de H3 que pour le travail de production et que vous ne souhaitez pas l'héberger, le panneau d'intégration videobao est le chemin le plus rapide. Si vous souhaitez le plein contrôle d'un déploiement local, la carte du modèle plus les documents de la plateforme vous permettront d'obtenir un pipeline 2K en un jour.