videobao est en ligne avec DouBao SeeDance 2.5 et MiniMax-H3 — 10 crédits à l'inscription

S'abonner maintenant
Guide du développeur

Guide du développeur MiniMax H3 : Architecture, 3 modes d'utilisation et workflow 2K

Une présentation technique de MiniMax H3 : le pipeline en trois étapes, le transformateur omniprésent H3-Base dense de 33B, T2VA vs FL2VA vs Ref2VA, et le workflow complet de régénération 2K avec des éléments locaux et cloud.

By Équipe videobao8 min de lecture
Diagramme d'aperçu du système MiniMax H3 montrant le pipeline en trois étapes de la compréhension du contexte à la génération de base jusqu'à la régénération 2K haute résolution

MiniMax H3 est un système de génération vidéo universel à pleine modalité. Il prend du texte, des images, des vidéos et de l'audio comme un seul contexte, comprend les relations entre eux et produit une vidéo native stéréo-audio de 2K, 15 secondes. L'architecture est la partie que la plupart des utilisateurs ne voient jamais, mais c'est la partie qui explique chaque décision que MiniMax a prise au cours des douze derniers mois. Ce guide passe en revue le pipeline en trois étapes, le transformateur omniprésent H3-Base dense de 33B à l'intérieur, les trois modes d'utilisation (T2VA, FL2VA, Ref2VA), et le workflow complet 2K qui combine la génération locale avec la régénération cloud.

Si vous n'êtes pas un praticien de l'apprentissage automatique, vous pouvez vous arrêter après la section des modes d'utilisation et utiliser videobao pour le reste. Si vous intégrez H3 vous-même, le reste de l'article est pour vous.

Aperçu du pipeline en trois étapes

H3 n'est pas un seul modèle. Il s'agit de trois modules connectés ensemble : H3-Context-IR, H3-Base et H3-Regenerate-2K. Le pipeline prend les instructions multimodales brutes à gauche et produit une vidéo 2K avec de l'audio synchronisé à droite.

H3-Context-IR analyse tout ce que l'utilisateur envoie au modèle. Texte, image, vidéo, audio ou toute combinaison. La sortie est une représentation intermédiaire de contexte structurée que les étapes en aval peuvent consommer. H3-Base génère ensuite une vidéo 768p avec de l'audio à partir de cette représentation, et H3-Regenerate-2K prend la sortie 768p, la fusionne à nouveau avec le contexte d'origine et la restitue à 2K. L'étape de régénération est ce qui fait que le 2K semble net plutôt que mis à l'échelle, car le modèle a toujours le contexte d'origine complet pour s'appuyer tout en affinant.

Considérez cela comme une recette en trois étapes : comprendre le brief, rédiger une version basse résolution, puis réécrire en pleine résolution avec le brief toujours en vue. Le même schéma fonctionne dans la production cinématographique et le design. H3 le rend simplement en un seul appel d'API.

Diagramme d'aperçu du système en trois étapes de MiniMax H3 : La compréhension du contexte alimente H3-Context-IR et une représentation de contexte structurée, la génération de base exécute H3-Base pour produire une vidéo 768p, et la régénération haute résolution exécute H3-Regenerate-2K pour produire une vidéo 2K avec une guidance de contexte des étapes précédentes
Figure 1 : Aperçu du système H3 - la compréhension du contexte alimente la génération de base, qui alimente la régénération 2K, avec une guidance de contexte tout au long du processus.

À l'intérieur de H3-Base : 33B dense, un flux, dé-bruitage conjoint vidéo-audio

H3-Base est le cœur du système. C'est un transformateur dense de 33 milliards de paramètres qui dé-bruite les latents vidéo et audio en un seul flux, utilisant un backbone DiT partagé avec 50 couches.

Trois encodeurs le nourrissent. L'encodeur H3 est construit sur Qwen3-VL-32B à la couche 50 et produit des jetons de texte. L'encodeur VAE visuel fonctionne à 16x16x24 avec une causalité temporelle et un découpage en patchs de 2x2x1, produisant des latents de référence visuels. L'encodeur VAE audio fonctionne à d=32, stéréo, 32 kHz, jetons de 40 Hz. Les quatre flux de jetons sont regroupés en une seule séquence en contexte, avec les latents vidéo et audio bruités ajoutés du côté de la génération. C'est cette seule séquence que le transformateur dé-bruite.

Le choix d'architecture qui compte est les composants spécifiques à la modalité sur un backbone partagé. Le DiT de base est partagé entre la vidéo et l'audio, ce qui explique pourquoi le modèle peut garder les deux synchronisés sans module d'alignement supplémentaire. Les deux décodeurs sont toujours séparés : un décodeur VAE visuel qui mappe les latents vidéo vers des trames RGB, et un décodeur VAE audio qui mappe les latents audio vers une forme d'onde stéréo. La sortie est une paire vidéo-plus-stéréo-audio synchronisée, générée en une seule passe.

Diagramme détaillé de l'architecture H3-Base montrant l'encodage des conditions (Encodeur H3 de Qwen3-VL-32B, Encodeur VAE visuel à 16x16x24, Encodeur VAE audio à 32 kHz stéréo), séquence en contexte regroupée, génération unifiée avec le transformateur Omni H3 de 33B et le backbone DiT partagé x 50, et décodage avec le décodeur VAE visuel et le décodeur VAE audio produisant une vidéo synchronisée plus audio stéréo
Figure 2 : Intérieur de H3-Base - encodage des conditions, séquence en contexte regroupée, dé-bruitage unifié, et décodage synchronisé.

Trois modes d'utilisation : T2VA, FL2VA, Ref2VA

H3 propose deux points de contrôle open source, chacun étant optimisé pour un mode d'utilisation différent. Les deux produisent une vidéo 768p avec audio en précision BF16. La différence réside dans ce qu'ils acceptent comme entrée.

H3-Base-FL2VA est le mode premier/dernier cadre. Il accepte du texte plus zéro, un ou deux images de référence. Zéro image signifie texte-à-audio-vidéo (T2VA). Une image peut être un premier cadre (I2VA à partir d'un cadre de tête) ou un cadre de queue. Deux images signifie interpolation premier-dernier cadre. Utilisez FL2VA lorsque l'utilisateur a une idée claire du début et de la fin et veut que le modèle remplisse le mouvement entre les deux.

H3-Base-Ref2VA est le mode basé sur la référence. Il accepte du texte plus jusqu'à 9 images de référence, jusqu'à 3 clips vidéo de référence (chacun de 2 à 15 secondes, le total ne dépassant pas 15 secondes), et jusqu'à 3 clips audio de référence (chacun de 2 à 15 secondes, le total ne dépassant pas 15 secondes). L'audio doit être associé à une image ou à une vidéo - il ne peut pas être seul. Le total de tous les types d'entrée est limité à 12 fichiers. Ref2VA est le mode pour la cohérence des personnages, le clonage de voix, le transfert de scène et les montages complexes où vous souhaitez réutiliser des morceaux de séquences existantes.

Tableau des points de contrôle H3 montrant H3-Base FL2VA prenant en charge T2VA et I2VA premier/dernier cadre avec cadres premier/dernier facultatifs, et H3-Base Ref2VA prenant en charge la référence-à-audio-vidéo avec texte plus images, vidéos et audio de référence, les deux produisant vidéo et audio en précision BF16
Figure 3 : Deux points de contrôle open source, deux modes d'utilisation. FL2VA est pour les workflows premier/dernier cadre ; Ref2VA est pour les workflows basés sur la référence.

Le workflow complet 2K : Base locale plus régénération cloud

La sortie 768p de H3-Base est le chemin local, entièrement open source. Le chemin 2K combine le H3-Base local avec deux API cloud : H3-Context-IR et H3-Regenerate-2K. Les deux sont hébergés par MiniMax.

Les trois étapes s'alignent avec le diagramme du pipeline. Premièrement, H3-Context-IR prend l'entrée utilisateur et produit le prompt étendu que H3-Base et H3-Regenerate-2K consommeront. Deuxièmement, le H3-Base déployé localement restitue une vidéo 768p avec audio à partir de ce prompt étendu. Troisièmement, H3-Regenerate-2K prend le résultat 768p comme base_video, le recombine avec le prompt étendu et le contexte utilisateur d'origine, et restitue à 2K. L'étape de régénération est ce qui porte le contexte sémantique d'origine dans le passage haute résolution, ce qui explique pourquoi la sortie 2K semble être un affinement plutôt qu'un upscale.

Trois cas 2K sont livrés dans la carte officielle du modèle : T2VA (texte uniquement, chaîne complète), I2VA (texte plus un premier cadre, chaîne complète), et Ref2VA (texte plus clips de référence, chaîne complète). Pour chaque cas, la carte du modèle fournit à la fois une exécution locale uniquement 768p et une exécution 2K via l'API, afin que le développeur puisse vérifier que le chemin local correspond au chemin cloud sur une sortie de référence connue.

Pour la production : dans l'exemple de code, la sortie H3-Base locale est encodée en base64 en tant qu'URL de données et transmise à H3-Regenerate-2K. Dans un déploiement réel, vous téléchargez la vidéo 768p vers n'importe quelle URL publique et transmettez l'URL comme base_video à la place. C'est le seul changement de plomberie significatif entre l'exemple et la production.

Fiche technique

Durée de sortie : 4 à 15 secondes. Formats d'image : 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Résolution : 768p par défaut ; 2K via H3-Regenerate-2K. Fréquence d'images : 24 FPS. Audio : 32 kHz stéréo, natif au modèle.

Le support linguistique stable couvre 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. D'autres langues bénéficient d'un support partiel. Licence : Licence communautaire MiniMax H3 (open source, mais pas permissive au sens d'Apache - lisez la carte du modèle avant de lancer un produit commercial par-dessus).

Où obtenir les poids : Hugging Face à huggingface.co/MiniMaxAI/MiniMax-H3 et ModelScope à modelscope.cn/models/MiniMax/MiniMax-H3. Les paramètres de requête complets, le prompt H3-Context-IR et le code de régénération se trouvent dans la carte du modèle Hugging Face.

Sur videobao : Qu'est-ce qui est en direct, qu'est-ce qui est ensuite

H3 est en direct sur videobao aujourd'hui. Les modes d'utilisation intégrés couvrent toute la surface H3-Base : texte vers vidéo ; image de première image, dernière image ou première+dernière image vers vidéo ; et mode guidé par référence avec jusqu'à 5 images de référence plus clips vidéo et audio de référence optionnels. Choisissez le mode qui correspond au brief, ajoutez des images ou références, générez un clip 2K et expédiez-le. Le prix est de 7 crédits par seconde pour le 2K natif, avec une durée de 4 à 15 secondes. H3 est en niveau premium sur videobao car la génération 2K est significativement plus chère que le 1080p.

Les trois modes sont livrés derrière le même flux de génération. Le mode guidé par référence est ce qui débloque la cohérence des personnages entre les prises, le clonage de voix pour les publicités de produits et le montage multi-source complexe, et il est déjà en direct sur videobao aux côtés des chemins première/dernière image, donc le même modèle prompt-plus-références fonctionne que vous utilisiez H3 aujourd'hui ou l'un de ces modes demain.

Déploiement local, ressources et quoi lire ensuite

Pour un déploiement local, vous avez besoin d'une boîte multi-GPU. Le transformateur dense de 33B est petit selon les normes de la frontière 2026, mais il veut encore une VRAM sérieuse. La carte du modèle décrit la configuration d'inférence exacte, le paramétrage du service de style vLLM et les hypothèses de précision BF16. Lisez la carte du modèle de bout en bout avant de vous engager sur une cible de déploiement.

Ressources : la carte du modèle Hugging Face est la source de vérité (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope reflète les poids pour les utilisateurs en Chine (modelscope.cn/models/MiniMax/MiniMax-H3). Les documents de la plateforme MiniMax couvrent les API cloud pour H3-2K Direct, H3-Context-IR et H3-Regenerate-2K sur platform.minimaxi.com/docs/api-reference. Pour le laboratoire sous-jacent, hailuoai.com est le point d'entrée grand public.

Si vous n'avez besoin de H3 que pour le travail de production et que vous ne souhaitez pas l'héberger, le panneau d'intégration videobao est le chemin le plus rapide. Si vous souhaitez le plein contrôle d'un déploiement local, la carte du modèle plus les documents de la plateforme vous permettront d'obtenir un pipeline 2K en un jour.

Written by

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Related Posts

← Retour à tous les articles
Guide du développeur MiniMax H3 : Architecture, 3 modes d'utilisation et workflow 2K - videobao