MiniMax H3 Passe en Open Source à 33 Milliards : Les Modèles Vidéo Franchissent la Ligne de Production
MiniMax a rendu open source son modèle vidéo H3 de 33 milliards de paramètres le dernier jour de juillet, atteignant l'état de l'art (SOTA). Nous expliquons ce qu'il fait réellement, pourquoi 33 milliards est le titre principal, et ce que les utilisateurs de videobao peuvent en faire aujourd'hui.
Le dernier jour de juillet, MiniMax a dévoilé H3, un modèle vidéo de 33 milliards de paramètres qui atteint l'état de l'art sur les principaux benchmarks vidéo. Le même jour, les poids ont été rendus open source. L'histoire n'est pas seulement qu'un autre laboratoire a rattrapé le Seedance de ByteDance. L'histoire est que la génération vidéo a franchi la ligne du 'démonstration cool' au 'outil de production', et MiniMax a choisi de livrer le moment en open source.
Sur videobao, cela change ce que vous pouvez faire en une seule session. Lisez la suite pour l'analyse de H3, l'argument 'pourquoi 33 milliards est le titre principal', et comment utiliser cette génération de modèles dans votre prochain projet.
Ce que MiniMax H3 fait réellement
H3 est construit autour de deux idées : l'entrée multimodale native et l'édition intermodale précise. Le texte, l'image, l'audio et la vidéo peuvent tous être utilisés comme références dans la même invite. Cela signifie que vous pouvez donner au modèle un court clip, pointer vers un personnage avec une instruction textuelle, et remplacer uniquement ce personnage tout en gardant le reste de l'environnement intact.
Les premières démonstrations de MiniMax se concentrent sur les scènes où les équipes de production ont réellement besoin de cela : les visites guidées de conception d'interface utilisateur, les publicités de marque, les coupes de style MV, les cinématiques de jeu, les effets AR et de transition, et les essayages de commerce électronique. L'argument n'est pas 'l'IA peut faire une vidéo' mais 'l'IA peut faire la vidéo spécifique dont vous avez besoin, avec l'élément spécifique changé'.
H3 génère également du 2K de manière native, avec un tout nouveau tokenizer construit sur l'architecture Hailuo-02. La compression est plus efficace, le coût d'entraînement et d'inférence est plus faible, et le modèle est suffisamment petit (33B) pour que les équipes de production sérieuses puissent réellement l'héberger.
Pourquoi 33 milliards est une histoire plus grande que l'état de l'art
L'état de l'art est le titre principal. 33 milliards est la véritable nouvelle. La plupart des modèles vidéo à l'état de l'art en 2025 avaient 70 milliards de paramètres ou plus, ce qui signifiait des factures de calcul sérieuses, une itération lente et des API fermées. Un modèle de 33 milliards à l'état de l'art signifie trois choses.
Premièrement, l'entraînement est plus accessible. Les équipes qui ne pouvaient pas se permettre d'entraîner un modèle vidéo de pointe l'année dernière peuvent maintenant l'affiner ou le distiller. Deuxièmement, l'inférence est moins chère. Le coût du crédit par génération sur videobao est façonné par le coût en amont, et les modèles plus petits poussent ce nombre vers le bas. Troisièmement, le déploiement est réaliste. Vous pouvez exécuter un modèle vidéo de 33 milliards sur du matériel de production sérieux sans construire un centre de données personnalisé.
En d'autres termes, l'état de l'art à 33 milliards est ce qui transforme un résultat de recherche en un produit. La même chose s'est produite avec les modèles de langage lorsque des modèles open source efficaces ont atteint la barre de qualité GPT-3 pour une fraction de la taille. La vidéo est en train de subir la même transition, juste douze mois derrière.
Du tour de passe-passe de démonstration à l'outil de production
Il y a un an, la vidéo AI était jugée sur la cohérence d'un lapin. Tout le domaine optimisait la cohérence au niveau de l'invite, et même cela était difficile. La barre de 2026 est différente. Des modèles comme Veo 3.1, Kling 2.5, Sora 2 et maintenant H3 ne se contentent pas de générer. Ils remplacent précisément un personnage sans tacher l'arrière-plan. Ils n'incluent pas seulement l'audio. Veo 3.1 propose de l'audio natif à 48 kHz, et la plupart des modèles grand public produisent désormais des vidéos synchronisées sur les lèvres en une seule passe.
Les cas d'utilisation ont évolué avec les capacités. L'année dernière, c'était 'regardez cet effet cool'. Cette année, c'est TVC, publicités de marque et démonstrations de produits. Le passage de 'montrer le modèle' à 'utiliser le modèle pour lancer une campagne' est la ligne que l'industrie vient de franchir.
Si vous avez essayé la vidéo AI en 2025 et que vous avez rebondi, les modèles de 2026 sont un produit différent. Sur videobao, vous pouvez désormais utiliser Hailuo 02, Veo 3.1, Kling 2.5 et Sora 2 dans la même session et choisir celui qui correspond au brief.
Pourquoi l'agrégation gagne lorsque les modèles deviennent open source
MiniMax a choisi de rendre H3 open source même s'ils ont des performances de pointe et un avantage en termes de coût. Cela semble contre-intuitif, mais le jeu open source devient la norme pour les laboratoires vidéo sérieux. La raison est simple : les modèles vidéo vont être partout, et être le fournisseur fermé d'une version légèrement meilleure est moins précieux que d'être la plateforme qui permet aux utilisateurs de comparer tous les modèles.
Regardez LTX-2.3. C'est un modèle vidéo open source à l'étranger qui a dépassé les 18 millions de téléchargements sur Hugging Face. Dix-huit millions. L'écosystème vidéo open source est réel, il est actif, et c'est là que se déroule la plupart des nouveaux travaux de produit. Des plateformes d'agrégation comme videobao se placent au-dessus de cela : nous emballons des modèles open source, fermés, chinois et occidentaux derrière une seule connexion et un seul solde de crédit, afin que vous n'ayez pas à choisir.
C'est la réponse pratique à la question 'open source ou fermé' pour les utilisateurs finaux. Vous ne choisissez pas. Vous utilisez la plateforme, et la plateforme choisit le bon modèle pour le travail. Parfois, c'est MiniMax H3, désormais disponible sur videobao. Parfois, c'est Veo 3.1 pour les prises de vue cinématographiques. Parfois, c'est Kling 2.5 pour les clips sociaux bon marché avec audio natif. L'important est que la plateforme puisse tout faire.
Comment utiliser H3 sur videobao aujourd'hui
H3 est désormais disponible sur videobao. Choisissez-le lorsque vous souhaitez une édition intermodale précise sur une toile native 2K. Le modèle : téléchargez une image de référence ou un court clip, écrivez une invite qui nomme l'élément que vous souhaitez modifier, et H3 garde le reste de la scène stable au pixel près. Hailuo 02, Kling 2.5 et Veo 3.1 sont tous dans la même session si vous souhaitez le même flux de travail dans une catégorie de prix ou une résolution différente.
Sur videobao, H3 fonctionne à 7 crédits par seconde pour le 2K natif avec une durée de 4 à 15 secondes. Les modes d'utilisation intégrés sont : texte vers vidéo, image de première image, dernière image ou première+dernière image vers vidéo, et mode guidé par référence avec jusqu'à 5 images de référence plus clips vidéo et audio de référence optionnels. L'édition précise intermodale est le cas d'utilisation principal. Hailuo 02 est le plan de secours moins cher pour le même flux de travail ; Veo 3.1 est le bon choix si vous avez besoin de 4K ; Kling 2.5 est le bon choix si vous souhaitez une piste audio intégrée avec un budget serré ; Sora 2 est le bon choix pour le storytelling multi-scènes long. H3 est uniquement de niveau premium sur videobao, car la génération 2K est nettement plus chère que le 1080p.
La vague open source de 33 milliards va continuer à faire baisser le prix plancher du reste de la gamme au cours des deux prochains trimestres. Le bon mouvement est de verrouiller le flux de travail d'édition intermodale maintenant, alors que H3 est le SOTA le plus frais et que les autres modèles continuent de se comprimer sous lui.