videobao ist live mit DouBao SeeDance 2.5 und MiniMax-H3 — 10 Credits bei Registrierung

Jetzt abonnieren
Branche

MiniMax H3 wird mit 33 Milliarden Parametern Open Source: Video-Modelle überschreiten die Produktionslinie

MiniMax hat am letzten Julitag sein 33B H3-Video-Modell als Open Source veröffentlicht und damit den SOTA erreicht. Wir analysieren, was es tatsächlich leistet, warum 33B die Schlagzeile ist und was videobao-Nutzer heute damit machen können.

By videobao Team6 min Lesezeit
MiniMax H3 Open Source 33B Video-Modell erreicht SOTA - illustriert mit einem violetten bis orangefarbenen Gradienten-Cover

Am letzten Julitag veröffentlichte MiniMax H3, ein 33-Milliarden-Parameter-Video-Modell, das auf den wichtigsten Video-Benchmarks den SOTA erreicht. Am selben Tag wurden die Gewichte als Open Source veröffentlicht. Die Geschichte geht nicht nur darum, dass ein weiteres Labor mit ByteDances Seedance gleichgezogen hat. Die Geschichte ist, dass die Videogenerierung die Grenze vom 'coolen Demo' zum 'Produktionswerkzeug' überschritten hat und MiniMax sich entschied, diesen Moment zu veröffentlichen.

Auf videobao ändert das, was Sie in einer einzigen Sitzung tun können. Lesen Sie weiter für die H3-Analyse, das 'Warum 33B die Schlagzeile ist'-Argument und wie Sie diese Generation von Modellen in Ihrem nächsten Projekt verwenden können.

Was MiniMax H3 tatsächlich leistet

H3 basiert auf zwei Ideen: nativer multimodaler Eingabe und präzisem cross-modalem Bearbeiten. Text, Bild, Audio und Video können alle als Referenzen im selben Prompt verwendet werden. Das bedeutet, Sie können dem Modell ein kurzes Video übergeben, mit einer Textanweisung auf ein Charakter zeigen und nur dieses Charakter ersetzen, während alles um es herum intakt bleibt.

Die frühen Demos von MiniMax konzentrieren sich auf die Szenen, in denen Produktionsteams dies tatsächlich benötigen: UI-Design-Durchläufe, Markenwerbung, MV-Stil-Schnitte, Spiel-Cinematics, AR- und Übergangseffekte sowie E-Commerce-Anprobe. Der Pitch ist nicht 'KI kann ein Video machen', sondern 'KI kann das spezifische Video, das Sie benötigen, mit dem spezifischen geänderten Element machen.'

H3 generiert auch nativ 2K, mit einem brandneuen Tokenizer, der auf der Hailuo-02-Architektur basiert. Die Kompression ist effizienter, die Kosten für Training und Inferenz sind niedriger, und das Modell ist klein genug (33B), dass ernsthafte Produktionsteams es tatsächlich hosten können.

Warum 33B die größere Geschichte als SOTA ist

SOTA ist die Schlagzeile. 33B ist die eigentliche Nachricht. Die meisten SOTA-Video-Modelle im Jahr 2025 hatten 70B+ Parameter, was bedeutete, dass sie ernsthafte Rechenrechnungen, langsame Iterationen und geschlossene APIs mit sich brachten. Ein 33B-Modell auf SOTA-Niveau bedeutet drei Dinge.

Erstens ist das Training zugänglicher. Teams, die sich letztes Jahr kein Training für ein Frontier-Video-Modell leisten konnten, können jetzt eines feinabstimmen oder destillieren. Zweitens ist die Inferenz günstiger. Die Kreditkosten pro Generierung auf videobao werden durch die Upstream-Kosten bestimmt, und kleinere Modelle drücken diese Zahl nach unten. Drittens ist die Bereitstellung realistisch. Sie können ein 33B-Video-Modell auf ernsthafter Produktionshardware ohne den Bau eines benutzerdefinierten Rechenzentrums ausführen.

Mit anderen Worten, SOTA bei 33B ist das, was ein Forschungsergebnis in ein Produkt verwandelt. Dasselbe geschah mit Sprachmodellen, als effiziente Open-Source-Treffer die GPT-3-Qualitätsstufe bei einem Bruchteil der Größe erreichten. Video macht gerade den gleichen Übergang, nur zwölf Monate später.

Von der Demo-Trick zum Produktionswerkzeug

Vor einem Jahr wurde KI-Video danach beurteilt, ob ein Hase kohärent war. Das gesamte Feld optimierte auf Prompt-Level-Konsistenz, und selbst das war schwierig. Der 2026er Maßstab ist anders. Modelle wie Veo 3.1, Kling 2.5, Sora 2 und jetzt H3 generieren nicht nur. Sie ersetzen ein Charakter präzise, ohne den Hintergrund zu verwischen. Sie schließen nicht nur Audio ein. Veo 3.1 liefert 48 kHz nativen Audio, und die meisten Mainstream-Modelle geben jetzt in einem einzigen Durchgang lip-synced Video aus.

Die Anwendungsfälle bewegten sich mit der Fähigkeit. Letztes Jahr war es 'Schau dir diesen coolen Effekt an'. Dieses Jahr sind es TVC, Markenwerbung und Produktdemonstrationen. Der Übergang vom 'Modell vorführen' zum 'Modell verwenden, um eine Kampagne auszuliefern' ist die Grenze, die die Branche gerade überschritten hat.

Wenn Sie 2025 KI-Video ausprobiert und abgeprallt sind, sind die 2026er Modelle ein anderes Produkt. Auf videobao können Sie jetzt Hailuo 02, Veo 3.1, Kling 2.5 und Sora 2 in derselben Sitzung verwenden und dasjenige auswählen, das zum Briefing passt.

Warum Aggregation gewinnt, wenn Modelle Open Source werden

MiniMax entschied sich, H3 als Open Source zu veröffentlichen, obwohl sie SOTA-Leistung und einen Kostenvorteil haben. Das klingt kontraintuitiv, aber das Open-Source-Spiel wird zum Standard für ernsthafte Video-Labore. Der Grund ist einfach: Video-Modelle werden überall sein, und es ist weniger wertvoll, der geschlossene Anbieter einer etwas besseren Version zu sein, als die Plattform zu sein, die es den Benutzern ermöglicht, alle zu vergleichen.

Schauen Sie sich LTX-2.3 an. Es ist ein im Ausland entwickeltes Open-Source-Video-Modell, das auf Hugging Face 18 Millionen Downloads überschritten hat. Achtzehn Millionen. Das Open-Source-Video-Ökosystem ist real, es ist aktiv, und es ist dort, wo die meisten neuen Produktarbeiten stattfinden. Aggregationsplattformen wie videobao sitzen oben darauf: Wir verpacken Open-Source-, Closed-Source-, chinesische und westliche Modelle hinter einem Login und einem Kreditguthaben, damit Sie nicht wählen müssen.

Das ist die praktische Antwort auf die 'Open Source oder Closed Source'-Frage für Endbenutzer. Sie wählen nicht. Sie verwenden die Plattform, und die Plattform wählt das richtige Modell für den Job. Manchmal ist das MiniMax H3, jetzt live auf videobao. Manchmal ist es Veo 3.1 für cinematische Aufnahmen. Manchmal ist es Kling 2.5 für günstige Social-Clips mit nativem Audio. Der Punkt ist, dass die Plattform all das kann.

Wie Sie heute H3 auf videobao verwenden

H3 ist jetzt auf videobao live. Wählen Sie es, wenn Sie präzises cross-modales Bearbeiten auf einer nativen 2K-Leinwand wünschen. Das Muster: Laden Sie ein Referenzbild oder ein kurzes Video hoch, schreiben Sie einen Prompt, der das Element benennt, das Sie ändern möchten, und H3 hält den Rest der Szene pixelstabil. Hailuo 02, Kling 2.5 und Veo 3.1 sind alle in derselben Sitzung, wenn Sie den gleichen Workflow in einer anderen Preis- oder Auflösungsebene wünschen.

Auf videobao läuft H3 mit 7 Credits pro Sekunde für natives 2K mit einer Dauer von 4-15s. Die integrierten Nutzungsmodi sind Text-zu-Video, Erst-Frame-, Letzt-Frame- oder Erst+Letzt-Frame-Bild-zu-Video sowie referenzgesteuerter Modus mit bis zu 5 Referenzbildern und optionalen Referenzvideo- und Audio-Clips. Präzise cross-modale Bearbeitung ist die Hauptanwendung. Hailuo 02 ist der günstigere Rückgriff für den gleichen Workflow; Veo 3.1 ist die richtige Wahl, wenn Sie 4K benötigen; Kling 2.5 ist die richtige Wahl, wenn Sie eine eingebaute Audiospur bei einem engen Budget wünschen; Sora 2 ist die richtige Wahl für langes mehrschüssiges Storytelling. H3 ist auf videobao nur Premium-Tarif, da 2K-Generierung deutlich teurer als 1080p ist.

Die 33B-Open-Source-Welle wird in den nächsten zwei Quartalen den Preisuntergrund über die restliche Produktlinie hinweg weiter senken. Der richtige Schritt ist, sich jetzt auf den cross-modalen Bearbeitungsworkflow festzulegen, während H3 das frischste SOTA ist und die anderen Modelle darunter weiter komprimiert werden.

Written by

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Related Posts

← Zurück zu allen Beiträgen
MiniMax H3 wird mit 33 Milliarden Parametern Open Source: KI-Video-Modelle sind jetzt Produktionswerkzeuge - videobao