videobao ist live mit DouBao SeeDance 2.5 und MiniMax-H3 — 10 Credits bei Registrierung

Jetzt abonnieren
Entwicklerhandbuch

MiniMax H3 Entwicklerhandbuch: Architektur, 3 Nutzungsmodi und 2K-Workflow

Ein technischer Überblick über MiniMax H3: die dreistufige Pipeline, der 33B dichte H3-Base Omni Transformer, T2VA vs. FL2VA vs. Ref2VA und der vollständige 2K-Regenerationsworkflow mit lokalen und Cloud-Komponenten.

By videobao Team8 min Lesezeit
MiniMax H3 Systemübersicht mit Darstellung der dreistufigen Pipeline vom Kontextverständnis über die Basisgenerierung bis zur hochauflösenden 2K-Regeneration

MiniMax H3 ist ein universelles, vollmodales Videogenerierungssystem. Es verarbeitet Text, Bild, Video und Audio als einen einzigen Kontext, versteht die Beziehungen zwischen ihnen und erzeugt ein 2K, 15-sekündiges Video mit nativen Stereo-Audio. Die Architektur ist der Teil, den die meisten Benutzer nie sehen, aber der jede Entscheidung erklärt, die MiniMax in den letzten zwölf Monaten getroffen hat. Dieser Leitfaden führt durch die dreistufige Pipeline, den 33B dichten H3-Base Omni Transformer, die drei Nutzungsmodi (T2VA, FL2VA, Ref2VA) und den vollständigen 2K-Workflow, der lokale Generierung mit Cloud-Regeneration kombiniert.

Wenn Sie kein Machine-Learning-Praktiker sind, können Sie nach dem Abschnitt über die Nutzungsmodi aufhören und den Rest mit videobao erledigen. Wenn Sie H3 selbst integrieren, ist der Rest des Artikels für Sie.

Die dreistufige Pipeline auf einen Blick

H3 ist nicht ein einzelnes Modell. Es besteht aus drei miteinander verbundenen Modulen: H3-Context-IR, H3-Base und H3-Regenerate-2K. Die Pipeline nimmt rohe multimodale Anweisungen auf der linken Seite auf und erzeugt auf der rechten Seite ein 2K-Video mit synchronisiertem Audio.

H3-Context-IR analysiert alles, was der Benutzer dem Modell vorgibt. Text, Bild, Video, Audio oder jede beliebige Kombination. Die Ausgabe ist eine strukturierte Kontext-Zwischenrepräsentation, die von den nachgelagerten Stufen verarbeitet werden kann. H3-Base generiert dann ein 768p-Video mit Audio aus dieser Repräsentation, und H3-Regenerate-2K nimmt die 768p-Ausgabe, fusioniert sie wieder mit dem ursprünglichen Kontext und rendert sie erneut bei 2K. Der Regenerationsschritt ist es, der 2K scharf und nicht nur hochskaliert erscheinen lässt, weil das Modell immer noch den vollständigen ursprünglichen Kontext hat, auf den es zurückgreifen kann, während es verfeinert.

Stellen Sie es sich als ein dreistufiges Rezept vor: Verstehen Sie die Vorgabe, entwerfen Sie eine niedrigauflösende Version, und dann überarbeiten Sie sie in voller Auflösung, während die Vorgabe noch in Sicht ist. Dasselbe Muster funktioniert in der Filmproduktion und im Design. H3 macht es nur zu einem einzigen API-Aufruf.

MiniMax H3 dreistufiges Systemübersicht: Kontextverständnis speist H3-Context-IR und eine strukturierte Kontextrepräsentation, Basisgenerierung führt H3-Base aus, um 768p-Video zu erzeugen, und Hochauflösende Regeneration führt H3-Regenerate-2K aus, um 2K-Video mit Kontextführung aus früheren Stufen zu erzeugen
Abbildung 1: H3-Systemübersicht - Kontextverständnis speist die Basisgenerierung, die 2K-Regeneration speist, wobei die Kontextführung durchgehend erhalten bleibt.

Inside H3-Base: 33B Dense, One Stream, Joint Video-Audio Denoising

H3-Base ist das Herzstück des Systems. Es ist ein 33-Milliarden-Parameter-dichter Transformer, der Video- und Audio-Latenzen in einem einzigen Strom denoisiert, wobei ein gemeinsamer DiT-Backbone mit 50 Schichten verwendet wird.

Drei Encoder speisen es. Der H3-Encoder basiert auf Qwen3-VL-32B auf Schicht 50 und erzeugt Text-Token. Der visuelle VAE-Encoder läuft bei 16x16x24 mit zeitlicher Kausalität und einem 2x2x1 Patchify, wobei visuelle Referenzlatenzen erzeugt werden. Der Audio-VAE-Encoder läuft bei d=32, Stereo, 32 kHz, 40 Hz Token. Die vier Token-Ströme werden zu einer einzigen In-Context-Sequenz zusammengepackt, wobei verrauschte Video- und Audio-Latenzen auf der Generierungsseite angehängt werden. Diese eine Sequenz ist es, die der Transformer denoisiert.

Die architektonische Entscheidung, die wichtig ist, sind die modalspezifischen Komponenten auf einem gemeinsamen Backbone. Der Basis-DiT ist über Video und Audio hinweg gemeinsam, was der Grund ist, warum das Modell die beiden ohne ein zusätzliches Ausrichtungsmodul synchron halten kann. Die beiden Decoder sind immer noch getrennt: ein visueller VAE-Decoder, der Video-Latenzen zurück zu RGB-Frames abbildet, und ein Audio-VAE-Decoder, der Audio-Latenzen zu Stereo-Wellenformen abbildet. Die Ausgabe ist ein synchronisiertes Video-plus-Stereo-Audio-Paar, das in einem Durchgang generiert wird.

Detailliertes H3-Base-Architekturdiagramm mit Bedingungsencoding (H3-Encoder von Qwen3-VL-32B, Visueller VAE-Encoder bei 16x16x24, Audio-VAE-Encoder bei 32 kHz Stereo), gepackte In-Context-Sequenz, einheitliche Generierung mit dem 33B H3 Omni Transformer und gemeinsamem DiT-Backbone x 50, und Decoding mit Visuellem VAE-Decoder und Audio-VAE-Decoder, die synchronisiertes Video plus Stereo-Audio erzeugen
Abbildung 2: H3-Base-Interna - Bedingungsencoding, gepackte In-Context-Sequenz, einheitliche Denoisierung und synchronisiertes Decoding.

Drei Nutzungsmodi: T2VA, FL2VA, Ref2VA

H3 liefert zwei Open-Source-Checkpoints, die jeweils für einen anderen Nutzungsmodus optimiert sind. Beide erzeugen 768p-Video mit Audio in BF16-Präzision. Der Unterschied liegt darin, was sie als Eingabe akzeptieren.

H3-Base-FL2VA ist der erste/letzte Frame-Modus. Er akzeptiert Text plus null, ein oder zwei Referenzbilder. Null Bilder bedeutet Text-zu-Audio-Video (T2VA). Ein Bild kann ein erster Frame (I2VA von einem Kopf-Frame) oder ein letzter Frame sein. Zwei Bilder bedeutet Interpolation zwischen erstem und letztem Frame. Verwenden Sie FL2VA, wenn der Benutzer einen klaren Anfang und Ende im Sinn hat und möchte, dass das Modell die dazwischenliegende Bewegung ausfüllt.

H3-Base-Ref2VA ist der referenzgesteuerte Modus. Er akzeptiert Text plus bis zu 9 Referenzbilder, bis zu 3 Referenzvideo-Clips (jeweils 2-15 Sekunden, insgesamt nicht mehr als 15 Sekunden) und bis zu 3 Referenzaudio-Clips (jeweils 2-15 Sekunden, insgesamt nicht mehr als 15 Sekunden). Audio muss mit einem Bild oder Video gepaart sein - es kann nicht alleine stehen. Der Gesamtumfang über alle Eingabetypen ist auf 12 Dateien begrenzt. Ref2VA ist der Modus für Charakter-Konsistenz, Voice-Cloning, Szenen-Transfer und komplexe Bearbeitungen, bei denen Sie Teile bestehender Aufnahmen wiederverwenden möchten.

H3-Checkpoint-Tabelle mit H3-Base FL2VA, der T2VA und ersten/letzten Frame I2VA mit optionalen ersten/letzten Frames unterstützt, und H3-Base Ref2VA, der referenz-zu-Audio-Video mit Text plus Referenzbilder, Videos und Audio unterstützt, beide erzeugen Video und Audio in BF16-Präzision
Abbildung 3: Zwei Open-Source-Checkpoints, zwei Nutzungsmodi. FL2VA ist für erste/letzte Frame-Workflows; Ref2VA ist für referenzgesteuerte Workflows.

Der vollständige 2K-Workflow: Lokale Basis plus Cloud-Regeneration

Die 768p-Ausgabe von H3-Base ist der lokale, vollständig Open-Source-Pfad. Der 2K-Pfad kombiniert lokales H3-Base mit zwei Cloud-APIs: H3-Context-IR und H3-Regenerate-2K. Beide werden von MiniMax gehostet.

Die drei Stufen entsprechen dem Pipeline-Diagramm. Zuerst nimmt H3-Context-IR die Benutzereingabe auf und erzeugt die erweiterte Eingabeaufforderung, die H3-Base und H3-Regenerate-2K verarbeiten werden. Zweitens rendert das lokal bereitgestellte H3-Base ein 768p-Video mit Audio aus dieser erweiterten Eingabeaufforderung. Drittens nimmt H3-Regenerate-2K das 768p-Ergebnis als base_video, kombiniert es wieder mit der erweiterten Eingabeaufforderung und dem ursprünglichen Benutzerkontext und rendert es erneut bei 2K. Der Regenerationsschritt ist es, der die ursprüngliche semantische Kontextinformation in den hochauflösenden Durchgang überträgt, weshalb die 2K-Ausgabe eher wie eine Verfeinerung als eine Hochskalierung erscheint.

Drei 2K-Fälle sind im offiziellen Modellblatt enthalten: T2VA (nur Text, vollständige Kette), I2VA (Text plus ein erster Frame, vollständige Kette) und Ref2VA (Text plus Referenzclips, vollständige Kette). Für jeden Fall bietet das Modellblatt sowohl einen nur lokalen 768p-Lauf als auch einen 2K-Lauf über die API, so dass der Entwickler verifizieren kann, dass der lokale Pfad mit dem Cloud-Pfad auf einer bekannten Referenzausgabe übereinstimmt.

Für die Produktion: In dem Beispielcode wird die lokale H3-Base-Ausgabe als Data URL base64-kodiert und an H3-Regenerate-2K übergeben. In einer realen Bereitstellung laden Sie das 768p-Video auf eine beliebige öffentliche URL hoch und übergeben die URL als base_video stattdessen. Das ist die einzige wesentliche Änderung in der Installation zwischen dem Beispiel und der Produktion.

Spezifikations-Checkliste

Ausgabedauer: 4 bis 15 Sekunden. Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Auflösung: Standardmäßig 768p; 2K über H3-Regenerate-2K. Bildrate: 24 FPS. Audio: 32 kHz Stereo, nativ zum Modell.

Stabile Sprachunterstützung umfasst 11 Sprachen: Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch. Andere Sprachen erhalten teilweise Unterstützung. Lizenz: MiniMax H3 Community License (Open-Source, aber nicht im Apache-Sinne permissiv - lesen Sie das Modellblatt, bevor Sie ein kommerzielles Produkt darauf aufbauen).

Wo man die Gewichte bekommt: Hugging Face unter huggingface.co/MiniMaxAI/MiniMax-H3 und ModelScope unter modelscope.cn/models/MiniMax/MiniMax-H3. Die vollständigen Anforderungsparameter, die H3-Context-IR-Eingabeaufforderung und der Regenerationscode sind im Hugging Face-Modellblatt enthalten.

Auf videobao: Was ist live, was kommt als nächstes

H3 ist heute auf videobao live. Die integrierten Nutzungsmodi decken die gesamte H3-Base-Oberfläche ab: Text-zu-Video; Erst-Frame-, Letzt-Frame- oder Erst+Letzt-Frame-Bild-zu-Video; und referenzgesteuerter Modus mit bis zu 5 Referenzbildern und optionalen Referenzvideo- und Audio-Clips. Wählen Sie den Modus, der zum Briefing passt, fügen Sie Frames oder Referenzen ein, generieren Sie einen 2K-Clip und versenden Sie ihn. Die Preisgestaltung beträgt 7 Credits pro Sekunde für natives 2K, mit einer Dauer von 4 bis 15 Sekunden. H3 ist Premium-Tier auf videobao, weil 2K-Generierung deutlich teurer ist als 1080p.

Alle drei Modi werden über denselben Generierungs-Flow ausgeliefert. Der referenzgesteuerte Modus ist es, der Charakter-Konsistenz über Aufnahmen hinweg, Voice-Cloning für Produktwerbung und komplexe Multi-Source-Bearbeitung freischaltet – und er ist bereits zusammen mit den Erst-/Letzt-Frame-Pfaden auf videobao live, sodass dasselbe Eingabeaufforderungs-plus-Referenzen-Muster funktioniert, ob Sie heute H3 oder morgen einen dieser Modi verwenden.

Lokale Bereitstellung, Ressourcen und was als nächstes zu lesen ist

Für die lokale Bereitstellung benötigen Sie ein Multi-GPU-Box. Der 33B dichte Transformer ist nach 2026 Frontier-Standards klein, aber er will immer noch ernsthafte VRAM. Das Modellblatt führt die genaue Inferenzkonfiguration, den vLLM-stilisierten Serveraufbau und die BF16-Präzisionsannahmen durch. Lesen Sie das Modellblatt von Anfang bis Ende, bevor Sie sich auf ein Bereitstellungsziel festlegen.

Ressourcen: Das Hugging Face-Modellblatt ist die Quelle der Wahrheit (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope spiegelt die Gewichte für Benutzer in China (modelscope.cn/models/MiniMax/MiniMax-H3). Die MiniMax-Plattformdokumente decken die Cloud-APIs für H3-2K Direct, H3-Context-IR und H3-Regenerate-2K auf platform.minimaxi.com/docs/api-reference ab. Für das zugrunde liegende Labor ist hailuoai.com der kundenorientierte Einstiegspunkt.

Wenn Sie H3 nur für Produktionsarbeiten benötigen und es nicht hosten möchten, ist die videobao-Integrationskonsole der schnellste Weg. Wenn Sie die volle Kontrolle über eine lokale Bereitstellung haben möchten, wird Ihnen das Modellblatt plus die Plattformdokumente zu einer 2K-Pipeline in einem Tag verhelfen.

Written by

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Related Posts

← Zurück zu allen Beiträgen
MiniMax H3 Entwicklerhandbuch: Architektur, 3 Nutzungsmodi und 2K-Workflow - videobao