videobao è online con DouBao SeeDance 2.5 e MiniMax-H3 — 10 crediti alla registrazione

Abbonati ora
Guida per Sviluppatori

Guida per Sviluppatori MiniMax H3: Architettura, 3 Modalità d'Uso e Workflow 2K

Una panoramica tecnica di MiniMax H3: la pipeline a tre stadi, il trasformatore denso H3-Base Omni da 33B, T2VA vs FL2VA vs Ref2VA, e il workflow completo di rigenerazione 2K con componenti locali e cloud.

Di Team videobao8 minuti di lettura
Diagramma di panoramica del sistema MiniMax H3 che mostra la pipeline a tre stadi dalla comprensione del contesto alla generazione di base ad alta risoluzione fino alla rigenerazione 2K

MiniMax H3 è un sistema di generazione video universale a piena modalità. Prende testo, immagine, video e audio come un unico contesto, ne comprende le relazioni e produce un video nativo stereo-audio a 2K della durata di 15 secondi. L'architettura è la parte che la maggior parte degli utenti non vede mai, ma che spiega ogni decisione presa da MiniMax negli ultimi dodici mesi. Questa guida illustra la pipeline a tre stadi, il trasformatore denso H3-Base Omni da 33B al suo interno, le tre modalità d'uso (T2VA, FL2VA, Ref2VA) e il workflow completo 2K che combina la generazione locale con la rigenerazione cloud.

Se non sei un esperto di machine learning, puoi fermarti dopo la sezione delle modalità d'uso e utilizzare videobao per il resto. Se stai integrando H3 tu stesso, il resto dell'articolo è per te.

La Pipeline a Tre Stadi in Breve

H3 non è un unico modello. È composta da tre moduli collegati tra loro: H3-Context-IR, H3-Base e H3-Regenerate-2K. La pipeline prende le istruzioni multimodali grezze a sinistra e produce un video 2K con audio sincronizzato a destra.

H3-Context-IR analizza qualsiasi cosa l'utente lanci al modello: testo, immagine, video, audio o qualsiasi combinazione. L'output è una rappresentazione intermedia strutturata del contesto che gli stadi a valle possono consumare. H3-Base genera quindi un video a 768p con audio da quella rappresentazione, e H3-Regenerate-2K prende l'output a 768p, lo fonde nuovamente con il contesto originale e lo rirenderizza a 2K. Il passo di rigenerazione è ciò che fa sembrare il 2K nitido piuttosto che upscalato, perché il modello ha ancora il contesto originale completo a cui attingere mentre perfeziona.

Pensala come una ricetta in tre fasi: comprendi il brief, crea una bozza a bassa risoluzione, quindi ridisegna a piena risoluzione con il brief ancora in vista. Lo stesso schema funziona nella produzione cinematografica e nel design. H3 lo rende semplicemente una singola chiamata API.

Diagramma di panoramica del sistema a tre stadi di MiniMax H3: la comprensione del contesto alimenta H3-Context-IR e una rappresentazione strutturata del contesto, la generazione di base esegue H3-Base per produrre video a 768p, e la rigenerazione ad alta risoluzione esegue H3-Regenerate-2K per produrre video 2K con guida del contesto dagli stadi precedenti
Figura 1: Panoramica del sistema H3 - la comprensione del contesto alimenta la generazione di base, che alimenta la rigenerazione 2K, con la guida del contesto portata fino in fondo.

Dentro H3-Base: 33B Denso, Unico Flusso, Denoising Video-Audio Congiunto

H3-Base è il cuore del sistema. È un trasformatore denso da 33 miliardi di parametri che denoisa i latenti video e audio in un unico flusso, utilizzando un backbone DiT condiviso con 50 livelli.

Tre encoder lo alimentano. L'encoder H3 è costruito su Qwen3-VL-32B al livello 50 e produce token di testo. L'encoder VAE visivo funziona a 16x16x24 con causalità temporale e un patchify 2x2x1, producendo latenti di riferimento visivo. L'encoder VAE audio funziona a d=32, stereo, 32 kHz, 40 Hz token. I quattro flussi di token sono impacchettati in una singola sequenza in contesto, con i latenti video e audio rumorosi aggiunti sul lato della generazione. Quella singola sequenza è ciò che il trasformatore denoisa.

La scelta di architettura che conta è la presenza di componenti specifici per la modalità su un backbone condiviso. Il DiT di base è condiviso tra video e audio, ed è per questo che il modello può mantenere i due sincronizzati senza un modulo di allineamento aggiuntivo. I due decoder sono ancora separati: un decoder VAE visivo che mappa i latenti video indietro ai frame RGB, e un decoder VAE audio che mappa i latenti audio alla forma d'onda stereo. L'output è una coppia video più audio stereo sincronizzati, generati in un unico passaggio.

Diagramma dettagliato dell'architettura H3-Base che mostra la codifica condizionale (H3 Encoder da Qwen3-VL-32B, Visual VAE Encoder a 16x16x24, Audio VAE Encoder a 32 kHz stereo), sequenza in-contesto impacchettata, generazione unificata con il trasformatore Omni H3 da 33B e backbone DiT condiviso x 50, e decodifica con Visual VAE Decoder e Audio VAE Decoder che producono video sincronizzati più audio stereo
Figura 2: Interni di H3-Base - codifica condizionale, sequenza in-contesto impacchettata, denoising unificato e decodifica sincronizzata.

Tre Modalità d'Uso: T2VA, FL2VA, Ref2VA

H3 rilascia due checkpoint open-source, ciascuno ottimizzato per una diversa modalità d'uso. Entrambi producono video a 768p con audio in precisione BF16. La differenza sta in ciò che accettano come input.

H3-Base-FL2VA è la modalità primo/ultimo frame. Accetta testo più zero, uno o due immagini di riferimento. Zero immagini significa testo-audio-video (T2VA). Un'immagine può essere un primo frame (I2VA da un frame iniziale) o un frame finale. Due immagini significa interpolazione primo-ultimo frame. Usa FL2VA quando l'utente ha in mente un chiaro inizio e fine e vuole che il modello riempia il movimento intermedio.

H3-Base-Ref2VA è la modalità guidata dal riferimento. Accetta testo più fino a 9 immagini di riferimento, fino a 3 clip video di riferimento (ciascuna da 2-15 secondi, totale non superiore a 15 secondi) e fino a 3 clip audio di riferimento (ciascuna da 2-15 secondi, totale non superiore a 15 secondi). L'audio deve essere abbinato a un'immagine o video - non può stare da solo. Il totale tra tutti i tipi di input è limitato a 12 file. Ref2VA è la modalità per la coerenza dei personaggi, il cloning vocale, il trasferimento di scene e le modifiche complesse in cui vuoi riutilizzare pezzi di filmati esistenti.

Tabella dei checkpoint H3 che mostra H3-Base FL2VA che supporta T2VA e I2VA primo/ultimo frame con frame primo/ultimo opzionali, e H3-Base Ref2VA che supporta riferimento-a-audio-video con testo più immagini, video e audio di riferimento, entrambi producendo video e audio a precisione BF16
Figura 3: Due checkpoint open-source, due modalità d'uso. FL2VA è per i workflow primo/ultimo frame; Ref2VA è per i workflow guidati dal riferimento.

Il Workflow Completo 2K: Base Locale più Rigenerazione Cloud

L'output a 768p da H3-Base è il percorso locale, completamente open-source. Il percorso 2K combina H3-Base locale con due API cloud: H3-Context-IR e H3-Regenerate-2K. Entrambe sono ospitate da MiniMax.

Le tre fasi si allineano con il diagramma della pipeline. Prima, H3-Context-IR prende l'input dell'utente e produce il prompt esteso che H3-Base e H3-Regenerate-2K consumeranno. Secondo, il H3-Base localmente distribuito rende un video a 768p con audio da quel prompt esteso. Terzo, H3-Regenerate-2K prende il risultato a 768p come base_video, lo ricombina con il prompt esteso e il contesto originale dell'utente, e rirenderizza a 2K. Il passo di rigenerazione è ciò che porta il contesto semantico originale nel passaggio ad alta risoluzione, ed è per questo che l'output 2K sembra un perfezionamento piuttosto che un upscaling.

Tre casi 2K sono presenti nella scheda ufficiale del modello: T2VA (solo testo, catena completa), I2VA (testo più un primo frame, catena completa) e Ref2VA (testo più clip di riferimento, catena completa). Per ogni caso la scheda del modello fornisce sia una corsa solo locale a 768p che una corsa 2K tramite API, in modo che lo sviluppatore possa verificare che il percorso locale corrisponda al percorso cloud su un output di riferimento noto.

Per la produzione: nel codice di esempio, l'output H3-Base locale è codificato in base64 come Data URL e passato a H3-Regenerate-2K. In una distribuzione reale, carichi il video a 768p su qualsiasi URL pubblico e passi l'URL come base_video invece. Questa è l'unica modifica significativa tra l'esempio e la produzione.

Scheda Tecnica

Durata dell'output: da 4 a 15 secondi. Proporzioni: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Risoluzione: 768p per default; 2K tramite H3-Regenerate-2K. Frame rate: 24 FPS. Audio: 32 kHz stereo, nativo al modello.

Supporto linguistico stabile copre 11 lingue: arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo. Altre lingue ricevono supporto parziale. Licenza: Licenza Comunità MiniMax H3 (open-source, ma non permissiva nel senso di Apache - leggi la scheda del modello prima di commercializzare un prodotto su di essa).

Dove ottenere i pesi: Hugging Face su huggingface.co/MiniMaxAI/MiniMax-H3 e ModelScope su modelscope.cn/models/MiniMax/MiniMax-H3. I parametri completi della richiesta, il prompt H3-Context-IR e il codice di rigenerazione sono nella scheda del modello Hugging Face.

Su videobao: Cosa è Live, Cosa è Dopo

H3 è live su videobao oggi. Le modalità d'uso integrate coprono l'intera superficie H3-Base: testo-a-video; immagine del primo fotogramma, ultimo fotogramma o primo+ultimo fotogramma a video; e modalità guidata dal riferimento con fino a 5 immagini di riferimento più clip video e audio di riferimento opzionali. Scegli la modalità adatta al brief, aggiungi fotogrammi o riferimenti, genera un clip 2K e spediscilo. Il prezzo è di 7 crediti al secondo per il 2K nativo, con un intervallo di durata da 4 a 15 secondi. H3 è di fascia premium su videobao perché la generazione 2K è significativamente più costosa del 1080p.

Tutte e tre le modalità vengono distribuite attraverso lo stesso flusso di generazione. La modalità guidata dal riferimento è ciò che sblocca la coerenza dei personaggi tra i fotogrammi, il cloning vocale per gli spot pubblicitari e le modifiche multi-sorgente complesse, ed è già live su videobao insieme ai percorsi primo/ultimo fotogramma, quindi lo stesso schema prompt-più-riferimenti funzionerà sia che tu stia usando H3 oggi o una qualsiasi di queste modalità domani.

Distribuzione Locale, Risorse e Cosa Leggere dopo

Per la distribuzione locale, hai bisogno di una box multi-GPU. Il trasformatore denso da 33B è piccolo per gli standard del 2026, ma richiede comunque VRAM seria. La scheda del modello illustra la configurazione di inferenza esatta, il setup di servizio stile vLLM e le ipotesi di precisione BF16. Leggi la scheda del modello dall'inizio alla fine prima di impegnarti in un obiettivo di distribuzione.

Risorse: la scheda del modello Hugging Face è la fonte di verità (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope riflette i pesi per gli utenti in Cina (modelscope.cn/models/MiniMax/MiniMax-H3). I documenti della piattaforma MiniMax coprono le API cloud per H3-2K Direct, H3-Context-IR e H3-Regenerate-2K su platform.minimaxi.com/docs/api-reference. Per il laboratorio sottostante, hailuoai.com è il punto di ingresso rivolto ai consumatori.

Se hai solo bisogno di H3 per il lavoro di produzione e non vuoi ospitarlo, il pannello di integrazione videobao è il percorso più veloce. Se vuoi il controllo completo di una distribuzione locale, la scheda del modello più i documenti della piattaforma ti porteranno a una pipeline 2K in un giorno.

Scritto da

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Post Correlati

← Torna a tutti i post
Guida per Sviluppatori MiniMax H3: Architettura, 3 Modalità d'Uso e Workflow 2K - videobao