Guía para Desarrolladores de MiniMax H3: Arquitectura, 3 Modos de Uso y Flujo de Trabajo 2K
Un recorrido técnico de MiniMax H3: el pipeline de tres etapas, el transformador omnipresente H3-Base de 33B de densidad, T2VA vs FL2VA vs Ref2VA, y el flujo de trabajo completo de regeneración 2K con piezas locales y en la nube.
MiniMax H3 es un sistema de generación de video de modalidad universal completa. Toma texto, imagen, video y audio como un solo contexto, entiende las relaciones entre ellos y produce un video nativo de audio estéreo de 2K y 15 segundos. La arquitectura es la parte que la mayoría de los usuarios nunca ven, pero es la parte que explica cada decisión que MiniMax tomó en los últimos doce meses. Esta guía recorre el pipeline de tres etapas, el transformador omnipresente H3-Base de 33B de densidad en su interior, los tres modos de uso (T2VA, FL2VA, Ref2VA) y el flujo de trabajo completo de 2K que combina la generación local con la regeneración en la nube.
Si no eres un practicante de aprendizaje automático, puedes detenerte después de la sección de modos de uso y usar videobao para el resto. Si estás integrando H3 por tu cuenta, el resto del artículo es para ti.
El Pipeline de Tres Etapas de un Vistazo
H3 no es un solo modelo. Son tres módulos conectados entre sí: H3-Context-IR, H3-Base y H3-Regenerate-2K. El pipeline toma instrucciones multimodales en bruto a la izquierda y produce un video de 2K con audio sincronizado a la derecha.
H3-Context-IR analiza lo que el usuario le arroja al modelo. Texto, imagen, video, audio o cualquier combinación. La salida es una representación intermedia de contexto estructurado que las etapas posteriores pueden consumir. Luego, H3-Base genera un video de 768p con audio a partir de esa representación, y H3-Regenerate-2K toma la salida de 768p, la fusiona de nuevo con el contexto original y vuelve a renderizar a 2K. El paso de regeneración es lo que hace que los 2K se sientan nítidos en lugar de escalados, porque el modelo aún tiene el contexto original completo para aprovechar mientras refina.
Piénsalo como una receta de tres pasos: entender el resumen, hacer un borrador de baja resolución y luego volver a redactar a resolución completa con el resumen aún a la vista. El mismo patrón funciona en la producción cinematográfica y el diseño. H3 simplemente lo convierte en una sola llamada a la API.

Dentro de H3-Base: 33B Denso, Un Solo Flujo, Denoising Conjunto de Video-Audio
H3-Base es el corazón del sistema. Es un transformador denso de 33 mil millones de parámetros que denoisa latentes de video y audio en un solo flujo, utilizando una columna vertebral DiT compartida con 50 capas.
Tres codificadores lo alimentan. El codificador H3 se basa en Qwen3-VL-32B en la capa 50 y produce tokens de texto. El codificador VAE Visual funciona a 16x16x24 con causalidad temporal y un parcheado de 2x2x1, produciendo latentes de referencia visual. El codificador VAE de Audio funciona a d=32, estéreo, 32 kHz, tokens de 40 Hz. Los cuatro flujos de tokens se empaquetan en una sola secuencia en contexto, con latentes de video ruidoso y audio ruidoso añadidos en el lado de la generación. Esa única secuencia es lo que el transformador denoisa.
La elección de arquitectura que importa es los componentes específicos de la modalidad sobre una columna vertebral compartida. El DiT base se comparte entre video y audio, por lo que el modelo puede mantener los dos sincronizados sin un módulo de alineación adicional. Los dos decodificadores aún son separados: un decodificador VAE Visual que mapea latentes de video de vuelta a cuadros RGB, y un decodificador VAE de Audio que mapea latentes de audio a forma de onda estéreo. La salida es un par de video más audio estéreo sincronizado, generado en una sola pasada.

Tres Modos de Uso: T2VA, FL2VA, Ref2VA
H3 lanza dos puntos de control de código abierto, cada uno ajustado para un modo de uso diferente. Ambos producen video de 768p con audio en precisión BF16. La diferencia está en lo que aceptan como entrada.
H3-Base-FL2VA es el modo de primer/último cuadro. Acepta texto más cero, una o dos imágenes de referencia. Cero imágenes significa texto a video-audio (T2VA). Una imagen puede ser un primer cuadro (I2VA desde un cuadro inicial) o un cuadro final. Dos imágenes significa interpolación de primer y último cuadro. Usa FL2VA cuando el usuario tiene un inicio y un final claros en mente y quiere que el modelo llene el movimiento intermedio.
H3-Base-Ref2VA es el modo impulsado por referencia. Acepta texto más hasta 9 imágenes de referencia, hasta 3 clips de video de referencia (cada uno de 2-15 segundos, el total no excede los 15 segundos) y hasta 3 clips de audio de referencia (cada uno de 2-15 segundos, el total no excede los 15 segundos). El audio debe estar emparejado con una imagen o video, no puede estar solo. El total entre todos los tipos de entrada tiene un tope de 12 archivos. Ref2VA es el modo para la consistencia de personaje, clonación de voz, transferencia de escena y ediciones complejas donde desea reutilizar piezas de metraje existente.

El Flujo de Trabajo Completo de 2K: Base Local más Regeneración en la Nube
La salida de 768p de H3-Base es la ruta local, completamente de código abierto. La ruta de 2K combina H3-Base local con dos API de la nube: H3-Context-IR y H3-Regenerate-2K. Ambos son alojados por MiniMax.
Las tres etapas se alinean con el diagrama del pipeline. Primero, H3-Context-IR toma la entrada del usuario y produce el aviso ampliado que H3-Base y H3-Regenerate-2K consumirán. Segundo, el H3-Base localmente desplegado renderiza un video de 768p con audio a partir de ese aviso ampliado. Tercero, H3-Regenerate-2K toma el resultado de 768p como base_video, lo recombina con el ampliado ampliado y el contexto original del usuario, y vuelve a renderizar a 2K. El paso de regeneración es lo que lleva el contexto semántico original a la pasada de alta resolución, por lo que la salida de 2K se siente como un refinamiento en lugar de un escalado.
Tres casos de 2K se incluyen en la tarjeta oficial del modelo: T2VA (solo texto, cadena completa), I2VA (texto más un primer cuadro, cadena completa) y Ref2VA (texto más clips de referencia, cadena completa). Para cada caso, la tarjeta del modelo proporciona tanto una ejecución local de 768p como una ejecución de 2K a través de la API, por lo que el desarrollador puede verificar que la ruta local coincide con la ruta en la nube en una salida de referencia conocida.
Para producción: en el código de ejemplo, la salida de H3-Base local se codifica en base64 como una URL de datos y se pasa a H3-Regenerate-2K. En un despliegue real, cargas el video de 768p a cualquier URL pública y pasas la URL como base_video en su lugar. Esa es la única diferencia significativa entre el ejemplo y la producción.
Ficha Técnica
Duración de la salida: de 4 a 15 segundos. Relaciones de aspecto: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Resolución: 768p por defecto; 2K a través de H3-Regenerate-2K. Velocidad de cuadros: 24 FPS. Audio: 32 kHz estéreo, nativo del modelo.
El soporte de idioma estable cubre 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español. Otros idiomas reciben soporte parcial. Licencia: Licencia Comunitaria MiniMax H3 (código abierto, pero no permisivo en el sentido de Apache - lea la tarjeta del modelo antes de lanzar un producto comercial sobre ella).
Dónde obtener los pesos: Hugging Face en huggingface.co/MiniMaxAI/MiniMax-H3 y ModelScope en modelscope.cn/models/MiniMax/MiniMax-H3. Los parámetros completos de la solicitud, el aviso H3-Context-IR y el código de regeneración están en la tarjeta del modelo de Hugging Face.
En videobao: Qué Está Vivo, Qué Viene Después
H3 está en vivo en videobao hoy. Los modos de uso integrados cubren toda la superficie H3-Base: texto a video; imagen de primer cuadro, último cuadro o primer+último cuadro a video; y modo impulsado por referencia con hasta 5 imágenes de referencia más clips de video y audio de referencia opcionales. Elija el modo que se ajuste al brief, agregue cuadros o referencias, genere un clip de 2K y envíelo. El precio es de 7 créditos por segundo para 2K nativo, con un rango de duración de 4 a 15 segundos. H3 es de nivel premium en videobao porque la generación de 2K es significativamente más cara que 1080p.
Los tres modos se entregan detrás del mismo flujo de generación. El modo impulsado por referencia es lo que desbloquea la consistencia de personaje entre tomas, la clonación de voz para anuncios de productos y la edición compleja de múltiples fuentes, y ya está en vivo en videobao junto con las rutas de primer/último cuadro, por lo que el mismo patrón de aviso-más-referencias funciona tanto si usa H3 hoy como cualquiera de esos modos mañana.
Despliegue Local, Recursos y Qué Leer a Continuación
Para el despliegue local, necesitas una caja multi-GPU. El transformador denso de 33B es pequeño según los estándares de vanguardia de 2026, pero aún así quiere VRAM seria. La tarjeta del modelo recorre la configuración exacta de inferencia, el patrón de servicio al estilo vLLM y las suposiciones de precisión BF16. Lee la tarjeta del modelo de principio a fin antes de comprometerte con un objetivo de despliegue.
Recursos: la tarjeta del modelo de Hugging Face es la fuente de la verdad (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope refleja los pesos para los usuarios en China (modelscope.cn/models/MiniMax/MiniMax-H3). Los documentos de la plataforma MiniMax cubren las API de la nube para H3-2K Direct, H3-Context-IR y H3-Regenerate-2K en platform.minimaxi.com/docs/api-reference. Para el laboratorio subyacente, hailuoai.com es el punto de entrada orientado al consumidor.
Si solo necesitas H3 para trabajos de producción y no quieres alojarlo, el panel de integración de videobao es el camino más rápido. Si quieres el control total de un despliegue local, la tarjeta del modelo más los documentos de la plataforma te llevarán a un pipeline de 2K en un día.