MiniMax H3 se lanza como código abierto con 33B: los modelos de video cruzan la línea de producción
MiniMax lanzó como código abierto su modelo de video H3 de 33B a finales de julio, alcanzando el estado del arte (SOTA). Desglosamos qué hace realmente, por qué 33B es el titular, y qué pueden hacer los usuarios de videobao con él hoy.
El último día de julio, MiniMax lanzó H3, un modelo de video de 33 mil millones de parámetros que alcanza el estado del arte (SOTA) en los principales benchmarks de video. El mismo día, los pesos del modelo se lanzaron como código abierto. La historia no es solo que otro laboratorio alcanzó a ByteDance's Seedance. La historia es que la generación de video ha cruzado la línea de 'demostración interesante' a 'herramienta de producción', y MiniMax eligió lanzar el momento como código abierto.
En videobao, eso cambia lo que puedes hacer en una sola sesión. Sigue leyendo para el desglose de H3, el argumento de 'por qué 33B es el titular' y cómo usar esta generación de modelos en tu próximo proyecto.
¿Qué hace realmente MiniMax H3?
H3 se construye alrededor de dos ideas: entrada de multi-modalidad nativa y edición precisa entre modalidades. Texto, imagen, audio y video pueden ser utilizados como referencias en el mismo prompt. Esto significa que puedes entregarle al modelo un clip corto, señalar a un personaje con una instrucción de texto y reemplazar solo a ese personaje mientras todo lo demás alrededor de él permanece intacto.
Los primeros demos de MiniMax se centran en las escenas donde los equipos de producción realmente necesitan esto: recorridos de diseño de UI, anuncios de marca, cortes de estilo MV, cinematografía de juegos, efectos de AR y transiciones, y pruebas de comercio electrónico. La propuesta no es 'la IA puede hacer un video' sino 'la IA puede hacer el video específico que necesitas, con el elemento específico cambiado'.
H3 también genera 2K de manera nativa, con un nuevo tokenizador construido sobre la arquitectura Hailuo-02. La compresión es más eficiente, el costo de entrenamiento e inferencia es menor, y el modelo es lo suficientemente pequeño (33B) para que los equipos de producción serios realmente puedan alojarlo.
¿Por qué 33B es una historia más grande que SOTA?
SOTA es el titular. 33B es la noticia real. La mayoría de los modelos de video SOTA en 2025 tenían más de 70B de parámetros, lo que significaba facturas de cómputo serias, iteración lenta y APIs cerradas. Un modelo de 33B en SOTA significa tres cosas.
Primero, el entrenamiento es más accesible. Los equipos que no pudieron permitirse entrenar un modelo de video de vanguardia el año pasado ahora pueden ajustar o destilar uno. Segundo, la inferencia es más barata. El costo del crédito por generación en videobao está determinado por el costo upstream, y los modelos más pequeños empujan ese número hacia abajo. Tercero, el despliegue es realista. Puedes ejecutar un modelo de video de 33B en hardware de producción serio sin necesidad de construir un centro de datos personalizado.
En otras palabras, SOTA a 33B es lo que convierte un resultado de investigación en un producto. Lo mismo sucedió con los modelos de lenguaje cuando los hits eficientes de código abierto alcanzaron la calidad de GPT-3 a una fracción del tamaño. El video está pasando por la misma transición, solo doce meses detrás.
De truco de demostración a herramienta de producción
Hace un año, el video de IA se juzgaba por si un conejo era coherente. Todo el campo estaba optimizando la consistencia a nivel de prompt, e incluso eso era difícil. La barra de 2026 es diferente. Modelos como Veo 3.1, Kling 2.5, Sora 2 y ahora H3 no solo generan. Reemplazan a un personaje con precisión sin manchar el fondo. No solo incluyen audio. Veo 3.1 ofrece audio nativo de 48 kHz, y la mayoría de los modelos principales ahora producen video sincronizado con los labios en una sola pasada.
Los casos de uso se movieron con la capacidad. El año pasado fue 'mira este efecto genial'. Este año es TVC, anuncios de marca y demostraciones de productos. El cambio de 'mostrar el modelo' a 'usar el modelo para lanzar una campaña' es la línea que acaba de cruzar la industria.
Si probaste el video de IA en 2025 y te desanimaste, los modelos de 2026 son un producto diferente. En videobao ahora puedes usar Hailuo 02, Veo 3.1, Kling 2.5 y Sora 2 en la misma sesión y elegir el que se ajuste al resumen.
¿Por qué la agregación gana cuando los modelos se lanzan como código abierto?
MiniMax eligió lanzar H3 como código abierto a pesar de tener un rendimiento SOTA y una ventaja de costo. Eso suena contraintuitivo, pero el juego de código abierto se está convirtiendo en el estándar para los laboratorios de video serios. La razón es simple: los modelos de video están a punto de estar en todas partes, y ser el proveedor cerrado de una versión ligeramente mejor es menos valioso que ser la plataforma que permite a los usuarios comparar todos ellos.
Mira LTX-2.3. Es un modelo de video de código abierto en el extranjero que superó los 18 millones de descargas en Hugging Face. Dieciocho millones. El ecosistema de video de código abierto es real, está activo y es donde ocurre la mayor parte del nuevo trabajo de productos. Las plataformas de agregación como videobao se sientan encima de esto: empaquetamos código abierto, cerrado, chino y occidental detrás de un solo inicio de sesión y un solo saldo de crédito, para que no tengas que elegir.
Esa es la respuesta práctica a la pregunta de 'código abierto o cerrado' para los usuarios finales. No eliges. Usas la plataforma, y la plataforma elige el modelo adecuado para el trabajo. A veces es MiniMax H3, ahora en vivo en videobao. A veces es Veo 3.1 para tomas cinematográficas. A veces es Kling 2.5 para clips sociales baratos con audio nativo. La cuestión es que la plataforma puede hacerlo todo.
¿Cómo usar H3 en videobao hoy?
H3 ya está en vivo en videobao. Elígelo cuando quieras una edición precisa entre modalidades en un lienzo nativo de 2K. El patrón: sube una imagen de referencia o un clip corto, escribe un prompt que nombre el elemento que deseas cambiar, y H3 mantiene el resto de la escena estable en píxeles. Hailuo 02, Kling 2.5 y Veo 3.1 están en la misma sesión si deseas el mismo flujo de trabajo en un nivel de precio o resolución diferente.
En videobao, H3 se ejecuta a 7 créditos por segundo para 2K nativo con un rango de duración de 4-15s. Los modos de uso integrados son: texto a video, imagen de primer cuadro, último cuadro o primer+último cuadro a video, y modo impulsado por referencia con hasta 5 imágenes de referencia más clips de video y audio de referencia opcionales. La edición precisa entre modalidades es el caso de uso principal. Hailuo 02 es la alternativa más barata para el mismo flujo de trabajo; Veo 3.1 es la elección correcta si necesitas 4K; Kling 2.5 es la elección correcta si deseas una pista de audio integrada en un presupuesto ajustado; Sora 2 es la elección correcta para contar historias largas con múltiples tomas. H3 es solo de nivel premium en videobao, ya que la generación de 2K es significativamente más cara que 1080p.
La ola de código abierto de 33B seguirá bajando el piso de precio en el resto de la alineación durante los próximos dos trimestres. El movimiento correcto es bloquear el flujo de trabajo de edición entre modalidades ahora, mientras H3 es el SOTA más reciente y los otros modelos siguen comprimiéndose bajo él.