videobao no ar com DouBao SeeDance 2.5 e MiniMax-H3 — 10 créditos ao se cadastrar

Assinar agora
Guia do Desenvolvedor

Guia do Desenvolvedor MiniMax H3: Arquitetura, 3 Modos de Uso e Fluxo de Trabalho 2K

Uma análise técnica do MiniMax H3: o pipeline de três estágios, o transformador denso H3-Base Omni de 33B, T2VA vs FL2VA vs Ref2VA, e o fluxo de trabalho completo de regeneração 2K com peças locais e em nuvem.

Por Equipe videobao8 min de leitura
Diagrama de visão geral do sistema MiniMax H3 mostrando o pipeline de três estágios, desde o entendimento do contexto até a geração base de alta resolução 2K

O MiniMax H3 é um sistema de geração de vídeo de modalidade universal completa. Ele recebe texto, imagem, vídeo e áudio como um único contexto, entende as relações entre eles e produz um vídeo nativo de áudio estéreo de 2K e 15 segundos. A arquitetura é a parte que a maioria dos usuários nunca vê, mas é a parte que explica cada decisão que a MiniMax tomou nos últimos doze meses. Este guia aborda o pipeline de três estágios, o transformador denso H3-Base Omni de 33B dentro dele, os três modos de uso (T2VA, FL2VA, Ref2VA) e o fluxo de trabalho completo de 2K que combina geração local com regeneração em nuvem.

Se você não é um praticante de aprendizado de máquina, pode parar após a seção de modos de uso e usar o videobao para o restante. Se você está integrando o H3 por conta própria, o restante do artigo é para você.

Visão Geral do Pipeline de Três Estágios

O H3 não é um único modelo. São três módulos conectados: H3-Context-IR, H3-Base e H3-Regenerate-2K. O pipeline recebe instruções multimodais brutas à esquerda e produz um vídeo de 2K com áudio sincronizado à direita.

O H3-Context-IR analisa o que o usuário lança para o modelo. Texto, imagem, vídeo, áudio ou qualquer combinação. A saída é uma representação intermediária de contexto estruturado que os estágios downstream podem consumir. Em seguida, o H3-Base gera um vídeo de 768p com áudio a partir dessa representação, e o H3-Regenerate-2K pega a saída de 768p, a recombina com o contexto original e re-renderiza em 2K. A etapa de regeneração é o que faz o 2K parecer nítido em vez de ampliado, porque o modelo ainda tem o contexto original completo para desenhar enquanto refina.

Pense nisso como uma receita de três etapas: entender o briefing, esboçar uma versão de baixa resolução e depois reescrever em resolução total com o briefing ainda em vista. O mesmo padrão funciona na produção cinematográfica e no design. O H3 apenas o transforma em uma única chamada de API.

Diagrama de visão geral do sistema de três estágios do MiniMax H3: O entendimento do contexto alimenta o H3-Context-IR e uma representação de contexto estruturado, a geração base executa o H3-Base para produzir vídeo de 768p, e a regeneração de alta resolução executa o H3-Regenerate-2K para produzir vídeo de 2K com orientação de contexto dos estágios anteriores
Figura 1: Visão geral do sistema H3 - o entendimento do contexto alimenta a geração base, que alimenta a regeneração de 2K, com orientação de contexto conduzida por todo o caminho.

Dentro do H3-Base: 33B Denso, Um Fluxo, Desnoising Conjunto de Vídeo-Áudio

O H3-Base é o coração do sistema. É um transformador denso de 33 bilhões de parâmetros que realiza o desnoising de latentes de vídeo e áudio em um único fluxo, usando um backbone DiT compartilhado com 50 camadas.

Três codificadores o alimentam. O Codificador H3 é construído sobre o Qwen3-VL-32B na camada 50 e produz tokens de texto. O Codificador VAE Visual opera a 16x16x24 com causalidade temporal e um patchify de 2x2x1, produzindo latentes de referência visual. O Codificador VAE de Áudio opera a d=32, estéreo, 32 kHz, tokens de 40 Hz. Os quatro fluxos de tokens são empacotados em uma única sequência no contexto, com latentes de vídeo e áudio ruidosos anexados no lado da geração. Essa única sequência é o que o transformador realiza o desnoising.

A escolha de arquitetura que importa é os componentes específicos de modalidade sobre um backbone compartilhado. O DiT base é compartilhado entre vídeo e áudio, razão pela qual o modelo pode manter os dois em sincronia sem um módulo de alinhamento extra. Os dois decodificadores ainda são separados: um Decodificador VAE Visual que mapeia latentes de vídeo de volta para quadros RGB, e um Decodificador VAE de Áudio que mapeia latentes de áudio para forma de onda estéreo. A saída é um par de vídeo mais áudio estéreo sincronizado, gerado em uma única passagem.

Diagrama detalhado da arquitetura H3-Base mostrando codificação de condição (Codificador H3 do Qwen3-VL-32B, Codificador VAE Visual a 16x16x24, Codificador VAE de Áudio a 32 kHz estéreo), sequência no contexto empacotada, geração unificada com o transformador Omni H3 de 33B e backbone DiT compartilhado x 50, e decodificação com Decodificador VAE Visual e Decodificador VAE de Áudio produzindo vídeo sincronizado mais áudio estéreo
Figura 2: Internos do H3-Base - codificação de condição, sequência no contexto empacotada, desnoising unificado e decodificação sincronizada.

Três Modos de Uso: T2VA, FL2VA, Ref2VA

O H3 lança dois checkpoints de código aberto, cada um ajustado para um modo de uso diferente. Ambos produzem vídeo de 768p com áudio em precisão BF16. A diferença está no que eles aceitam como entrada.

H3-Base-FL2VA é o modo de primeiro/último quadro. Ele aceita texto mais zero, uma ou duas imagens de referência. Zero imagens significa texto para áudio-vídeo (T2VA). Uma imagem pode ser um quadro inicial (I2VA de um quadro principal) ou um quadro final. Duas imagens significa interpolação de primeiro e último quadro. Use FL2VA quando o usuário tiver um início e fim claros em mente e quiser que o modelo preencha o movimento intermediário.

H3-Base-Ref2VA é o modo orientado por referência. Ele aceita texto mais até 9 imagens de referência, até 3 clipes de vídeo de referência (cada um de 2-15 segundos, totalizando não mais que 15 segundos) e até 3 clipes de áudio de referência (cada um de 2-15 segundos, totalizando não mais que 15 segundos). O áudio deve ser emparelhado com uma imagem ou vídeo - não pode ficar sozinho. O total entre todos os tipos de entrada é limitado a 12 arquivos. Ref2VA é o modo para consistência de personagem, clonagem de voz, transferência de cena e edições complexas onde você deseja reutilizar peças de filmagens existentes.

Tabela de checkpoints H3 mostrando H3-Base FL2VA suportando T2VA e I2VA de primeiro/último quadro com quadros opcionais de primeiro/último, e H3-Base Ref2VA suportando referência para áudio-vídeo com texto mais imagens, vídeos e áudio de referência, ambos produzindo vídeo e áudio em precisão BF16
Figura 3: Dois checkpoints de código aberto, dois modos de uso. FL2VA é para fluxos de trabalho de primeiro/último quadro; Ref2VA é para fluxos de trabalho orientados por referência.

O Fluxo de Trabalho Completo de 2K: Base Local mais Regeneração em Nuvem

A saída de 768p do H3-Base é o caminho local, totalmente de código aberto. O caminho de 2K combina o H3-Base local com duas APIs em nuvem: H3-Context-IR e H3-Regenerate-2K. Ambos são hospedados pela MiniMax.

Os três estágios se alinham com o diagrama do pipeline. Primeiro, o H3-Context-IR recebe a entrada do usuário e produz o prompt expandido que o H3-Base e o H3-Regenerate-2K consumirão. Segundo, o H3-Base localmente implantado renderiza um vídeo de 768p com áudio a partir desse prompt expandido. Terceiro, o H3-Regenerate-2K pega o resultado de 768p como base_video, recombina-o com o prompt expandido e o contexto original do usuário, e re-renderiza em 2K. A etapa de regeneração é o que carrega o contexto semântico original na passagem de alta resolução, razão pela qual a saída de 2K parece uma melhoria em vez de um aumento de escala.

Três casos de 2K são enviados no cartão oficial do modelo: T2VA (somente texto, cadeia completa), I2VA (texto mais um quadro inicial, cadeia completa) e Ref2VA (texto mais clipes de referência, cadeia completa). Para cada caso, o cartão do modelo fornece uma execução local de 768p somente local e uma execução de 2K via API, para que o desenvolvedor possa verificar se o caminho local corresponde ao caminho em nuvem em uma saída de referência conhecida.

Para produção: no código de exemplo, a saída do H3-Base local é codificada em base64 como uma URL de dados e passada para o H3-Regenerate-2K. Em uma implantação real, você carrega o vídeo de 768p para qualquer URL público e passa a URL como base_video em vez disso. Essa é a única mudança significativa de encanamento entre o exemplo e a produção.

Ficha Técnica

Duração da saída: de 4 a 15 segundos. Proporções de aspecto: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Resolução: 768p por padrão; 2K via H3-Regenerate-2K. Taxa de quadros: 24 FPS. Áudio: 32 kHz estéreo, nativo do modelo.

O suporte de idioma estável cobre 11 idiomas: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. Outros idiomas recebem suporte parcial. Licença: Licença Comunitária MiniMax H3 (código aberto, mas não permissiva no sentido Apache - leia o cartão do modelo antes de lançar um produto comercial sobre ele).

Onde obter os pesos: Hugging Face em huggingface.co/MiniMaxAI/MiniMax-H3 e ModelScope em modelscope.cn/models/MiniMax/MiniMax-H3. Os parâmetros completos da solicitação, o prompt H3-Context-IR e o código de regeneração estão no cartão do modelo Hugging Face.

No videobao: O Que Está Ao Vivo, O Que Vem a Seguir

O H3 está ao vivo no videobao hoje. Os modos de uso integrados cobrem toda a superfície H3-Base: texto para vídeo; imagem de primeiro quadro, último quadro ou primeiro+último quadro para vídeo; e modo orientado por referência com até 5 imagens de referência além de clipes de vídeo e áudio de referência opcionais. Escolha o modo que se ajusta ao brief, adicione quadros ou referências, gere um clipe de 2K e envie-o. O preço é de 7 créditos por segundo para 2K nativo, com uma faixa de duração de 4 a 15 segundos. O H3 é de nível premium no videobao porque a geração de 2K é significativamente mais cara que 1080p.

Todos os três modos são entregues através do mesmo fluxo de geração. O modo orientado por referência é o que desbloqueia a consistência de personagem entre os tiros, a clonagem de voz para anúncios de produtos e a edição multi-fonte complexa, e já está ao vivo no videobao junto com os caminhos de primeiro/último quadro, de modo que o mesmo padrão de prompt-mais-referências funciona se você está usando o H3 hoje ou qualquer um desses modos amanhã.

Implantação Local, Recursos e O Que Ler a Seguir

Para implantação local, você precisa de uma caixa multi-GPU. O transformador denso de 33B é pequeno pelos padrões de fronteira de 2026, mas ainda assim quer VRAM sério. O cartão do modelo percorre a configuração de inferência exata, a configuração de serviço no estilo vLLM e as suposições de precisão BF16. Leia o cartão do modelo de ponta a ponta antes de se comprometer com um alvo de implantação.

Recursos: o cartão do modelo Hugging Face é a fonte da verdade (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope espelha os pesos para usuários na China (modelscope.cn/models/MiniMax/MiniMax-H3). Os documentos da plataforma MiniMax cobrem as APIs em nuvem para H3-2K Direct, H3-Context-IR e H3-Regenerate-2K em platform.minimaxi.com/docs/api-reference. Para o laboratório subjacente, hailuoai.com é o ponto de entrada voltado para o consumidor.

Se você só precisa do H3 para trabalhos de produção e não quer hospedá-lo, o painel de integração do videobao é o caminho mais rápido. Se você quiser o controle total de uma implantação local, o cartão do modelo mais os documentos da plataforma o levarão a um pipeline de 2K em um dia.

Escrito por

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Postagens Relacionadas

← Voltar a todas as postagens
Guia do Desenvolvedor MiniMax H3: Arquitetura, 3 Modos de Uso e Fluxo de Trabalho 2K - videobao