MiniMax H3 개발자 가이드: 아키텍처, 3가지 사용 모드 및 2K 워크플로
MiniMax H3의 기술적 탐색: 3단계 파이프라인, 33B 밀집 H3-Base 옴니 트랜스포머, T2VA vs FL2VA vs Ref2VA, 그리고 로컬 및 클라우드 요소를 혼합한 완전한 2K 재생 워크플로.
MiniMax H3는 범용 완전 모달리티 비디오 생성 시스템입니다. 텍스트, 이미지, 비디오, 오디오를 하나의 컨텍스트로 받아들이고, 그들 사이의 관계를 이해하며, 2K, 15초, 내장 스테레오 오디오 비디오를 생성합니다. 이 아키텍처는 대부분의 사용자가 결코 보지 못하는 부분이지만, 지난 12개월 동안 MiniMax가 내린 모든 결정의 이유를 설명하는 부분입니다. 이 가이드는 3단계 파이프라인, 그 안에 있는 33B 밀집 H3-Base 옴니 트랜스포머, 세 가지 사용 모드(T2VA, FL2VA, Ref2VA), 그리고 로컬 생성 및 클라우드 재생을 결합한 완전한 2K 워크플로를 안내합니다.
만약 여러분이 머신러닝 실무자가 아니라면, 사용 모드 섹션 이후에 멈추고 나머지 부분은 videobao를 사용하시면 됩니다. 만약 여러분이 직접 H3를 통합하고 있다면, 나머지 기사는 여러분을 위한 것입니다.
한눈에 보는 3단계 파이프라인
H3는 하나의 모델이 아닙니다. 세 개의 모듈이 연결된 것입니다: H3-Context-IR, H3-Base, H3-Regenerate-2K. 파이프라인은 왼쪽의 원시 다중 모달 명령을 받아들이고 오른쪽에 동기화된 오디오가 있는 2K 비디오를 생성합니다.
H3-Context-IR은 모델에 사용자가 던지는 모든 것을 구문 분석합니다. 텍스트, 이미지, 비디오, 오디오 또는 이들의 조합이 가능합니다. 출력은 하위 단계에서 소비할 수 있는 구조화된 컨텍스트 중간 표현입니다. H3-Base는 해당 표현에서 768p 비디오와 오디오를 생성하고, H3-Regenerate-2K는 768p 출력을 가져와 원래 컨텍스트와 다시 결합하고 2K로 재렌더링합니다. 재생 단계는 2K가 업스케일이 아닌 날카롭게 느껴지도록 하는 것입니다. 왜냐하면 모델은 세밀화하는 동안에도 여전히 전체 원본 컨텍스트를 활용할 수 있기 때문입니다.
이를 세 단계 요리법으로 생각해보세요: 브리프를 이해하고, 저해상도 버전을 초안으로 작성한 다음, 브리프를 계속 보면서 전체 해상도로 다시 초안을 작성합니다. 같은 패턴이 영화 제작과 디자인에서 작동합니다. H3는 그것을 하나의 API 호출로 만듭니다.

H3-Base 내부: 33B 밀집, 하나의 스트림, 공동 비디오-오디오 잡음 제거
H3-Base는 시스템의 핵심입니다. 330억 개의 매개변수를 가진 밀집 트랜스포머로, 50개의 레이어가 있는 공유 DiT 백본을 사용하여 비디오와 오디오 잠재를 하나의 스트림으로 잡음 제거합니다.
세 개의 인코더가 이를 공급합니다. H3 인코더는 Qwen3-VL-32B의 레이어 50에 구축되어 텍스트 토큰을 생성합니다. 시각적 VAE 인코더는 16x16x24에서 시간적 인과성과 2x2x1 패치화를 실행하여 시각적 참조 잠재를 생성합니다. 오디오 VAE 인코더는 d=32, 스테레오, 32 kHz, 40 Hz 토큰에서 실행됩니다. 네 개의 토큰 스트림은 하나의 인컨텍스트 시퀀스로 패키징되며, 생성 측에 노이즈가 있는 비디오 및 노이즈가 있는 오디오 잠재가 추가됩니다. 이 하나의 시퀀스가 트랜스포머가 잡음 제거하는 것입니다.
중요한 아키텍처 선택은 공유 백본 위에 있는 모달리티별 구성 요소입니다. 기본 DiT는 비디오와 오디오 간에 공유되므로, 모델은 추가적인 정렬 모듈 없이 두 가지를 동기화 상태로 유지할 수 있습니다. 두 개의 디코더는 여전히 분리되어 있습니다: 비디오 잠재를 RGB 프레임으로 다시 매핑하는 시각적 VAE 디코더와 오디오 잠재를 스테레오 파형으로 매핑하는 오디오 VAE 디코더. 출력은 동기화된 비디오-스테레오 오디오 쌍으로, 한 번의 패스로 생성됩니다.

세 가지 사용 모드: T2VA, FL2VA, Ref2VA
H3는 두 가지 오픈 소스 체크포인트를 출시하며, 각각 다른 사용 모드에 맞게 조정되었습니다. 둘 다 BF16 정밀도로 오디오가 포함된 768p 비디오를 생성합니다. 차이점은 입력으로 받아들이는 것입니다.
H3-Base-FL2VA는 첫 번째/마지막 프레임 모드입니다. 텍스트와 함께 0, 1 또는 2개의 참조 이미지를 허용합니다. 이미지가 0개이면 텍스트-오디오-비디오(T2VA)입니다. 하나의 이미지는 헤드 프레임(I2VA의 경우) 또는 테일 프레임일 수 있습니다. 두 개의 이미지는 첫 번째 및 마지막 프레임 보간을 의미합니다. 사용자가 명확한 시작과 끝을 염두에 두고 있고, 모델이 그 사이의 동작을 채우기를 원할 때 FL2VA를 사용하세요.
H3-Base-Ref2VA는 참조 기반 모드입니다. 텍스트와 최대 9개의 참조 이미지, 최대 3개의 참조 비디오 클립(각각 2-15초, 총 15초를 초과하지 않음), 최대 3개의 참조 오디오 클립(각각 2-15초, 총 15초를 초과하지 않음)을 허용합니다. 오디오는 이미지 또는 비디오와 쌍을 이루어야 하며, 독립적으로 존재할 수 없습니다. 모든 입력 유형의 총합은 12개 파일로 제한됩니다. Ref2VA는 캐릭터 일관성, 음성 복제, 장면 전환, 그리고 기존 영상을 재사용하려는 복잡한 편집을 위한 모드입니다.

완전한 2K 워크플로: 로컬 기본 및 클라우드 재생
H3-Base의 768p 출력은 로컬, 완전 오픈 소스 경로입니다. 2K 경로는 로컬 H3-Base와 두 개의 클라우드 API: H3-Context-IR 및 H3-Regenerate-2K를 결합합니다. 둘 다 MiniMax에서 호스팅합니다.
세 단계는 파이프라인 다이어그램과 일치합니다. 먼저, H3-Context-IR은 사용자 입력을 받아들이고 H3-Base 및 H3-Regenerate-2K가 소비할 확장된 프롬프트를 생성합니다. 둘째, 로컬에 배포된 H3-Base는 해당 확장된 프롬프트에서 768p 비디오와 오디오를 렌더링합니다. 셋째, H3-Regenerate-2K는 768p 결과를 base_video로 가져와 확장된 프롬프트 및 원래 사용자 컨텍스트와 다시 결합하고 2K로 다시 렌더링합니다. 재생 단계는 원래의 의미론적 컨텍스트를 고해상도 패스에 전달하는 것이기 때문에, 2K 출력이 업스케일이 아닌 개선처럼 느껴집니다.
공식 모델 카드에는 세 가지 2K 사례가 포함되어 있습니다: T2VA(텍스트 전용, 전체 체인), I2VA(텍스트와 첫 번째 프레임, 전체 체인), 및 Ref2VA(텍스트와 참조 클립, 전체 체인). 각 사례에 대해 모델 카드는 로컬 전용 768p 실행과 API를 통한 2K 실행을 모두 제공하므로, 개발자는 알려진 참조 출력에서 로컬 경로가 클라우드 경로와 일치하는지 확인할 수 있습니다.
프로덕션의 경우: 예제 코드에서 로컬 H3-Base 출력은 base64로 인코딩된 Data URL로 전달되어 H3-Regenerate-2K에 전달됩니다. 실제 배포에서는 768p 비디오를 모든 공개 URL에 업로드하고 base_video로 URL을 전달합니다. 이것이 예제와 프로덕션 간의 유일한 의미 있는 배관 변경입니다.
사양 치트 시트
출력 기간: 4~15초. 가로세로 비율: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. 해상도: 기본적으로 768p; H3-Regenerate-2K를 통해 2K. 프레임 속도: 24 FPS. 오디오: 32 kHz 스테레오, 모델에 내장.
안정적인 언어 지원은 11개 언어를 포함합니다: 아랍어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 스페인어. 다른 언어는 부분 지원됩니다. 라이선스: MiniMax H3 커뮤니티 라이선스(오픈 소스이지만 Apache 의미의 허용 라이선스가 아님 - 상업용 제품을 출시하기 전에 모델 카드를 읽으세요).
무게를 얻을 수 있는 곳: Hugging Face의 huggingface.co/MiniMaxAI/MiniMax-H3 및 ModelScope의 modelscope.cn/models/MiniMax/MiniMax-H3. 전체 요청 매개변수, H3-Context-IR 프롬프트, 재생 코드는 Hugging Face 모델 카드에 있습니다.
videobao에서: 무엇이 라이브이고, 무엇이 다음인지
H3는 오늘 videobao에서 라이브 상태입니다. 통합된 사용 모드는 전체 H3-Base 표면을 포괄합니다: 텍스트-비디오; 첫 번째 프레임, 마지막 프레임 또는 첫+마지막 프레임 이미지-비디오; 그리고 최대 5개의 참조 이미지와 선택적 참조 비디오 및 오디오 클립을 사용하는 참조 기반 모드. 브리프에 맞는 모드를 선택하고, 프레임 또는 참조를 투입해 2K 클립을 생성하여 출하하세요. 가격은 기본 2K의 경우 초당 7 크레딧이며, 4~15초의 기간 범위입니다. H3는 videobao에서 프리미엄 계층입니다. 2K 생성이 1080p보다 의미 있게 비싸기 때문입니다.
세 가지 모드 모두 동일한 생성 흐름을 통해 출시됩니다. 참조 기반 모드는 샷 간 캐릭터 일관성, 제품 광고를 위한 음성 복제, 복잡한 다중 소스 편집을 가능하게 하는 것으로, 첫/마지막 프레임 경로와 함께 이미 videobao에서 라이브 상태입니다. 따라서 오늘 H3를 사용하든, 내일 이 모드 중 하나를 사용하든, 동일한 프롬프트-참조 패턴이 작동합니다.
로컬 배포, 리소스 및 다음에 읽을 내용
로컬 배포를 위해서는 멀티 GPU 박스가 필요합니다. 2026년 프론티어 표준에 비해 33B 밀집 트랜스포머는 작지만, 여전히 심각한 VRAM을 원합니다. 모델 카드는 정확한 추론 구성, vLLM 스타일의 서비스 설정, BF16 정밀도 가정에 대해 단계별로 설명합니다. 배포 대상에 커밋하기 전에 모델 카드를 처음부터 끝까지 읽으세요.
리소스: Hugging Face 모델 카드는 진리의 원천입니다 (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope는 중국 사용자를 위해 가중치를 미러링합니다 (modelscope.cn/models/MiniMax/MiniMax-H3). MiniMax 플랫폼 문서는 H3-2K Direct, H3-Context-IR, H3-Regenerate-2K에 대한 클라우드 API를 platform.minimaxi.com/docs/api-reference에서 다룹니다. 기초 연구실의 경우, hailuoai.com이 소비자 지향 진입 포인트입니다.
만약 여러분이 H3를 프로덕션 작업에만 사용하고 호스팅하지 않으려면, videobao 통합 패널이 가장 빠른 경로입니다. 만약 여러분이 로컬 배포의 완전한 제어를 원한다면, 모델 카드와 플랫폼 문서가 하루 안에 2K 파이프라인에 도달하게 해줄 것입니다.