MiniMax H3, 330억 개의 매개변수로 오픈 소스화: 비디오 모델이 생산 라인을 넘다
MiniMax는 7월 마지막 날에 330억 개의 매개변수를 가진 H3 비디오 모델을 출시하고 SOTA를 달성했습니다. 이 글에서는 이 모델이 실제로 무엇을 하는지, 왜 330억 개의 매개변수가 헤드라인인지, 그리고 videobao 사용자들이 오늘 이 모델을 어떻게 활용할 수 있는지에 대해 설명합니다.
7월의 마지막 날, MiniMax는 주요 비디오 벤치마크에서 SOTA를 달성한 330억 개의 매개변수를 가진 비디오 모델 H3를 출시했습니다. 같은 날, 모델의 가중치가 오픈 소스로 공개되었습니다. 이 이야기는 단지 다른 연구소가 ByteDance의 Seedance를 따라잡았다는 것이 아닙니다. 이 이야기는 비디오 생성이 '멋진 데모'에서 '생산 도구'로의 전환점을 넘었고, MiniMax가 그 순간을 공개하기로 선택했다는 것입니다.
videobao에서, 이것은 여러분이 한 세션에서 할 수 있는 것을 바꿉니다. H3의 분석, '왜 330억 개의 매개변수가 헤드라인인가'라는 주장, 그리고 다음 프로젝트에서 이 세대의 모델을 어떻게 사용할 수 있는지에 대한 내용을 계속해서 읽어보세요.
MiniMax H3가 실제로 하는 일
H3는 기본적인 다중 모달성 입력과 교차 모달 정밀 편집이라는 두 가지 아이디어를 중심으로 구축되었습니다. 텍스트, 이미지, 오디오, 비디오 모두 같은 프롬프트에서 참조로 사용될 수 있습니다. 즉, 모델에 짧은 클립을 제공하고, 텍스트 지침으로 한 캐릭터를 가리키고, 그 캐릭터만 교체하면서 주변의 모든 것은 그대로 유지할 수 있습니다.
MiniMax의 초기 데모는 제작 팀이 실제로 필요로 하는 장면에 중점을 둡니다: UI 디자인 워크스루, 브랜드 광고, MV 스타일의 컷, 게임 시네마틱, AR 및 전환 효과, 그리고 이커머스 트라이온. 이 모델의 제안은 'AI가 비디오를 만들 수 있다'가 아니라 'AI가 여러분이 필요로 하는 특정 비디오를, 특정 요소만 변경하여 만들 수 있다'는 것입니다.
H3는 또한 Hailuo-02 아키텍처를 기반으로 한 새로운 토크나이저를 사용하여 기본적으로 2K를 생성합니다. 압축 효율이 더 높고, 학습 및 추론 비용이 낮으며, 모델의 크기가 충분히 작아(330억 개의 매개변수) 실제 제작 팀이 이를 호스팅할 수 있습니다.
왜 330억 개의 매개변수가 SOTA보다 더 큰 뉴스인가
SOTA는 헤드라인입니다. 330억 개의 매개변수는 실제 뉴스입니다. 2025년의 대부분의 SOTA 비디오 모델은 700억 개 이상의 매개변수를 가지고 있었고, 이는 심각한 컴퓨팅 비용, 느린 반복, 그리고 폐쇄형 API를 의미했습니다. 330억 개의 매개변수를 가진 SOTA 모델은 세 가지 의미를 의미합니다.
첫째, 학습이 더 접근하기 쉽습니다. 작년에 최첨단 비디오 모델을 학습할 수 없었던 팀이 이제는 파인튜닝이나 증류할 수 있습니다. 둘째, 추론 비용이 저렴합니다. videobao에서의 생성당 비용은 상류 비용에 의해 형성되며, 더 작은 모델은 그 수치를 낮춥니다. 셋째, 배포가 현실적입니다. 330억 개의 매개변수를 가진 비디오 모델을 맞춤형 데이터 센터 구축 없이도 실제 제작 하드웨어에서 실행할 수 있습니다.
즉, 330억 개의 매개변수에서 SOTA는 연구 결과를 제품으로 전환시킵니다. 효율적인 오픈 소스 모델이 GPT-3 품질 기준을 훨씬 작은 크기에서 달성했을 때 언어 모델에서 같은 일이 일어났습니다. 비디오도 같은 전환을 겪고 있으며, 다만 12개월 뒤쳐져 있습니다.
데모 트릭에서 생산 도구로
일 년 전, AI 비디오는 토끼가 일관성 있는지를 기준으로 판단되었습니다. 전체 분야는 프롬프트 수준의 일관성을 최적화하고 있었고, 그것조차도 어려웠습니다. 2026년의 기준은 다릅니다. Veo 3.1, Kling 2.5, Sora 2, 그리고 이제 H3와 같은 모델들은 단순히 생성하는 것이 아닙니다. 그들은 배경을 지우지 않고 캐릭터를 정밀하게 교체합니다. 그들은 단순히 오디오를 포함하는 것이 아닙니다. Veo 3.1은 48 kHz의 기본 오디오를 제공하며, 대부분의 주류 모델들은 이제 한 번의 통과로 립싱크된 비디오를 출력합니다.
사용 사례도 기능과 함께 이동했습니다. 작년이 '이 멋진 효과를 봐라'였다면, 올해는 TVC, 브랜드 광고, 제품 데모입니다. '모델을 자랑하다'에서 '모델을 사용하여 캠페인을 출시하다'로의 전환은 업계가 막 넘은 선입니다.
만약 여러분이 2025년에 AI 비디오를 시도하고 실망했다면, 2026년의 모델들은 다른 제품입니다. videobao에서 여러분은 이제 Hailuo 02, Veo 3.1, Kling 2.5, 그리고 Sora 2를 같은 세션에서 사용하고, 그 중에서 브리핑에 맞는 것을 선택할 수 있습니다.
모델이 오픈 소스가 되면 집계가 승리하는 이유
MiniMax는 SOTA 성능과 비용 우위를 가지고 있음에도 불구하고 H3를 오픈 소스로 공개하기로 선택했습니다. 이는 직관에 반하는 것처럼 보이지만, 오픈 소스 플레이는 심각한 비디오 연구소들에게 표준이 되어가고 있습니다. 이유는 간단합니다: 비디오 모델은 어디에나 존재하게 될 것이고, 약간 더 나은 버전을 폐쇄형 벤더로 제공하는 것보다, 모든 것을 비교할 수 있도록 하는 플랫폼이 되는 것이 더 가치가 있습니다.
LTX-2.3을 봐보세요. Hugging Face에서 1800만 다운로드 이상을 기록한 해외 오픈 소스 비디오 모델입니다. 1800만. 오픈 소스 비디오 에코시스템은 실재하고, 활발하며, 대부분의 새로운 제품 작업이 일어나는 곳입니다. videobao와 같은 집계 플랫폼은 이 위에 위치합니다: 우리는 하나의 로그인, 하나의 크레딧 잔액 뒤에 오픈 소스, 폐쇄 소스, 중국 및 서양 모델을 패키징하므로, 여러분은 선택할 필요가 없습니다.
이는 최종 사용자를 위한 '오픈 소스 또는 폐쇄 소스' 질문에 대한 실질적인 해답입니다. 여러분은 선택하지 않습니다. 여러분은 플랫폼을 사용하고, 플랫폼이 작업을 위한 올바른 모델을 선택합니다. 때로는 MiniMax H3, 지금 videobao에서 사용 가능합니다. 때로는 시네마틱 샷을 위한 Veo 3.1입니다. 때로는 예산이 빠듯한 소셜 클립을 위한 Kling 2.5입니다. 중요한 것은 플랫폼이 모든 것을 할 수 있다는 것입니다.
오늘 videobao에서 H3를 사용하는 방법
H3는 이제 videobao에서 사용 가능합니다. 기본 2K 캔버스에서 교차 모달 정밀 편집을 원할 때 선택하세요. 패턴은 다음과 같습니다: 참조 이미지 또는 짧은 클립을 업로드하고, 변경하려는 요소를 명시하는 프롬프트를 작성하면, H3는 나머지 장면을 픽셀 단위로 안정적으로 유지합니다. Hailuo 02, Kling 2.5, Veo 3.1 모두 같은 세션에서 사용 가능하며, 다른 가격 또는 해상도 계층에서 동일한 워크플로를 원할 때 사용할 수 있습니다.
videobao에서 H3는 기본 2K에 대해 초당 7 크레딧으로 실행되며, 4-15초의 지속 시간 범위를 가집니다. 통합된 사용 모드는 텍스트-비디오, 첫 번째 프레임, 마지막 프레임 또는 첫+마지막 프레임 이미지-비디오, 그리고 최대 5개의 참조 이미지와 선택적 참조 비디오 및 오디오 클립을 사용하는 참조 기반 모드입니다. 교차 모달 정밀 편집이 헤드라인 사용 사례입니다.Hailuo 02는 동일한 워크플로우에 대한 저렴한 대안입니다;Veo 3.1은 4K가 필요할 때 올바른 선택입니다;Kling 2.5는 예산이 빠듯할 때 기본 오디오 트랙이 내장된 것을 원할 때 올바른 선택입니다;Sora 2는 긴 다중 샷 스토리텔링을 위한 올바른 선택입니다.H3는 videobao에서 프리미엄 계층 전용입니다, 2K 생성이 1080p보다 실질적으로 비싸기 때문입니다.
330억 개의 오픈 소스 파동은 다음 두 분기 동안 나머지 제품 라인업의 가격 하한선을 계속 낮출 것입니다. 올바른 움직임은 H3가 가장 최신의 SOTA이고 다른 모델들이 그 아래에서 압축되는 동안 지금 교차 모달 편집 워크플로를 고정하는 것입니다.