videobao 正式リリース DouBao SeeDance 2.5MiniMax-H3 — 登録で 10 クレジット無料

今すぐ登録
開発者ガイド

MiniMax H3 開発者ガイド: アーキテクチャ、3つの利用モード、および2Kワークフロー

MiniMax H3の技術的な詳細解説: 3段階のパイプライン、33Bの密なH3-Base Omni Transformer、T2VA vs FL2VA vs Ref2VA、およびローカルとクラウドを組み合わせた完全な2K再生ワークフロー。

By videobao チーム8 分読み
MiniMax H3システムの概要図で、コンテキスト理解からベース生成を経て高解像度の2K再生までの3段階のパイプラインを示しています

MiniMax H3は、ユニバーサルなフルモダリティビデオ生成システムです。テキスト、画像、ビデオ、オーディオを単一のコンテキストとして受け取り、それらの関係を解釈し、2K、15秒、ネイティブステレオオーディオのビデオを生成します。アーキテクチャはほとんどのユーザーが目にすることのない部分ですが、MiniMaxが過去12ヶ月間に行ったすべての決定を説明する部分です。このガイドでは、3段階のパイプライン、その中にある33Bの密なH3-Base Omni Transformer、3つの利用モード(T2VA、FL2VA、Ref2VA)、およびローカル生成とクラウド再生を組み合わせた完全な2Kワークフローを解説します。

もしあなたが機械学習の実践者でないなら、利用モードのセクションの後で止めて、videobaoを他の部分に使用することができます。もしあなたが自分でH3を統合しているなら、この記事の残りの部分はあなたのためになります。

3段階のパイプラインを一目で見る

H3は1つのモデルではありません。3つのモジュールが接続されています:H3-Context-IR、H3-Base、およびH3-Regenerate-2K。パイプラインは左側の生のマルチモーダル指示を受け取り、右側で同期したオーディオ付きの2Kビデオを生成します。

H3-Context-IRは、モデルに投げかけられるユーザーの入力を解析します。テキスト、画像、ビデオ、オーディオ、またはそれらの任意の組み合わせが可能です。出力は、下流のステージが消費できる構造化されたコンテキスト中間表現です。次に、H3-Baseはその表現から768pのビデオとオーディオを生成し、H3-Regenerate-2Kは768pの出力を取り戻し、元のコンテキストと再結合し、2Kで再レンダリングします。再生ステップは、モデルが細部を調整する際に完全な元のコンテキストを引き続き利用できるため、2Kが鮮明に感じられる理由です。

これを3段階のレシピと考えてください。要約を理解し、低解像度のバージョンを下書きし、要約を見ながらフル解像度で再下書きします。このパターンは、映画制作やデザインでも有効です。H3はそれを単一のAPI呼び出しにします。

MiniMax H3の3段階システム概要図: コンテキスト理解がH3-Context-IRと構造化されたコンテキスト表現をフィードし、ベース生成がH3-Baseを実行して768pビデオを生成し、高解像度再生がH3-Regenerate-2Kを実行してコンテキストガイダンスによる2Kビデオを生成
図1: H3システム概要 - コンテキスト理解がベース生成をフィードし、それが2K再生をフィードし、コンテキストガイダンスが最後まで引き継がれる。

H3-Baseの中身を詳しく見る: 33B密度、1ストリーム、ビデオ-オーディオ協調ノイズ除去

H3-Baseはシステムの中心です。500層のパラメータを持つ33億の密なトランスフォーマーで、単一のストリームでビデオとオーディオの潜在変数をノイズ除去し、共有のDiTバックボーンを使用します。

3つのエンコーダーがそれを供給します。H3エンコーダーはQwen3-VL-32Bをレイヤ50に構築し、テキストトークンを生成します。ビジュアルVAEエンコーダーは16x16x24で時間的因果関係を持ち、2x2x1のパッチ化を行い、ビジュアル参照潜在変数を生成します。オーディオVAEエンコーダーはd=32、ステレオ、32 kHz、40 Hzトークンで動作します。4つのトークンストリームは単一のコンテキスト内シーケンスにパックされ、ノイズの多いビデオとノイズの多いオーディオ潜在変数が生成側に追加されます。その単一のシーケンスがトランスフォーマーがノイズ除去するものです。

重要なアーキテクチャの選択は、共有バックボーン上に特定のモダリティコンポーネントがあることです。ベースのDiTはビデオとオーディオで共有されているため、モデルはこの2つを同期させることができます。2つのデコーダーはまだ別々です:ビデオ潜在変数をRGBフレームに戻すビジュアルVAEデコーダーと、オーディオ潜在変数をステレオ波形にマップするオーディオVAEデコーダーです。出力は同期したビデオとステレオオーディオのペアで、1回の通過で生成されます。

詳細なH3-Baseアーキテクチャ図で、条件エンコーディング(H3エンコーダーはQwen3-VL-32Bから、ビジュアルVAEエンコーダーは16x16x24、オーディオVAEエンコーダーは32 kHzステレオ)、パックされたコンテキスト内シーケンス、統一された生成(33B H3 Omniトランスフォーマーと共有DiTバックボーンx 50)、およびデコード(ビジュアルVAEデコーダーとオーディオVAEデコーダーが同期したビデオとステレオオーディオを生成)
図2: H3-Baseの内部 - 条件エンコーディング、パックされたコンテキスト内シーケンス、統一されたノイズ除去、および同期したデコード。

3つの利用モード: T2VA、FL2VA、Ref2VA

H3は2つのオープンソースのチェックポイントをリリースしており、それぞれが異なる利用モードに合わせて調整されています。どちらのチェックポイントもBF16精度で768pのビデオとオーディオを生成します。違いは入力として受け取るものです。

H3-Base-FL2VAは最初の/最後のフレームモードです。テキストと0、1、または2つの参照画像を受け入れます。画像が0の場合はテキストからオーディオビデオ(T2VA)です。1つの画像は先頭フレーム(ヘッドフレームからのI2VA)または末尾フレームです。2つの画像は最初と最後のフレームの補間です。ユーザーが明確な開始と終了を考えていて、モデルにその間の動きを埋めてほしいときにFL2VAを使用します。

H3-Base-Ref2VAは参照駆動モードです。テキストと最大9つの参照画像、最大3つの参照ビデオクリップ(それぞれ2〜15秒、合計で15秒を超えない)、および最大3つの参照オーディオクリップ(それぞれ2〜15秒、合計で15秒を超えない)を受け入れます。オーディオは画像またはビデオとペアになっている必要があります。単独では使用できません。すべての入力タイプの合計は12ファイルに制限されています。Ref2VAは、キャラクターの一貫性、ボイスクローニング、シーン転送、および既存の映像を再利用したい複雑な編集のためのモードです。

H3チェックポイントテーブルで、H3-Base FL2VAがT2VAと最初の/最後のフレームI2VAをサポートし、オプションで最初の/最後のフレームがあり、H3-Base Ref2VAがテキストと参照画像、ビデオ、オーディオによる参照からオーディオビデオをサポートし、両方ともBF16精度でビデオとオーディオを生成
図3: 2つのオープンソースのチェックポイント、2つの利用モード。FL2VAは最初の/最後のフレームワークフローのためのもので、Ref2VAは参照駆動ワークフローのためのものです。

完全な2Kワークフロー: ローカルベースとクラウド再生

H3-Baseからの768pの出力は、ローカルで完全にオープンソースのパスです。2Kパスは、ローカルのH3-Baseと2つのクラウドAPI(H3-Context-IRとH3-Regenerate-2K)を組み合わせたものです。どちらもMiniMaxがホストしています。

3つのステージはパイプライン図と一致します。まず、H3-Context-IRがユーザーの入力を取り、拡張されたプロンプトを生成し、H3-BaseとH3-Regenerate-2Kが消費します。次に、ローカルに展開されたH3-Baseがその拡張プロンプトから768pのビデオとオーディオをレンダリングします。次に、H3-Regenerate-2Kが768pの結果をbase_videoとして取り戻し、それを拡張プロンプトと元のユーザーコンテキストと再結合し、2Kで再レンダリングします。再生ステップは、元のセマンティックコンテキストをハイレゾパスに持ち込むものであり、2K出力が改良されたように感じられる理由です。

公式のモデルカードには3つの2Kケースが同梱されています:T2VA(テキストのみ、完全チェーン)、I2VA(テキストと最初のフレーム、完全チェーン)、およびRef2VA(テキストと参照クリップ、完全チェーン)。各ケースについて、モデルカードはローカル専用の768p実行とAPIを介した2K実行の両方を提供しているため、開発者はローカルパスが既知の参照出力でクラウドパスと一致することを確認できます。

実運用の場合:サンプルコードでは、ローカルのH3-Base出力をData URLとしてbase64エンコードし、H3-Regenerate-2Kに渡します。実際の展開では、768pビデオを任意の公開URLにアップロードし、base_videoとしてURLを渡します。これがサンプルと運用の間の唯一の意味のある配管の変更です。

仕様チートシート

出力期間: 4〜15秒。縦横比: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16。解像度: デフォルトで768p; 2KはH3-Regenerate-2K経由。フレームレート: 24 FPS。オーディオ: 32 kHzステレオ、モデルにネイティブ。

安定した言語サポートは11言語をカバーしています:アラビア語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語。その他の言語は部分的なサポートを受けます。ライセンス: MiniMax H3コミュニティライセンス(オープンソースですが、Apacheの意味での許可型ではありません - 商用製品に搭載する前にモデルカードをお読みください)。

重みの入手先: Hugging Face(huggingface.co/MiniMaxAI/MiniMax-H3)およびModelScope(modelscope.cn/models/MiniMax/MiniMax-H3)。完全なリクエストパラメータ、H3-Context-IRプロンプト、および再生コードは、Hugging Faceのモデルカードにあります。

videobaoでは: 何がライブで、何が次にくるか

H3は本日videobaoでライブです。統合された利用モードは、H3-Base全体をカバーします:テキストからビデオ;最初/最後/最初+最後のフレームからの画像からビデオ;および最大5枚の参照画像と任意の参照ビデオおよびオーディオクリップを含む参照駆動モード。ブリーフに合うモードを選び、フレームまたは参照を投入し、2Kクリップを生成して出荷します。価格はネイティブ2Kで1秒あたり7クレジット、4〜15秒の期間範囲です。H3はvideobaoではプレミアム階層にあります。2K生成は1080pよりもはるかに高いためです。

3つのモードはすべて同じ生成フローで出荷されます。参照駆動モードは、ショット間のキャラクター一貫性、製品広告のボイスクローニング、複雑なマルチソース編集を可能にするもので、最初/最後のフレームパスと共にすでにvideobaoでライブです。したがって、今日H3を使用しているか、これらのモードのいずれかを使用しているかに関わらず、同じプロンプト+参照のパターンが機能します。

ローカル展開、リソース、および次に読むべきもの

ローカル展開の場合、マルチGPUボックスが必要です。2026年のフロンティア標準では33Bの密なトランスフォーマーは小さいですが、それでも深刻なVRAMが必要です。モデルカードは正確な推論構成、vLLMスタイルのサービング設定、およびBF16精度の仮定について説明します。展開ターゲットにコミットする前に、モデルカードを一通りお読みください。

リソース:Hugging Faceのモデルカードが真実の源です(huggingface.co/MiniMaxAI/MiniMax-H3)。ModelScopeは中国のユーザーのために重みをミラーリングしています(modelscope.cn/models/MiniMax/MiniMax-H3)。MiniMaxプラットフォームのドキュメントは、H3-2K Direct、H3-Context-IR、およびH3-Regenerate-2KのクラウドAPIをplatform.minimaxi.com/docs/api-referenceでカバーしています。基礎となるラボについては、hailuoai.comが消費者向けのエントリーポイントです。

H3を実制作のためだけに必要とし、それをホストしたくない場合は、videobao生成パネルが最速のパスです。完全なローカル展開の制御が必要な場合は、モデルカードとプラットフォームドキュメントで1日で2Kパイプラインに到達できます。

Written by

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Related Posts

← 記事一覧に戻る
MiniMax H3 開発者ガイド: アーキテクチャ、3つの利用モード、および2Kワークフロー - videobao