videobao 正式上線 DouBao SeeDance 2.5MiniMax-H3 最新模型,註冊會員送 10 點數

立即訂閱
開發者指南

MiniMax H3 開發者指南:架構、三種使用模式及2K工作流程

MiniMax H3 的技術詳解:三階段管線、33B密集型H3-Base全能變壓器、T2VA與FL2VA及Ref2VA的比較,以及結合本地生成與雲端再生的完整2K再生工作流程。

By videobao 團隊8 分鐘閱讀
MiniMax H3 系統概覽圖,展示從上下文理解到基礎生成再到高解析度2K再生的三階段管線

MiniMax H3 是一個通用的全模態視頻生成系統。它將文本、圖像、視頻和音頻作為單一上下文,理解它們之間的關係,並生成一個2K、15秒、原生立體聲的視頻。其架構是用戶永遠不會直接看到的部分,但卻是解釋MiniMax過去十二個月內每一個決策的關鍵。本指南將帶您深入了解三階段管線、管線內部的33B密集型H3-Base全能變壓器、三種使用模式(T2VA、FL2VA、Ref2VA),以及結合本地生成與雲端再生的完整2K工作流程。

如果您不是機器學習從業者,您可以在使用模式部分之後停止,並使用videobao來完成其餘部分。如果您自己正在整合H3,則本文的其餘部分就是為您準備的。

三階段管線概覽

H3 不是一個單一的模型。它是三個模塊的組合:H3-Context-IR、H3-Base 和 H3-Regenerate-2K。管線從左側的原始多模態指令開始,並在右側生成一個帶有同步音頻的2K視頻。

H3-Context-IR 解析用戶向模型提供的任何內容。文本、圖像、視頻、音頻或任何組合。其輸出是一個結構化的上下文中間表示,下游階段可以消費。然後 H3-Base 從該表示生成一個帶有音頻的768p視頻,而 H3-Regenerate-2K 將768p輸出與原始上下文重新融合,並以2K分辨率重新渲染。再生步驟是使2K感覺清晰而不是簡單放大,因為模型在精煉時仍然擁有完整的原始上下文可供使用。

可以將其視為一個三步食譜:理解簡報,草擬一個低分辨率版本,然後在仍然可以看到簡報的情況下以全分辨率重新草擬。同樣的模式適用於電影製作和設計。H3 只是將其變成單一 API 調用。

MiniMax H3 三階段系統概覽圖:上下文理解為 H3-Context-IR 和結構化上下文表示提供輸入,基礎生成運行 H3-Base 以產生768p視頻,高分辨率再生運行 H3-Regenerate-2K 以產生帶有上下文指導的2K視頻
圖1:H3系統概覽 - 上下文理解為基礎生成提供輸入,基礎生成為2K再生提供輸入,上下文指導貫穿始終。

H3-Base 內部結構:33B 密集型,單流,聯合視頻-音頻去噪

H3-Base 是系統的核心。它是一個擁有330億參數的密集型變壓器,使用共享的 DiT 主幹網絡,擁有50層,單流去噪視頻和音頻潛在數據。

它有三個編碼器。H3 編碼器基於 Qwen3-VL-32B 的第50層,並生成文本標記。視覺 VAE 編碼器以 16x16x24 的分辨率運行,具有時間因果關係和 2x2x1 的分塊,生成視覺參考潛在數據。音頻 VAE 編碼器以 d=32、立體聲、32 kHz、40 Hz 標記的分辨率運行。四個標記流被打包成單一的上下文序列,並在生成側附加了噪聲視頻和噪聲音頻潛在數據。這個單一序列就是變壓器去噪的對象。

重要的架構選擇是在共享主幹網絡之上的特定於模態的組件。基礎 DiT 在視頻和音頻之間是共享的,這就是為什麼模型可以在沒有額外的對齊模塊的情況下保持兩者同步。兩個解碼器仍然是分開的:一個是將視頻潛在數據映射回 RGB 幀的視覺 VAE 解碼器,另一個是將音頻潛在數據映射成立體聲波形的音頻 VAE 解碼器。輸出是一對同步的視頻加立體聲音頻,生成於一次通過。

詳細的 H3-Base 架構圖,展示條件編碼(H3 編碼器來自 Qwen3-VL-32B,視覺 VAE 編碼器在 16x16x24,音頻 VAE 編碼器在 32 kHz 立體聲),打包的上下文序列,統一的生成與共享的 DiT 主幹網絡 x 50,以及使用視覺 VAE 解碼器和音頻 VAE 解碼器進行同步解碼以產生同步的視頻加立體聲音頻
圖2:H3-Base 內部結構 - 條件編碼,打包的上下文序列,統一的去噪,以及同步解碼。

三種使用模式:T2VA、FL2VA、Ref2VA

H3 發布了兩個開源檢查點,每個檢查點針對不同的使用模式進行了調整。兩者都產生 BF16 精度的 768p 視頻和音頻。區別在於它們接受的輸入。

H3-Base-FL2VA 是首尾幀模式。它接受文本加上零、一或兩個參考圖像。零圖像意味著文本到音頻視頻(T2VA)。一張圖像可以是首幀(從頭幀開始的 I2VA)或尾幀。兩張圖像意味著首尾幀插值。當用戶心中有一個明確的開始和結束,並希望模型填充中間動作時,使用 FL2VA。

H3-Base-Ref2VA 是參考驅動模式。它接受文本加上最多9張參考圖像、3個參考視頻片段(每個2-15秒,總長不超過15秒)和3個參考音頻片段(每個2-15秒,總長不超過15秒)。音頻必須與圖像或視頻配對 - 它不能單獨存在。所有輸入類型的總數上限為12個文件。Ref2VA 是用於角色一致性、語音克隆、場景傳輸和複雜編輯的模式,您希望重用現有片段。

H3 檢查點表格顯示 H3-Base FL2VA 支持 T2VA 和首/尾幀 I2VA,帶有可選的首/尾幈,以及 H3-Base Ref2VA 支持參考到音頻視頻,帶有文本加上參考圖像、視頻和音頻,兩者都以 BF16 精度生成視頻和音頻
圖3:兩個開源檢查點,兩種使用模式。FL2VA 用於首/尾幀工作流程;Ref2VA 用於參考驅動工作流程。

完整的2K工作流程:本地基礎加雲端再生

H3-Base 的768p輸出是本地、完全開源的途徑。2K途徑結合了本地 H3-Base 和兩個雲端 API:H3-Context-IR 和 H3-Regenerate-2K。兩者均由 MiniMax 託管。

三個階段與管線圖對應。首先,H3-Context-IR 接收用戶輸入並生成 H3-Base 和 H3-Regenerate-2K 將消費的擴展提示。其次,本地部署的 H3-Base 從該擴展提示渲染一個帶有音頻的768p視頻。第三,H3-Regenerate-2K 將768p結果作為 base_video,重新與擴展提示和原始用戶上下文結合,並以2K分辨率重新渲染。再生步驟是將原始語義上下文帶入高分辨率過程的原因,這就是為什麼2K輸出感覺像是一個改進而不是簡單的放大。

官方模型卡中發布了三個2K案例:T2VA(僅文本,全鏈)、I2VA(文本加首幀,全鏈)和 Ref2VA(文本加參考片段,全鏈)。對於每個案例,模型卡都提供了僅限本地的768p運行和通過 API 的2K運行,因此開發人員可以驗證本地路徑與雲端路徑在已知參考輸出上是否匹配。

對於生產:在示例代碼中,本地 H3-Base 輸出被 base64 編碼為數據 URL 並傳遞給 H3-Regenerate-2K。在實際部署中,您將768p視頻上傳到任何公共 URL 並將 URL 作為 base_video 傳遞。這是示例和生產之間唯一的重大管道變更。

規格速查表

輸出持續時間:4 到 15 秒。縱橫比:21:9、16:9、4:3、1:1、3:4、9:16。分辨率:默認768p;通過 H3-Regenerate-2K 達到2K。幀率:24 FPS。音頻:32 kHz 立體聲,原生於模型。

穩定的語言支持涵蓋11種語言:阿拉伯語、中文、英語、法語、德語、意大利語、日語、韓語、葡萄牙語、俄語和西班牙語。其他語言獲得部分支持。許可證:MiniMax H3 社區許可證(開源,但不像 Apache 那樣寬鬆 - 在其上發布商業產品之前請閱讀模型卡)。

在哪裡獲取權重:Hugging Face 在 huggingface.co/MiniMaxAI/MiniMax-H3 和 ModelScope 在 modelscope.cn/models/MiniMax/MiniMax-H3。完整的請求參數、H3-Context-IR 提示和再生代碼都在 Hugging Face 模型卡中。

在 videobao 上:什麼是實時的,什麼是接下來的

H3 今天在 videobao 上線。集成的使用模式覆蓋完整的 H3-Base 表面:文本到視頻;首幀、尾幀或首尾幀圖生視頻;以及參考驅動模式(最多 5 張參考圖,可選參考視頻和音頻片段)。挑選符合簡報的模式,輸入幀或參考,生成 2K 片段,並發佈。價格是每秒 7 個信用點用於原生 2K,持續時間範圍為 4 到 15 秒。H3 在 videobao 上是高級層,因為 2K 生成比 1080p 明顯更昂貴。

所有三種模式都在同一個生成流程下交付。參考驅動模式是解鎖跨鏡頭角色一致性、產品廣告的語音克隆和複雜多源編輯的關鍵,並且它已與首/尾幀路徑一起在 videobao 上線,因此無論您今天使用 H3 還是明天使用這些模式中的任何一種,同樣的提示加參考模式都有效。

本地部署、資源以及接下來要閱讀的內容

對於本地部署,您需要一個多GPU盒子。33B密集型變壓器按2026年前沿標準來看是小的,但它仍然需要嚴肅的VRAM。模型卡將逐步介紹確切的推理配置、vLLM風格的服務設置以及BF16精度假設。在您承諾部署目標之前,請完整閱讀模型卡。

資源:Hugging Face 模型卡是真相的來源(huggingface.co/MiniMaxAI/MiniMax-H3)。ModelScope 為中國用戶鏡像權重(modelscope.cn/models/MiniMax/MiniMax-H3)。MiniMax 平台文檔涵蓋了 H3-2K Direct、H3-Context-IR 和 H3-Regenerate-2K 的雲端 API,位於 platform.minimaxi.com/docs/api-reference。對於底層實驗室,hailuoai.com 是面向消費者的入口。

如果您只需要 H3 進行生產工作並且不想託管它,videobao 集成面板是最快的途徑。如果您想要本地部署的完全控制權,模型卡加上平台文檔將在一天內讓您進入2K管道。

Written by

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Related Posts

← 返回全部文章
MiniMax H3 開發者指南:架構、三種使用模式及2K工作流程 - videobao