videobao เปิดตัวอย่างเป็นทางการ DouBao SeeDance 2.5 และ MiniMax-H3 — สมัครรับ 10 เครดิต

สมัครเลย
คู่มือนักพัฒนา

คู่มือนักพัฒนา MiniMax H3: สถาปัตยกรรม, 3 รูปแบบการใช้งาน, และลำดับการทำงาน 2K

การแนะนำทางเทคนิคของ MiniMax H3: ทางเดินแบบสามขั้นตอน, โทรฟอร์มเมอร์ H3-Base Omni ที่มีความหนาแน่น 33B, T2VA กับ FL2VA กับ Ref2VA, และลำดับการทำงานการสร้างใหม่ 2K ที่เต็มรูปแบบพร้อมส่วนท้องถิ่นและคลาวด์.

โดย ทีม videobaoอ่านใน 8 นาที
แผนภาพภาพรวมของระบบ MiniMax H3 ที่แสดงทางเดินแบบสามขั้นตอนจากการเข้าใจบริบทผ่านการสร้างฐานไปยังการสร้างใหม่ 2K ความละเอียดสูง

MiniMax H3 เป็นระบบการสร้างวิดีโอที่มีความสามารถในการรองรับการ์ดทุกประเภท. ระบบนี้รับข้อมูลประเภทข้อความ, รูปภาพ, วิดีโอ, และเสียงเป็นบริบทเดียว, เข้าใจความสัมพันธ์ระหว่างพวกมัน, และสร้างวิดีโอความละเอียด 2K, ความยาว 15 วินาที, พร้อมเสียงสเตอริโอ. สถาปัตยกรรมเป็นส่วนที่ผู้ใช้ส่วนใหญ่ไม่เคยเห็น แต่เป็นส่วนที่อธิบายการตัดสินใจทุกอย่างที่ MiniMax ทำในช่วง 12 เดือนที่ผ่านมา. คู่มือนี้จะแนะนำทางเดินแบบสามขั้นตอน, โทรฟอร์มเมอร์ H3-Base Omni ที่มีความหนาแน่น 33B ภายใน, สามรูปแบบการใช้งาน (T2VA, FL2VA, Ref2VA), และลำดับการทำงาน 2K ที่รวมการสร้างท้องถิ่นและการสร้างใหม่ในคลาวด์.

หากคุณไม่ใช่นักปฏิบัติงานเรียนรู้ของเครื่อง, คุณสามารถหยุดหลังจากส่วนของรูปแบบการใช้งานและใช้ videobao สำหรับส่วนที่เหลือ. หากคุณกำลังรวม H3 เอง, ส่วนที่เหลือของบทความนี้เป็นสำหรับคุณ.

ทางเดินแบบสามขั้นตอนในแง่การช่วยเหลือ

H3 ไม่ใช่แบบจำลองเดียว. มันเป็นสามโมดูลที่เชื่อมต่อกัน: H3-Context-IR, H3-Base, และ H3-Regenerate-2K. ทางเดินนี้รับคำสั่งพหุมิติดิบทางซ้ายและสร้างวิดีโอ 2K พร้อมเสียงที่ซิงโครไนซ์ทางขวา.

H3-Context-IR วิเคราะห์สิ่งที่ผู้ใช้ใส่ให้แบบจำลอง. ข้อความ, รูปภาพ, วิดีโอ, เสียง, หรือการผสมผสานใด ๆ. ผลลัพธ์คือการแทนที่บริบทที่มีโครงสร้างที่ขั้นตอนต่อไปสามารถใช้ได้. H3-Base จากนั้นจะสร้างวิดีโอ 768p พร้อมเสียงจากการแทนที่นั้น, และ H3-Regenerate-2K จะรับผลลัพธ์ 768p, รวมกับบริบทต้นฉบับ, และแสดงใหม่ที่ 2K. ขั้นตอนการสร้างใหม่คือสิ่งที่ทำให้ 2K รู้สึกแตกต่างจากการปรับขนาด, เพราะแบบจำลองยังคงมีบริบทต้นฉบับเต็มรูปแบบในการใช้ในขณะที่ปรับแต่ง.

นึกถึงว่าเป็นสูตรที่มีสามขั้นตอน: เข้าใจสรุป, ร่างรุ่นต้นแบบที่ความละเอียดต่ำ, จากนั้นร่างใหม่ที่ความละเอียดเต็มรูปแบบพร้อมสรุปที่ยังคงอยู่ในมุมมอง. รูปแบบเดียวกันนี้ใช้ได้ในการผลิตภาพยนตร์และการออกแบบ. H3 ก็แค่ทำให้เป็นการเรียก API เดียว.

แผนภาพภาพรวมของระบบ MiniMax H3 ที่แสดงทางเดินแบบสามขั้นตอนจากการเข้าใจบริบทผ่านการสร้างฐานไปยังการสร้างใหม่ 2K ความละเอียดสูง
รูปภาพ 1: ภาพรวมของระบบ H3 - การเข้าใจบริบทผ่านการสร้างฐาน, ซึ่งผ่านการสร้าง 2K, พร้อมการแนะนำบริบทที่ถ่ายทอดไปตลอด.

ใน H3-Base: 33B ความหนาแน่น, ทางเดียว, การกำจัดความรบกวนวิดีโอ-เสียงร่วม

H3-Base เป็นหัวใจของระบบ. เป็นโทรฟอร์มเมอร์ที่มีความหนาแน่น 33 พันล้านพารามิเตอร์ที่กำจัดความรบกวนของวิดีโอและเสียง latents ในทางเดียว, โดยใช้ backbone DiT ที่แชร์กัน 50 ชั้น.

สามตัวเข้ารหัสเลี้ยงมัน. H3 Encoder สร้างขึ้นจาก Qwen3-VL-32B ที่ชั้น 50 และสร้างโทเค็นข้อความ. Visual VAE Encoder ทำงานที่ 16x16x24 พร้อมความสัมพันธ์เชิงเวลาและ patchify 2x2x1, สร้าง latents การอ้างอิงทางกายภาพ. Audio VAE Encoder ทำงานที่ d=32, สเตอริโอ, 32 kHz, 40 Hz โทเค็น. สี่ทางเดินโทเค็นถูกบรรจุเข้าในลำดับในบริบทเดียว, พร้อม latents วิดีโอและเสียงที่มีความรบกวนที่เพิ่มเติมในด้านการสร้าง. ลำดับเดียวนั้นคือสิ่งที่โทรฟอร์มเมอร์กำจัดความรบกวน.

การตัดสินใจด้านสถาปัตยกรรมที่สำคัญคือส่วนประกอบที่เฉพาะตัวของมิติที่อยู่เหนือ backbone ที่แชร์. DiT พื้นฐานถูกแชร์ระหว่างวิดีโอและเสียง, ซึ่งเป็นเหตุผลที่แบบจำลองสามารถรักษาสองสิ่งนี้ในการซิงโครไนซ์โดยไม่ต้องมีโมดูลการปรับแต่งเพิ่มเติม. สองตัวถอดรหัสยังคงแยกออก: Visual VAE Decoder ที่แปลง latents วิดีโอกลับไปเป็นเฟรม RGB, และ Audio VAE Decoder ที่แปลง latents เสียงเป็นคลื่นเสียงสเตอริโอ. ผลลัพธ์คือคู่วิดีโอ-สเตอริโอที่ซิงโครไนซ์, สร้างในการผ่านเดียว.

แผนภาพสถาปัตยกรรม H3-Base ที่ละเอียดซึ่งแสดงการเข้ารหัสเงื่อนไข (H3 Encoder จาก Qwen3-VL-32B, Visual VAE Encoder ที่ 16x16x24, Audio VAE Encoder ที่ 32 kHz สเตอริโอ), ลำดับในบริบทที่บรรจุ, การสร้างร่วมกันที่ 33B H3 Omni Transformer และ backbone DiT ที่แชร์ x 50, และการถอดรหัสด้วย Visual VAE Decoder และ Audio VAE Decoder ที่สร้างวิดีโอและสเตอริโอที่ซิงโครไนซ์
รูปภาพ 2: H3-Base ภายใน - การเข้ารหัสเงื่อนไข, ลำดับในบริบทที่บรรจุ, การกำจัดความรบกวนร่วม, และการถอดรหัสที่ซิงโครไนซ์.

สามรูปแบบการใช้งาน: T2VA, FL2VA, Ref2VA

H3 ส่งมอบสอง checkpoint ที่เปิดใช้งานแบบ open-source, แต่ละตัวถูกปรับแต่งสำหรับรูปแบบการใช้งานที่แตกต่างกัน. ทั้งสองสร้างวิดีโอ 768p พร้อมเสียงในความละเอียด BF16. ความแตกต่างคือสิ่งที่พวกมันยอมรับเป็น input.

H3-Base-FL2VA เป็นรูปแบบแรก/สุดท้ายของเฟรม. มันยอมรับข้อความและภาพอ้างอิงศูนย์, หนึ่ง, หรือสองภาพอ้างอิง. ศูนย์ภาพหมายถึงข้อความ-เสียง-วิดีโอ (T2VA). ภาพเดียวสามารถเป็นเฟรมแรก (I2VA จากเฟรมหัว) หรือเฟรมสุดท้าย. สองภาพหมายถึงการแทรกอินเตอร์โพลาเชชันแรก/สุดท้าย. ใช้ FL2VA เมื่อผู้ใช้มีจุดเริ่มต้นและจุดสุดท้ายที่ชัดเจนและต้องการให้แบบจำลองเติมใน motion ระหว่างกลาง.

H3-Base-Ref2VA เป็นรูปแบบที่ขับเคลื่อนด้วยอ้างอิง. มันยอมรับข้อความและภาพอ้างอิงสูงสุด 9 ภาพ, วิดีโออ้างอิงสูงสุด 3 คลิป (แต่ละคลิป 2-15 วินาที, รวมไม่เกิน 15 วินาที), และเสียงอ้างอิงสูงสุด 3 คลิป (แต่ละคลิป 2-15 วินาที, รวมไม่เกิน 15 วินาที). เสียงต้องเป็นคู่กับภาพหรือวิดีโอ - มันไม่สามารถยืนคนเดียวได้. ทั้งหมดรวมกันทุกประเภท input จำกัดที่ 12 ไฟล์. Ref2VA เป็นรูปแบบสำหรับความสม่ำเสมอของตัวละคร, การโกนเสียง, การถ่ายโอนฉาก, และการแก้ไขที่ซับซ้อนที่คุณต้องการนำชิ้นส่วนของ footage ที่มีอยู่.

ตาราง checkpoint H3 ที่แสดง H3-Base FL2VA สนับสนุน T2VA และ I2VA แรก/สุดท้าย พร้อมเฟรมแรก/สุดท้ายที่เลือก, และ H3-Base Ref2VA สนับสนุนการอ้างอิง-เสียง-วิดีโอ พร้อมข้อความและภาพอ้างอิง, วิดีโอ, และเสียง, ทั้งสองสร้างวิดีโอและเสียงในความละเอียด BF16
รูปภาพ 3: สอง checkpoint แบบ open-source, สองรูปแบบการใช้งาน. FL2VA สำหรับลำดับการทำงานแรก/สุดท้าย; Ref2VA สำหรับลำดับการทำงานที่ขับเคลื่อนด้วยอ้างอิง.

ลำดับการทำงาน 2K ที่เต็มรูปแบบ: ฐานท้องถิ่นพร้อมการสร้างใหม่ในคลาวด์

ผลลัพธ์ 768p จาก H3-Base เป็นทางท้องถิ่น, ทางที่เปิดใช้งานแบบ open-source. ทาง 2K รวม H3-Base ท้องถิ่นกับ API คลาวด์สองตัว: H3-Context-IR และ H3-Regenerate-2K. ทั้งสองโมดูลโฮสต์โดย MiniMax.

สามขั้นตอนตรงกับแผนภาพทางเดิน. ก่อนอื่น, H3-Context-IR รับ input ของผู้ใช้และสร้าง prompt ที่ H3-Base และ H3-Regenerate-2K จะใช้. ที่สอง, H3-Base ที่ปรับใช้ท้องถิ่นแสดงวิดีโอ 768p พร้อมเสียงจาก prompt ที่ขยายนั้น. ที่สาม, H3-Regenerate-2K รับผลลัพธ์ 768p เป็น base_video, รวมกับ prompt ที่ขยายและบริบทต้นฉบับของผู้ใช้, และแสดงใหม่ที่ 2K. ขั้นตอนการสร้างใหม่คือสิ่งที่ถ่ายทอดบริบทเดิมไปในการผ่านความละเอียดสูง, ซึ่งเป็นเหตุผลที่ผลลัพธ์ 2K รู้สึกเหมือนการปรับแต่งมากกว่าการปรับขนาด.

สามกรณี 2K ที่ถ่ายทอดใน official model card: T2VA (ข้อความเท่านั้น, ทางที่เต็มรูปแบบ), I2VA (ข้อความพร้อมเฟรมแรก, ทางที่เต็มรูปแบบ), และ Ref2VA (ข้อความพร้อม clips อ้างอิง, ทางที่เต็มรูปแบบ). สำหรับแต่ละกรณี model card มีทั้งการทำงาน 768p ท้องถิ่นเท่านั้นและการทำงาน 2K ผ่าน API, ดังนั้นนักพัฒนาสามารถตรวจสอบว่าทางท้องถิ่นตรงกับทางคลาวด์ใน output ที่รู้จัก.

สำหรับการผลิต: ใน code ตัวอย่าง, output H3-Base ท้องถิ่นถูก base64-encode เป็น Data URL และผ่านไปให้ H3-Regenerate-2K. ในการปรับใช้จริง, คุณอัปโหลดวิดีโอ 768p ไปยัง URL สาธารณะใด ๆ และผ่าน URL นั้นเป็น base_video แทน. นั่นคือการเปลี่ยนแปลงที่มีความหมายเพียงอย่างเดียวระหว่างตัวอย่างและการปรับใช้.

Spec Cheat Sheet

Output duration: 4 to 15 seconds. Aspect ratios: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Resolution: 768p by default; 2K via H3-Regenerate-2K. Frame rate: 24 FPS. Audio: 32 kHz stereo, native to the model.

Stable language support covers 11 languages: Arabic, Chinese, English, French, German, Italian, Japanese, Korean, Portuguese, Russian, and Spanish. Other languages get partial support. License: MiniMax H3 Community License (open-source, but not permissive in the Apache sense - read the model card before shipping a commercial product on top of it).

Where to get the weights: Hugging Face at huggingface.co/MiniMaxAI/MiniMax-H3 and ModelScope at modelscope.cn/models/MiniMax/MiniMax-H3. The full request parameters, the H3-Context-IR prompt, and the regeneration code are in the Hugging Face model card.

On videobao: What Is Live, What Is Next

H3 ใช้งานจริงบน videobao วันนี้ โหมดการใช้งานแบบบูรณาการครอบคลุมพื้นผิว H3-Base ทั้งหมด: text-to-video; ภาพจากเฟรมแรก, เฟรมสุดท้าย หรือเฟรมแรก+สุดท้ายไปยังวิดีโอ; และโหมดที่ขับเคลื่อนด้วยการอ้างอิงที่มีภาพอ้างอิงได้ถึง 5 ภาพ พร้อมคลิปวิดีโอและเสียงอ้างอิงเพิ่มเติม เลือกโหมดที่เหมาะกับงาน ใส่เฟรมหรือข้อมูลอ้างอิง สร้างคลิป 2K และส่งมอบ ราคาคือ 7 เครดิตต่อวินาทีสำหรับ 2K แบบพื้นฐาน ที่มีช่วงระยะเวลา 4 ถึง 15 วินาที H3 เป็นแบบ premium-tier บน videobao เนื่องจากการสร้าง 2K มีราคาแพงกว่า 1080p อย่างมีนัยสำคัญ

ทั้งสามโหมดจัดส่งผ่านขั้นตอนการสร้างเดียวกัน โหมดที่ขับเคลื่อนด้วยการอ้างอิงคือสิ่งที่ปลดล็อกความสอดคล้องของตัวละครข้ามช็อต การโคลนเสียงสำหรับโฆษณาผลิตภัณฑ์ และการตัดต่อหลายแหล่งที่ซับซ้อน และมันใช้งานจริงบน videobao แล้วคู่กับเส้นทางเฟรมแรก/สุดท้าย ดังนั้นรูปแบบ prompt-plus-references เดียวกันจะทำงานได้ไม่ว่าคุณจะใช้ H3 วันนี้ หรือใช้โหมดเหล่านั้นโหมดใดโหมดหนึ่งในวันพรุ่งนี้

Local Deployment, Resources, and What to Read Next

For local deployment, you need a multi-GPU box. The 33B dense transformer is small by 2026 frontier standards but it still wants serious VRAM. The model card walks through the exact inference configuration, the vLLM-style serving setup, and the BF16 precision assumptions. Read the model card end-to-end before you commit to a deployment target.

Resources: the Hugging Face model card is the source of truth (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope mirrors the weights for users in China (modelscope.cn/models/MiniMax/MiniMax-H3). The MiniMax platform docs cover the cloud APIs for H3-2K Direct, H3-Context-IR, and H3-Regenerate-2K at platform.minimaxi.com/docs/api-reference. For the underlying lab, hailuoai.com is the consumer-facing entry point.

If you only need H3 for production work and do not want to host it, the videobao integration panel is the fastest path. If you want the full control of a local deployment, the model card plus the platform docs will get you to a 2K pipeline in a day.

เขียนโดย

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

โพสต์ที่เกี่ยวข้อง

← กลับไปยังทุกโพสต์
คู่มือนักพัฒนา MiniMax H3: สถาปัตยกรรม, 3 รูปแบบการใช้งาน, และลำดับการทำงาน 2K - videobao