videobao resmi live dengan DouBao SeeDance 2.5 dan MiniMax-H3 — daftar dapat 10 kredit

Berlangganan sekarang
Panduan Pengembang

Panduan Pengembang MiniMax H3: Arsitektur, 3 Mode Penggunaan, dan Alur Kerja 2K

Penjelasan teknis tentang MiniMax H3: pipeline tiga tahap, transformer padat H3-Base Omni 33B, T2VA vs FL2VA vs Ref2VA, dan alur regenerasi 2K penuh dengan bagian lokal dan cloud.

Oleh Tim videobao8 menit baca
Diagram gambaran umum sistem MiniMax H3 yang menunjukkan pipeline tiga tahap dari pemahaman konteks hingga generasi dasar 2K resolusi tinggi

MiniMax H3 adalah sistem generasi video universal untuk semua modalitas. Sistem ini mengambil teks, gambar, video, dan audio sebagai satu konteks, memahami hubungan di antara mereka, dan menghasilkan video 2K, 15 detik, dengan audio stereo asli. Arsitektur adalah bagian yang paling banyak pengguna tidak pernah lihat tetapi bagian yang menjelaskan setiap keputusan yang dibuat MiniMax dalam dua belas bulan terakhir. Panduan ini menjelaskan pipeline tiga tahap, transformer padat H3-Base Omni 33B di dalamnya, tiga mode penggunaan (T2VA, FL2VA, Ref2VA), dan alur kerja 2K penuh yang menggabungkan generasi lokal dengan regenerasi cloud.

Jika Anda bukan seorang praktisi pembelajaran mesin, Anda dapat berhenti setelah bagian mode penggunaan dan menggunakan videobao untuk sisanya. Jika Anda mengintegrasikan H3 sendiri, sisa artikel ini untuk Anda.

Tinjauan Singkat Pipeline Tiga Tahap

H3 bukan satu model. Ini adalah tiga modul yang saling terhubung: H3-Context-IR, H3-Base, dan H3-Regenerate-2K. Pipeline mengambil instruksi multimodal mentah di sebelah kiri dan menghasilkan video 2K dengan audio tersinkronisasi di sebelah kanan.

H3-Context-IR mengurai apa pun yang diberikan pengguna ke model. Teks, gambar, video, audio, atau kombinasi apa pun. Outputnya adalah Representasi Menengah Konteks terstruktur yang dapat dikonsumsi oleh tahap hilir. H3-Base kemudian menghasilkan video 768p dengan audio dari representasi itu, dan H3-Regenerate-2K mengambil output 768p, menggabungkannya kembali dengan konteks asli, dan merender ulang pada 2K. Langkah regenerasi adalah yang membuat 2K terasa tajam daripada ditingkatkan, karena model masih memiliki konteks asli penuh untuk digunakan saat menyempurnakan.

Bayangkan ini sebagai resep tiga langkah: memahami ringkasan, membuat versi rendah-resolusi, lalu menulis ulang pada resolusi penuh dengan ringkasan masih dalam pandangan. Pola yang sama bekerja dalam produksi film dan desain. H3 hanya membuatnya menjadi satu panggilan API.

Diagram tinjauan sistem MiniMax H3 tiga tahap: Pemahaman Konteks memberi makan H3-Context-IR dan representasi konteks terstruktur, Generasi Dasar menjalankan H3-Base untuk menghasilkan video 768p, dan Regenerasi Resolusi Tinggi menjalankan H3-Regenerate-2K untuk menghasilkan video 2K dengan panduan konteks dari tahap sebelumnya
Gambar 1: Tinjauan sistem H3 - pemahaman konteks memberi makan generasi dasar, yang memberi makan regenerasi 2K, dengan panduan konteks dibawa sepanjang jalan.

Di Dalam H3-Base: 33B Padat, Satu Aliran, Pengurangan Kebisingan Video-Audio Gabungan

H3-Base adalah jantung dari sistem. Ini adalah transformer padat 33 miliar parameter yang mengurangi kebisingan laten video dan audio dalam satu aliran, menggunakan tulang punggung DiT bersama dengan 50 lapisan.

Tiga pengkode memberi makan. Pengkode H3 dibangun di atas Qwen3-VL-32B pada lapisan 50 dan menghasilkan token teks. Pengkode Visual VAE berjalan pada 16x16x24 dengan kausalitas temporal dan patchify 2x2x1, menghasilkan laten referensi visual. Pengkode Audio VAE berjalan pada d=32, stereo, 32 kHz, token 40 Hz. Empat aliran token dikemas menjadi satu urutan dalam konteks, dengan laten video berisik dan laten audio berisik ditambahkan di sisi generasi. Urutan tunggal itulah yang transformer kurangi kebisingannya.

Pilihan arsitektur yang penting adalah komponen spesifik modalitas di atas tulang punggung bersama. DiT dasar dibagikan bersama antara video dan audio, itulah sebabnya model dapat menjaga keduanya tetap sinkron tanpa modul penyelarasan tambahan. Dua dekoder masih terpisah: Visual VAE Decoder yang memetakan laten video kembali ke bingkai RGB, dan Audio VAE Decoder yang memetakan laten audio ke bentuk gelombang stereo. Outputnya adalah pasangan video-plus-stereo-audio tersinkronisasi, yang dihasilkan dalam satu kali proses.

Diagram arsitektur H3-Base terperinci yang menunjukkan pengkodean kondisi (Pengkode H3 dari Qwen3-VL-32B, Pengkode Visual VAE pada 16x16x24, Pengkode Audio VAE pada stereo 32 kHz), urutan dalam konteks yang dikemas, generasi terpadu dengan transformer Omni H3 33B dan tulang punggung DiT bersama x 50, dan dekode dengan Visual VAE Decoder dan Audio VAE Decoder yang menghasilkan video tersinkronisasi ditambah audio stereo
Gambar 2: H3-Base bagian dalam - pengkodean kondisi, urutan dalam konteks yang dikemas, pengurangan kebisingan terpadu, dan dekode tersinkronisasi.

Tiga Mode Penggunaan: T2VA, FL2VA, Ref2VA

H3 mengirimkan dua checkpoint sumber terbuka, masing-masing disesuaikan untuk mode penggunaan yang berbeda. Keduanya menghasilkan video 768p dengan audio dalam presisi BF16. Perbedaannya adalah apa yang mereka terima sebagai input.

H3-Base-FL2VA adalah mode frame pertama/terakhir. Ini menerima teks ditambah nol, satu, atau dua gambar referensi. Nol gambar berarti teks-ke-audio-video (T2VA). Satu gambar bisa berupa frame pertama (I2VA dari frame kepala) atau frame terakhir. Dua gambar berarti interpolasi frame pertama dan terakhir. Gunakan FL2VA ketika pengguna memiliki awal dan akhir yang jelas dalam pikiran dan ingin model mengisi gerakan di antaranya.

H3-Base-Ref2VA adalah mode yang digerakkan oleh referensi. Ini menerima teks ditambah hingga 9 gambar referensi, hingga 3 klip video referensi (masing-masing 2-15 detik, total tidak melebihi 15 detik), dan hingga 3 klip audio referensi (masing-masing 2-15 detik, total tidak melebihi 15 detik). Audio harus dipasangkan dengan gambar atau video - tidak dapat berdiri sendiri. Total di semua jenis input dibatasi hingga 12 file. Ref2VA adalah mode untuk konsistensi karakter, kloning suara, transfer adegan, dan pengeditan kompleks di mana Anda ingin menggunakan kembali bagian dari rekaman yang ada.

Tabel checkpoint H3 yang menunjukkan H3-Base FL2VA mendukung T2VA dan I2VA frame pertama/terakhir dengan frame pertama/terakhir opsional, dan H3-Base Ref2VA mendukung referensi-ke-audio-video dengan teks ditambah gambar, video, dan audio referensi, keduanya menghasilkan video dan audio pada presisi BF16
Gambar 3: Dua checkpoint sumber terbuka, dua mode penggunaan. FL2VA untuk alur kerja frame pertama/terakhir; Ref2VA untuk alur kerja yang digerakkan oleh referensi.

Alur Kerja 2K Penuh: Basis Lokal ditambah Regenerasi Cloud

Output 768p dari H3-Base adalah jalur sumber terbuka penuh lokal. Jalur 2K menggabungkan H3-Base lokal dengan dua API cloud: H3-Context-IR dan H3-Regenerate-2K. Keduanya dihosting oleh MiniMax.

Tiga tahap sejajar dengan diagram pipeline. Pertama, H3-Context-IR mengambil input pengguna dan menghasilkan prompt yang diperluas yang akan dikonsumsi oleh H3-Base dan H3-Regenerate-2K. Kedua, H3-Base ter-deploy secara lokal merender video 768p dengan audio dari prompt yang diperluas itu. Ketiga, H3-Regenerate-2K mengambil hasil 768p sebagai base_video, menggabungkannya kembali dengan prompt yang diperluas dan konteks pengguna asli, dan merender ulang pada 2K. Langkah regenerasi adalah yang membawa konteks semantik asli ke dalam proses resolusi tinggi, itulah sebabnya output 2K terasa seperti penyempurnaan daripada peningkatan skala.

Tiga kasus 2K dikirimkan dalam kartu model resmi: T2VA (teks saja, rantai penuh), I2VA (teks ditambah frame pertama, rantai penuh), dan Ref2VA (teks ditambah klip referensi, rantai penuh). Untuk setiap kasus, kartu model menyediakan run 768p hanya lokal dan run 2K melalui API, sehingga pengembang dapat memverifikasi bahwa jalur lokal cocok dengan jalur cloud pada output referensi yang diketahui.

Untuk produksi: dalam kode contoh, output H3-Base lokal dikodekan base64 sebagai Data URL dan diteruskan ke H3-Regenerate-2K. Dalam penerapan nyata, Anda mengunggah video 768p ke URL publik apa pun dan meneruskan URL sebagai base_video. Itu adalah satu-satunya perubahan pipa yang berarti antara contoh dan produksi.

Ringkasan Spesifikasi

Durasi output: 4 hingga 15 detik. Rasio aspek: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Resolusi: 768p secara default; 2K melalui H3-Regenerate-2K. Frame rate: 24 FPS. Audio: 32 kHz stereo, asli ke model.

Dukungan bahasa stabil mencakup 11 bahasa: Arab, Cina, Inggris, Perancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol. Bahasa lain mendapatkan dukungan parsial. Lisensi: MiniMax H3 Community License (sumber terbuka, tetapi tidak permisif dalam arti Apache - baca kartu model sebelum mengirimkan produk komersial di atasnya).

Di mana mendapatkan bobot: Hugging Face di huggingface.co/MiniMaxAI/MiniMax-H3 dan ModelScope di modelscope.cn/models/MiniMax/MiniMax-H3. Parameter permintaan lengkap, prompt H3-Context-IR, dan kode regenerasi ada di kartu model Hugging Face.

Di videobao: Apa yang Aktif, Apa yang Selanjutnya

H3 aktif di videobao hari ini. Mode penggunaan terintegrasi mencakup seluruh permukaan H3-Base: teks-ke-video; gambar bingkai pertama, bingkai terakhir, atau bingkai pertama+terakhir ke video; dan mode berbasis referensi dengan hingga 5 gambar referensi beserta klip video dan audio referensi opsional. Pilih mode yang sesuai dengan brief, tambahkan bingkai atau referensi, hasilkan klip 2K dan kirimkan. Harga adalah 7 kredit per detik untuk 2K asli, dengan rentang durasi 4 hingga 15 detik. H3 adalah tingkat premium di videobao karena generasi 2K secara signifikan lebih mahal daripada 1080p.

Ketiga mode dikirim di belakang alur generasi yang sama. Mode berbasis referensi adalah yang membuka konsistensi karakter antar bidikan, kloning suara untuk iklan produk, dan pengeditan multi-sumber kompleks, dan sudah aktif di videobao bersama jalur bingkai pertama/terakhir, sehingga pola prompt-plus-referensi yang sama berfungsi baik Anda menggunakan H3 hari ini atau salah satu mode tersebut besok.

Penerapan Lokal, Sumber Daya, dan Apa yang Harus Dibaca Selanjutnya

Untuk penerapan lokal, Anda memerlukan kotak multi-GPU. Transformer 33B padat kecil menurut standar frontier 2026 tetapi masih membutuhkan VRAM serius. Kartu model menjelaskan konfigurasi inferensi yang tepat, pengaturan penyajian gaya vLLM, dan asumsi presisi BF16. Baca kartu model dari awal hingga akhir sebelum Anda memutuskan target penerapan.

Sumber daya: kartu model Hugging Face adalah sumber kebenaran (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope mencerminkan bobot untuk pengguna di China (modelscope.cn/models/MiniMax/MiniMax-H3). Dokumentasi platform MiniMax mencakup API cloud untuk H3-2K Direct, H3-Context-IR, dan H3-Regenerate-2K di platform.minimaxi.com/docs/api-reference. Untuk lab yang mendasari, hailuoai.com adalah titik masuk yang berorientasi konsumen.

Jika Anda hanya membutuhkan H3 untuk pekerjaan produksi dan tidak ingin menghostingnya, panel integrasi videobao adalah jalur tercepat. Jika Anda menginginkan kontrol penuh dari penerapan lokal, kartu model ditambah dokumentasi platform akan membawa Anda ke alur 2K dalam sehari.

Ditulis oleh

videobao Team

Editorial Team

Editorial team behind videobao's model comparisons and tutorials.

Postingan Terkait

← Kembali ke semua postingan
Panduan Pengembang MiniMax H3: Arsitektur, 3 Mode Penggunaan, dan Alur Kerja 2K - videobao