Hướng dẫn phát triển MiniMax H3: Kiến trúc, 3 chế độ sử dụng và quy trình 2K
Một cách đi sâu về kỹ thuật của MiniMax H3: đường ống ba giai đoạn, bộ chuyển đổi Omni 33B dày đặc H3-Base, T2VA so với FL2VA so với Ref2VA, và toàn bộ quy trình tái tạo 2K với các phần cục bộ và đám mây.
MiniMax H3 là một hệ thống tạo video đa dạng đầy đủ. Nó lấy văn bản, hình ảnh, video và âm thanh làm một ngữ cảnh duy nhất, hiểu mối quan hệ giữa chúng và tạo ra một video 2K, 15 giây, âm thanh đôi nguyên gốc. Kiến trúc là phần mà hầu hết người dùng không bao giờ thấy nhưng phần giải thích mọi quyết định mà MiniMax đã đưa ra trong 12 tháng qua. Hướng dẫn này sẽ đi qua đường ống ba giai đoạn, bộ chuyển đổi Omni 33B dày đặc H3-Base bên trong nó, ba chế độ sử dụng (T2VA, FL2VA, Ref2VA) và toàn bộ quy trình 2K kết hợp tạo cục bộ với tái tạo đám mây.
Nếu bạn không phải là một người thực hành học máy, bạn có thể dừng lại sau phần chế độ sử dụng và sử dụng videobao cho phần còn lại. Nếu bạn đang tích hợp H3 một cách độc lập, phần còn lại của bài viết là dành cho bạn.
Tổng quan về đường ống ba giai đoạn
H3 không phải là một mô hình. Nó là ba mô-đun được kết nối với nhau: H3-Context-IR, H3-Base và H3-Regenerate-2K. Đường ống lấy các chỉ thị đa dạng thô ở bên trái và tạo ra một video 2K với âm thanh đồng bộ ở bên phải.
H3-Context-IR phân tích bất cứ thứ gì mà người dùng ném vào mô hình. Văn bản, hình ảnh, video, âm thanh hoặc bất kỳ tổ hợp nào. Đầu ra là một Biểu diễn Trung gian Cấu trúc hóa mà các giai đoạn hạ tầng có thể sử dụng. Sau đó, H3-Base tạo ra một video 768p với âm thanh từ biểu diễn đó, và H3-Regenerate-2K lấy đầu ra 768p, kết hợp lại với ngữ cảnh gốc và tái hiển thị ở 2K. Bước tái tạo làm cho 2K cảm giác sắc nét thay vì được thu phóng, bởi vì mô hình vẫn có toàn bộ ngữ cảnh gốc để sử dụng trong khi nó tinh chỉnh.
Hãy tưởng tượng nó như một công thức ba bước: hiểu phác thảo, thảo một phiên bản thấp độ, sau đó thảo lại ở đầy đủ độ phân giải với phác thảo vẫn còn trong tầm nhìn. Cùng một mô hình hoạt động trong sản xuất phim và thiết kế. H3 chỉ làm cho nó trở thành một cuộc gọi API duy nhất.

Bên trong H3-Base: 33 tỷ dày đặc, một luồng, làm sạch đồng thời video âm thanh
H3-Base là trái tim của hệ thống. Nó là một bộ chuyển đổi dày đặc 33 tỷ tham số sử dụng một lõi DiT chia sẻ với 50 tầng để làm sạch video và âm thanh latents trong một luồng duy nhất.
Ba bộ mã hóa cung cấp cho nó. Bộ mã hóa H3 được xây dựng trên Qwen3-VL-32B ở tầng 50 và tạo ra các token văn bản. Bộ mã hóa Visual VAE chạy ở 16x16x24 với tính nhân quả thời gian và một patchify 2x2x1, tạo ra các latents tham chiếu hình ảnh. Bộ mã hóa Audio VAE chạy ở d=32, âm thanh đôi, 32 kHz, token 40 Hz. Bốn luồng token được đóng gói thành một chuỗi ngữ cảnh duy nhất, với video có nhiễu và âm thanh có nhiễu latents được thêm vào phía tạo ra. Chuỗi đơn lẻ đó là cái mà bộ chuyển đổi làm sạch.
Lựa chọn kiến trúc quan trọng là các thành phần dành riêng cho mô đun trên một lõi chia sẻ. DiT cơ bản được chia sẻ giữa video và âm thanh, đó là lý do tại sao mô hình có thể giữ cho hai thứ đồng bộ mà không cần một mô-đun liên kết bổ sung. Hai bộ giải mã vẫn riêng biệt: một bộ giải mã Visual VAE ánh xạ video latents trở lại các khung RGB, và một bộ giải mã Audio VAE ánh xạ âm thanh latents thành dạng sóng âm thanh đôi. Đầu ra là một cặp video-plus-âm thanh đôi đồng bộ, được tạo ra trong một lần.

Ba chế độ sử dụng: T2VA, FL2VA, Ref2VA
H3 cung cấp hai checkpoint nguồn mở, mỗi checkpoint được điều chỉnh cho một chế độ sử dụng khác nhau. Cả hai đều tạo ra video 768p với âm thanh ở độ chính xác BF16. Sự khác biệt là những gì họ chấp nhận làm đầu vào.
H3-Base-FL2VA là chế độ đầu cuối/đầu tiên. Nó chấp nhận văn bản cùng với không, một hoặc hai hình ảnh tham chiếu. Không có hình ảnh có nghĩa là văn bản sang âm thanh-video (T2VA). Một hình ảnh có thể là một khung đầu tiên (I2VA từ một khung đầu đầu) hoặc một khung cuối cùng. Hai hình ảnh có nghĩa là phân chia đầu cuối/đầu tiên. Sử dụng FL2VA khi người dùng có một đầu và một cuối rõ ràng trong đầu và muốn mô hình điền vào chuyển động giữa.
H3-Base-Ref2VA là chế độ điều khiển bởi tham chiếu. Nó chấp nhận văn bản cùng với tối đa 9 hình ảnh tham chiếu, tối đa 3 clip video tham chiếu (mỗi clip 2-15 giây, tổng không vượt quá 15 giây), và tối đa 3 clip âm thanh tham chiếu (mỗi clip 2-15 giây, tổng không vượt quá 15 giây). Âm thanh phải được kết hợp với hình ảnh hoặc video - nó không thể tồn tại độc lập. Tổng cộng tất cả các loại đầu vào tối đa là 12 tệp. Ref2VA là chế độ dành cho tính nhất quán của nhân vật, nhân bản giọng nói, chuyển cảnh và chỉnh sửa phức tạp mà bạn muốn tái sử dụng các phần của footage hiện có.

Toàn bộ quy trình 2K: Cơ bản cục bộ cùng tái tạo đám mây
Đầu ra 768p từ H3-Base là đường đi cục bộ, hoàn toàn nguồn mở. Đường đi 2K kết hợp H3-Base cục bộ với hai API đám mây: H3-Context-IR và H3-Regenerate-2K. Cả hai đều được lưu trữ bởi MiniMax.
Ba giai đoạn điều chỉnh với sơ đồ đường ống. Đầu tiên, H3-Context-IR lấy đầu vào của người dùng và tạo ra đề xuất mở rộng mà H3-Base và H3-Regenerate-2K sẽ sử dụng. Thứ hai, H3-Base cục bộ được triển khai hiển thị một video 768p với âm thanh từ đề xuất mở rộng đó. Thứ ba, H3-Regenerate-2K lấy kết quả 768p làm base_video, kết hợp lại với đề xuất mở rộng và ngữ cảnh người dùng gốc, và tái hiển thị ở 2K. Bước tái tạo là cách mang ngữ cảnh nguyên thủy vào lần lướt chất lượng cao, đó là lý do tại sao đầu ra 2K cảm giác như là một tinh chỉnh thay vì một thu phóng.
Ba trường hợp 2K được gửi trong thẻ mô hình chính thức: T2VA (chỉ văn bản, chuỗi đầy đủ), I2VA (văn bản cùng với khung đầu tiên, chuỗi đầy đủ), và Ref2VA (văn bản cùng với clip tham chiếu, chuỗi đầy đủ). Đối với mỗi trường hợp, thẻ mô hình cung cấp cả một chạy 768p chỉ cục bộ và một chạy 2K qua API, vì vậy nhà phát triển có thể xác minh rằng đường đi cục bộ khớp với đường đi đám mây trên một đầu ra tham chiếu đã biết.
Đối với sản xuất: trong mã ví dụ, đầu ra H3-Base cục bộ được mã hóa base64 dưới dạng URL dữ liệu và được chuyển đến H3-Regenerate-2K. Trong một triển khai thực tế, bạn tải lên video 768p lên bất kỳ URL công khai nào và truyền URL làm base_video thay vì. Đó là thay đổi ống nghề đơn giản nhất giữa ví dụ và sản xuất.
Tổng hợp thông số
Thời gian đầu ra: 4 đến 15 giây. Tỷ lệ khung hình: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Độ phân giải: 768p theo mặc định; 2K qua H3-Regenerate-2K. Tốc độ khung hình: 24 FPS. Âm thanh: 32 kHz âm đôi, nguyên gốc với mô hình.
Hỗ trợ ngôn ngữ tồn động bao gồm 11 ngôn người: Ả Rập, Trung Quốc, Anh, Pháp, Đức, Ý, Nhật, Hàn Quốc, Bồ Đào Nha, Nga và Tây Ban Nha. Các ngôn ngữ khác có hỗ trợ một phần. Giấy phép: Giấy phép Cộng đồng MiniMax H3 (nguồn mở, nhưng không thông thoáng theo nghĩa Apache - đọc thẻ mô hình trước khi sản xuất một sản phẩm thương mại trên đó).
Nơi lấy trọng lượng: Hugging Face tại huggingface.co/MiniMaxAI/MiniMax-H3 và ModelScope tại modelscope.cn/models/MiniMax/MiniMax-H3. Các tham số yêu cầu đầy đủ, đề xuất H3-Context-IR và mã tái tạo nằm trong thẻ mô hình Hugging Face.
Trên videobao: Những gì đã hoạt động, những gì tiếp theo
H3 đã hoạt động trên videobao ngày nay. Các chế độ sử dụng tích hợp bao phủ toàn bộ bề mặt H3-Base: text-to-video; hình ảnh khung hình đầu tiên, khung hình cuối cùng hoặc khung hình đầu+cuối sang video; và chế độ điều khiển bằng tham chiếu với tối đa 5 hình ảnh tham chiếu cùng các clip video và âm thanh tham chiếu tùy chọn. Chọn chế độ phù hợp với brief, thêm khung hình hoặc tham chiếu, tạo clip 2K và gửi. Giá thành là 7 điểm tín dụng mỗi giây cho 2K gốc, với một phạm vi thời gian từ 4 đến 15 giây. H3 là hạng đỉnh trên videobao vì tạo 2K có giá trị nhiều hơn nhiều so với 1080p.
Cả ba chế độ đều được phân phối thông qua cùng một quy trình tạo dựng. Chế độ điều khiển bằng tham chiếu là cách giải phóng tính nhất quán của nhân vật qua các khung hình, nhân bản giọng nói cho các quảng cáo sản phẩm và chỉnh sửa đa nguồn phức tạp, và nó đã hoạt động trên videobao cùng với các đường đi khung hình đầu/cuối, vì vậy cùng một mẫu đề xuất cùng với tham chiếu hoạt động cho dù bạn đang sử dụng H3 ngày hôm nay hay bất kỳ chế độ nào trong số đó vào ngày mai.
Triển khai cục bộ, tài nguyên và những gì tiếp theo
Để triển khai cục bộ, bạn cần một hộp đa GPU. Bộ chuyển đổi dày đặc 33 tỷ là nhỏ theo tiêu chuẩn tiền đạo 2026 nhưng nó vẫn muốn VRAM nghiêm trọng. Thẻ mô hình hướng dẫn đầy đủ cấu hình suy diễn, cấu hình phục vụ kiểu vLLM và các giả định độ chính xác BF16. Đọc thẻ mô hình từ đầu đến cuối trước khi bạn cam kết một mục tiêu triển khai.
Tài nguyên: thẻ mô hình Hugging Face là nguồn sự thật (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope phản chiếu các trọng lượng cho người dùng tại Trung Quốc (modelscope.cn/models/MiniMax/MiniMax-H3). Các tài liệu trang web MiniMax bao gồm các API đám mây cho H3-2K Direct, H3-Context-IR và H3-Regenerate-2K tại platform.minimaxi.com/docs/api-reference. Đối với phòng thí nghiệm cơ bản, hailuoai.com là điểm vào tiếp cận với người tiêu dùng.
Nếu bạn chỉ cần H3 để làm việc sản xuất và không muốn lưu trữ nó, bảng tạo dựng videobao là đường đi nhanh nhất. Nếu bạn muốn sự kiểm soát đầy đủ của một triển khai cục bộ, thẻ mô hình cùng với các tài liệu nền tảng sẽ đưa bạn đến một đường ống 2K chỉ trong một ngày.