Руководство разработчика MiniMax H3: Архитектура, 3 режима использования и 2K рабочий процесс
Технический обзор MiniMax H3: трехэтапный конвейер, 33-миллиардный плотный H3-Base Omni Transformer, T2VA против FL2VA против Ref2VA, и полный 2K рабочий процесс с локальными и облачными компонентами.
MiniMax H3 - это универсальная система генерации видео с полной модальностью. Она принимает текст, изображения, видео и аудио как единый контекст, понимает отношения между ними и создает видео с разрешением 2K, длительностью 15 секунд и стереозвуком. Архитектура - это часть, которую большинство пользователей никогда не видят, но именно она объясняет каждое решение, принятое MiniMax за последние двенадцать месяцев. Это руководство проведет вас через трехэтапный конвейер, 33-миллиардный плотный H3-Base Omni Transformer внутри него, три режима использования (T2VA, FL2VA, Ref2VA) и полный 2K рабочий процесс, который сочетает локальную генерацию с облачной регенерацией.
Если вы не являетесь специалистом по машинному обучению, вы можете остановиться после раздела о режимах использования и использовать videobao для остального. Если вы сами интегрируете H3, остальная часть статьи для вас.
Трехэтапный конвейер в двух словах
H3 - это не одна модель. Это три модуля, соединенных вместе: H3-Context-IR, H3-Base и H3-Regenerate-2K. Конвейер принимает необработанные мультимодальные инструкции слева и создает видео с разрешением 2K и синхронизированным звуком справа.
H3-Context-IR анализирует все, что пользователь передает модели. Текст, изображения, видео, аудио или любая их комбинация. Выходом является структурированное промежуточное представление контекста, которое могут использовать последующие этапы. Затем H3-Base генерирует видео с разрешением 768p с аудио из этого представления, а H3-Regenerate-2K берет выход 768p, объединяет его обратно с исходным контекстом и повторно рендерит в 2K. Шаг регенерации - это то, что делает 2K резким, а не просто увеличенным, потому что модель все еще имеет полный исходный контекст для использования при уточнении.
Представьте это как трехэтапный рецепт: понять бриф, создать черновик с низким разрешением, а затем переделать его в полном разрешении, имея бриф в поле зрения. Эта же схема работает в производстве фильмов и дизайне. H3 просто делает это одним вызовом API.

Внутри H3-Base: 33B плотный, один поток, совместное шумоподавление видео и аудио
H3-Base - это сердце системы. Это 33-миллиардный параметрический плотный трансформатор, который шумоподавляет видео и аудио латенты в одном потоке, используя общий каркас DiT с 50 слоями.
Три энкодера питают его. H3 Энкодер построен на Qwen3-VL-32B на уровне 50 и создает текстовые токены. Энкодер Visual VAE работает на 16x16x24 с временной причинностью и 2x2x1 патчингом, создавая визуальные латентные референсы. Энкодер Audio VAE работает на d=32, стерео, 32 кГц, 40 Гц токенах. Четыре потока токенов упаковываются в одну последовательность в контексте, с зашумленными видео и аудио латентами, добавленными на стороне генерации. Эта единственная последовательность - то, что трансформатор шумоподавляет.
Архитектурный выбор, который имеет значение, - это компоненты, специфичные для модальности, поверх общего каркаса. Базовый DiT является общим для видео и аудио, поэтому модель может синхронизировать два без дополнительного модуля выравнивания. Два декодера все еще разделены: Visual VAE Decoder, который отображает видео латенты обратно в RGB кадры, и Audio VAE Decoder, который отображает аудио латенты в стерео волновую форму. Выход - это синхронизированная пара видео плюс стерео аудио, сгенерированная за один проход.

Три режима использования: T2VA, FL2VA, Ref2VA
H3 выпускает два открытых контрольных пункта, каждый из которых настроен для разных режимов использования. Оба производят видео с разрешением 768p с аудио в BF16 точности. Разница в том, что они принимают в качестве входных данных.
H3-Base-FL2VA - это режим первый/последний кадр. Он принимает текст плюс ноль, один или два эталонных изображения. Ноль изображений означает текст-аудио-видео (T2VA). Одно изображение может быть первым кадром (I2VA от головного кадра) или последним кадром. Два изображения означают интерполяцию между первым и последним кадром. Используйте FL2VA, когда у пользователя есть четкое начало и конец в уме и он хочет, чтобы модель заполнила промежуточное движение.
H3-Base-Ref2VA - это режим, управляемый ссылками. Он принимает текст плюс до 9 эталонных изображений, до 3 эталонных видеоклипов (каждый 2-15 секунд, общая продолжительность не превышает 15 секунд) и до 3 эталонных аудиоклипов (каждый 2-15 секунд, общая продолжительность не превышает 15 секунд). Аудио должно быть в паре с изображением или видео - оно не может стоять отдельно. Общее количество всех типов входных данных ограничено 12 файлами. Ref2VA - это режим для согласованности персонажей, клонирования голоса, переноса сцены и сложных правок, где вы хотите повторно использовать части существующих кадров.

Полный 2K рабочий процесс: Локальная база плюс облачная регенерация
Выход 768p из H3-Base - это локальный, полностью открытый исходный путь. Путь 2K объединяет локальный H3-Base с двумя облачными API: H3-Context-IR и H3-Regenerate-2K. Оба размещены MiniMax.
Три этапа соответствуют диаграмме конвейера. Сначала H3-Context-IR принимает входные данные пользователя и создает расширенный запрос, который будет использоваться H3-Base и H3-Regenerate-2K. Во-вторых, локально развернутый H3-Base рендерит видео с разрешением 768p с аудио из этого расширенного запроса. В-третьих, H3-Regenerate-2K берет результат 768p как base_video, повторно объединяет его с расширенным запросом и исходным контекстом пользователя и повторно рендерит в 2K. Шаг регенерации - это то, что переносит исходный семантический контекст в высокоразрешенный проход, поэтому выход 2K ощущается как уточнение, а не просто увеличение.
Три случая 2K поставляются в официальной модели: T2VA (только текст, полная цепочка), I2VA (текст плюс первый кадр, полная цепочка) и Ref2VA (текст плюс эталонные клипы, полная цепочка). Для каждого случая карта модели предоставляет как локальный только 768p запуск, так и 2K запуск через API, так что разработчик может проверить, что локальный путь соответствует облачному пути на известном эталонном выходе.
Для производства: в примере кода локальный выход H3-Base кодируется в base64 как URL данных и передается в H3-Regenerate-2K. В реальном развертывании вы загружаете видео 768p на любой общедоступный URL и передаете URL как base_video вместо этого. Это единственное значимое изменение в сантехнике между примером и производством.
Спецификация шпаргалка
Длительность вывода: от 4 до 15 секунд. Соотношение сторон: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Разрешение: по умолчанию 768p; 2K через H3-Regenerate-2K. Частота кадров: 24 FPS. Аудио: 32 кГц стерео, встроенное в модель.
Поддержка стабильного языка охватывает 11 языков: арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский и испанский. Другие языки получают частичную поддержку. Лицензия: MiniMax H3 Community License (открытый исходный код, но не разрешительная в смысле Apache - прочитайте карту модели перед выпуском коммерческого продукта на ее основе).
Где взять веса: Hugging Face на huggingface.co/MiniMaxAI/MiniMax-H3 и ModelScope на modelscope.cn/models/MiniMax/MiniMax-H3. Полные параметры запроса, H3-Context-IR запрос и код регенерации находятся в карте модели Hugging Face.
На videobao: Что есть в наличии, что будет дальше
H3 уже доступен на videobao сегодня. Интегрированные режимы использования покрывают всю поверхность H3-Base: текст-в-видео; изображение первого кадра, последнего кадра или первого+последнего кадра в видео; и режим на основе ссылок с до 5 изображениями-ссылками и опциональными видео- и аудио-ссылками. Выберите режим, подходящий под бриф, добавьте кадры или ссылки, создайте 2K-клип и отправьте его. Цена составляет 7 кредитов за секунду для нативного 2K, с диапазоном длительности от 4 до 15 секунд. H3 является премиум-уровнем на videobao, потому что генерация 2K значительно дороже, чем 1080p.
Все три режима поставляются через один и тот же процесс генерации. Режим на основе ссылок — это то, что открывает согласованность персонажей между кадрами, клонирование голоса для рекламы продуктов и сложное многопоточное редактирование, и он уже доступен на videobao вместе с путями первого/последнего кадра, так что один и тот же шаблон запрос-плюс-ссылки работает, используете ли вы H3 сегодня или любой из этих режимов завтра.
Локальное развертывание, ресурсы и что читать дальше
Для локального развертывания вам нужен многопроцессорный блок. 33-миллиардный плотный трансформатор мал по стандартам 2026 года, но он все еще требует серьезной VRAM. Карта модели проходит через точную конфигурацию вывода, настройку сервера в стиле vLLM и предположения о точности BF16. Прочитайте карту модели от начала до конца, прежде чем выбрать цель развертывания.
Ресурсы: карта модели Hugging Face является источником истины (huggingface.co/MiniMaxAI/MiniMax-H3). ModelScope отражает веса для пользователей в Китае (modelscope.cn/models/MiniMax/MiniMax-H3). Документация платформы MiniMax охватывает облачные API для H3-2K Direct, H3-Context-IR и H3-Regenerate-2K на platform.minimaxi.com/docs/api-reference. Для лежащей в основе лаборатории, hailuoai.com является входной точкой для потребителей.
Если вам нужно H3 только для производственной работы и вы не хотите размещать его, панель управления генерацией videobao - это самый быстрый путь. Если вы хотите полный контроль над локальным развертыванием, карта модели плюс документация платформы приведут вас к 2K конвейеру за день.