Когда MiniMax H3 получил открытые веса, моей первой мыслью было не «ура, теперь видео всегда бесплатны», а «отлично, теперь слово за видеокартой и счетом за электричество». Если мощный компьютер у вас уже есть, релиз действительно интересный: модель можно скачать, не платить API за каждый ролик, спокойно проверять промпты, ставить задачи в очередь и хранить материалы на своих дисках.
Но бесплатные веса не означают нулевую стоимость всей системы. Официальная конфигурация по-прежнему требовательна. Квантизация, выгрузка модели и инструменты для малого объема VRAM позволяют работать на потребительских GPU, но ценой дополнительной RAM, меньшего разрешения и ожидания, за которое можно успеть выпить кофе.

Разберем с точки зрения любителя AI-видео, что именно открыто в генераторе видео MiniMax H3, потянет ли его ваш компьютер и что выгоднее: локальный запуск или онлайн-генерация.
Содержание
01 Что означает релиз MiniMax H3?
Фразу «MiniMax H3 стал открытым» лучше уточнить: это модель с открытыми весами. MiniMax опубликовала на Hugging Face веса H3-Base, конфигурации и компоненты инференса. Их можно скачивать, развертывать, изменять и запускать через SGLang, vLLM, Diffusers, ComfyUI или инструменты сообщества.
Генерацию, которую раньше выполнял облачный сервер, можно перенести на свою машину. При достаточном оборудовании, месте и навыках количество запусков больше не связано напрямую с кредитами или счетом API. Это удобно для массовых тестов раскадровки, постоянства персонажей и рекламных вариантов.
Короткий вывод
Открытые веса — не вся официальная система
Полная система H3 состоит из H3-Context-IR, H3-Base и H3-Regenerate-2K. Опубликован только H3-Base. H3-Context-IR для понимания сложных мультимодальных материалов и H3-Regenerate-2K для повторной генерации в 2K остаются облачными компонентами.
02 Что именно опубликовано?
Согласно официальной карточке MiniMax H3, есть два основных варианта. Оба одновременно предсказывают видео и нативный стереозвук, но принимают разные данные.
| Вариант | Возможности | Входные данные |
|---|---|---|
| H3-Base-FL2VA | Текст-в-видео, первый, последний или первый и последний кадры | Текст либо 0–2 изображения начального и конечного кадра |
| H3-Base-Ref2VA | Мультимодальные референсы, видео-в-видео, звук и персонаж | Текст с изображениями, видео и аудиореференсами |
- Длительность: 4–15 секунд.
- Форматы: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 и другие.
- Локальное разрешение Base: короткая сторона 768 пикселей.
- Частота: 24 FPS.
- Звук: стерео 32 кГц, нативная генерация атмосферы, музыки и речи.
- Языки стабильной речи: 11, включая китайский, английский, японский, корейский и русский.
Открытый Ref2VA принимает до 9 изображений, 3 видео и 3 аудиофайлов, всего не более 12 смешанных файлов. У онлайн-продуктов лимиты могут отличаться, поэтому уточняйте, идет ли речь о локальных весах, официальном API или сторонней платформе.
03 Можно ли пользоваться MiniMax H3 бесплатно?
Если под «бесплатно» понимать отсутствие платы за каждый локальный инференс, да, в разрешенных регионах, при соблюдении MiniMax H3 Community License Agreement и политики допустимого использования.
На 5 августа 2026 года Россия не входит в список исключенных регионов, поэтому лицензия предоставляет ограниченное безвозмездное право использования и изменения при соблюдении ее условий. США, ЕС, Великобритания и Южная Корея исключены явно. Перед коммерческим внедрением в любом регионе читайте актуальную редакцию лицензии и при необходимости консультируйтесь с юристом.
| Без оплаты за запуск | Остающиеся расходы | Ограничения |
|---|---|---|
| Локальный инференс и повторные тесты API | GPU, RAM, SSD, электричество, охлаждение и износ | Регион, правила использования и модули, доступные только через API |
MiniMax не заявляет прав на результат генерации, но законность, права на изображение и авторские материалы, а также дальнейшее использование остаются вашей ответственностью. Модель можно забрать домой, ответственность — нет.
04 Требования: запустить и работать комфортно — не одно и то же
Ответ на вопрос «хватит ли 8GB VRAM?» зависит от весов, длительности, разрешения, допустимого ожидания и объема RAM для выгрузки модели.
| Оборудование | Способ | Опубликованные данные | Для кого |
|---|---|---|---|
| Около 6–9GB VRAM | WanGP, квантизация, выгрузка в CPU/RAM | Данные сообщества: 5 секунд 832×480 — около 5–6GB; 15 секунд — 8–9GB | Для знакомства при согласии на низкое разрешение и ожидание |
| Один GPU 24–32GB | Pruned, INT8, FP8 или GGUF с выгрузкой | Практичный потребительский диапазон по мнению сообщества, не официальный тест полной точности | Для авторов, знакомых с ComfyUI и настройками |
| 2× RTX 5090 32GB | SGLang TP2 и послойная выгрузка | Официально: около 384GB RAM; 5 секунд, 1344×768, 50 шагов — 559.67 секунды | Мощная станция с сохранением официальной точности |
| 4× H100/H200 | Официальный SGLang на нескольких GPU | Рекомендованные и проверенные конфигурации | Команды, исследовательские центры, серверы |
Официальный тест SGLang: полный запрос в 50 шагов на двух RTX 5090 занял около 9 минут 20 секунд, пик — около 26.3 GiB на GPU. Это доступнее серверных карт, но еще не простая установка в обычный игровой ПК.
Проект WanGP снижает VRAM до 5–9GB за счет квантизации, выгрузки и меньшего разрешения. Это данные конкретного инструмента сообщества, а не минимум официального BF16. Новыми узкими местами станут RAM, скорость SSD и время.
05 Какие веса выбрать: не скачивайте все 498GB
На 5 августа 2026 года официальный репозиторий занимает около 498GB, включая разные задачи, исходный и Diffusers-форматы. Полностью он не нужен.
Один официальный каталог FL2VA — около 144GB. В наборах MiniMax H3 для ComfyUI можно выбрать точность под оборудование.
| Основные веса | Размер | Рекомендация |
|---|---|---|
| BF16 | 66.3GB | Полная точность, несколько GPU или мощная станция. |
| INT8 | 34GB | Компромисс размера и качества, нужна достаточная память. |
| Pruned BF16 | 40.2GB | Меньший объем при точности BF16. |
| Pruned FP8/INT8 | 21GB | Лучший старт для потребительской системы. |
21GB — не размер всей установки
Это один файл диффузионной модели. Нужны также текстовый энкодер Qwen3-VL, видео- и аудио-VAE, среда, кэш и место для результатов. Подготовьте быстрый SSD с запасом.
- Текст, изображение, первый/последний кадры: FL2VA.
- Персонаж, движение, видео или звук как референс: Ref2VA.
- Мало VRAM/RAM: Pruned INT8/FP8 или GGUF.
- Сравнение официального качества: BF16 и несколько GPU.
06 Три способа локальной установки MiniMax H3
Единственного правильного способа нет. Выбирайте по оборудованию и по тому, хотите ли вы тратить время на творчество или терминал.
Проверьте до установки
- ОС: инструкции рассчитаны прежде всего на Windows 10/11 или Linux с NVIDIA GPU.
- Драйвер: обновите NVIDIA; в готовом ComfyUI проверьте, что PyTorch/CUDA видит GPU.
- RAM: при малом VRAM компоненты выгружаются в RAM. 32GB может не хватить.
- SSD: 80–100GB для компактных весов; более 150GB для полного FL2VA плюс кэш и результаты.
- Задача: текст, изображение и крайние кадры — FL2VA; референсы изображений, видео и звука — Ref2VA.
01 Установка через ComfyUI
Подойдет тем, кто знаком с узловыми процессами и хочет менять модель, семплирование и постобработку.
Используйте Manager, обновление настольной версии или Git. Старые версии могут не видеть узлы H3.
На странице весов Comfy-Org выберите один файл под задачу.
- FL2VA для потребительского GPU:
minimax_h3_fl2va_pruned_int8_convrot.safetensorsилиminimax_h3_fl2va_pruned_fp8_scaled.safetensors. - Мультимодальные референсы: Pruned INT8/FP8 с
ref2vaв имени. - Мощная система:
minimax_h3_fl2va_bf16.safetensorsили Ref2VA BF16.
Поместите файл в:
ComfyUI/models/diffusion_models/
Одних диффузионных весов недостаточно: нужны текстовый энкодер Qwen3-VL и отдельные VAE для видео и звука.
- Энкодер:
qwen3vl_32b_minimax_h3_int8_convrot.safetensors→ComfyUI/models/text_encoders/. - Видео-VAE:
minimax_h3_video_vae_fp16.safetensors→ComfyUI/models/vae/. - Аудио-VAE:
minimax_h3_audio_vae_fp32.safetensors→ComfyUI/models/vae/.
После загрузки структура каталогов будет примерно такой:
ComfyUI/
└── models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors
Скачайте JSON-шаблон под свою задачу и перетащите его на холст ComfyUI.
Начните с 5 секунд, малого разрешения, 15–20 шагов и фиксированного seed. Проверьте текст или один первый кадр, видео и звук, а затем повышайте длительность, разрешение и число референсов.
02 Установка через WanGP
WanGP автоматически выбирает подходящую модель, выгружает компоненты в RAM и дает браузерный интерфейс. Поддерживаются FL2VA, Ref2VA, полная 33B и облегченная 20B Pruned.
Скачайте ZIP из официального репозитория DeepBeepMeep/Wan2GP или клонируйте:
git clone https://github.com/deepbeepmeep/Wan2GP.git
cd Wan2GP
В Windows откройте scripts\install.bat, в Linux — scripts/install.sh. При первой установке выберите Auto Install, чтобы создать отдельную среду Python и поставить PyTorch, CUDA и ускорители для GPU.
# Linux
bash scripts/install.shВ Windows обычно достаточно двойного щелчка по BAT. Модель можно добавить и в существующую стабильную среду WanGP.
Windows: scripts\run.bat. Linux:
bash scripts/run.shОткройте локальный адрес из терминала и выберите MiniMax H3. При первом выборе FL2VA или Ref2VA подходящие файлы будут скачаны, что займет время.
- Для текста или первого кадра выберите MiniMax H3 FL2VA.
- Начните с 832×480 и 5 секунд.
- Используйте 15–20 шагов и фиксированный seed.
- При малом VRAM оставьте Lower VRAM.
- Если не хватает RAM, но GPU свободен, выберите Lower RAM.
Нагрузка не исчезает, а переходит на RAM, SSD и PCIe. Если браузер занимает много VRAM, запустите Chrome через scripts/start-chrome-no-gpu.bat или scripts/start-chrome-no-gpu.sh.
03 Развертывание через SGLang
SGLang — одна из рекомендованных платформ для нескольких H100, H200, B200, B300, RTX 5090 или AMD Instinct. Она предлагает асинхронный видео-API, очередь, топологии GPU и настройки производительности.
Выполните официальную команду в отдельной среде Python на Linux-сервере.
uv pip install "sglang[diffusion]" --prerelease=allow
Базовая официальная команда для четырех GPU:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--model-variant fl2va \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010Для референсов замените --model-variant fl2va на --model-variant ref2va и используйте другой порт. Две RTX 5090 требуют TP2 и дополнительных параметров, поэтому воспользуйтесь подборщиком оборудования SGLang MiniMax H3.
На самом сервере тестируйте через http://127.0.0.1:30010. С другого устройства используйте LAN IP, публичный IP или домен сервера. Поскольку пример содержит --host 0.0.0.0, не открывайте порт в интернет без брандмауэра, аутентификации или обратного прокси. Затем отправляйте T2VA/FL2VA через асинхронный API и опрашивайте статус для получения MP4.
Частые проблемы
- Нет узлов H3: обновите ComfyUI и зависимости, перезапустите.
- Весов нет в списке: проверьте каталог и лишний одноименный уровень.
- Не хватает VRAM: Pruned INT8/FP8, короче видео, ниже разрешение, закройте другие GPU-программы.
- VRAM хватает, система падает: не хватает RAM/swap; сократите выгрузку или энкодер.
- Первый запуск «завис»: проверьте в терминале загрузку и кэш.
- Видео без звука: проверьте аудио-VAE и специальный процесс H3.
Что выбрать?
- Знаете ComfyUI: ComfyUI.
- Мало VRAM, нужен простой интерфейс: WanGP.
- Несколько мощных GPU, внутренний сервис: SGLang.
- Не хотите ничего ставить: онлайн MiniMax H3.
07 Как сократить стоимость локальной генерации?
Не ставьте все параметры на максимум только потому, что веса «бесплатны». Сначала создайте дешевый цикл проб.
- Сначала 5 секунд: проверьте персонажа, движение, камеру и звук, затем 10–15.
- Сначала 480p/768p: подтвердите идею, потом увеличьте или перегенерируйте.
- Квантизация/Pruned: INT8, FP8 и GGUF для черновиков.
- Только нужный вариант: без референсов не скачивайте Ref2VA.
- Фиксируйте seed и меняйте одно: так понятно, что сработало.
- Используйте очередь: пусть компьютер считает несколько задач.
- Учитывайте браузер: запуск Chrome без GPU может освободить примерно 1–5GB VRAM.
Упрощенная стоимость одного локального видео
Если оборудование уже есть и роликов много, средняя цена падает. Покупка двух RTX 5090, 384GB RAM и нового блока питания ради редких видео больше похожа на предоплату счета API в компьютерном магазине.
08 Локальный запуск или онлайн?
| Ситуация | Лучше локально | Лучше онлайн |
|---|---|---|
| Частота | Много ежедневных тестов и вариантов | Редкие ролики, нестабильный объем |
| Оборудование | Уже есть мощный GPU, RAM и SSD | Нет оборудования и желания обновлять ПК ради модели |
| Время и навыки | Готовы работать с Python, CUDA, узлами и зависимостями | Хотите открыть браузер, загрузить файлы и начать |
| Качество и функции | Допустимы 480p/768p, квантизация и ожидание | Нужны полное понимание промпта, скорость или 2K |
| Конфиденциальность | Материалы остаются на своем устройстве | Подходит облако по политике сервиса |
Чтобы просто попробовать текст, изображение или референсы, не нужно скачивать сотни гигабайт. Откройте MiniMax H3 в LitVideo и тратьте время на промпт и кадр, а не на ночные переговоры с CUDA.
В каталоге AI-моделей видео можно сравнить качество, скорость и входные данные. Иногда выгоднее поручить локальным и облачным инструментам то, что каждый умеет лучше.
09 Плюсы и минусы открытых весов
Преимущества
- Нет платы API за каждый локальный запуск.
- Текст, крайние кадры и мультимодальные референсы.
- Видео и стереозвук 32 кГц в одной модели.
- Материалы, промпты и результаты остаются локально.
- ComfyUI, WanGP, SGLang и квантизованные веса.
- Подходит для массовых тестов, очередей и исследований.
Недостатки
- Огромный размер полных официальных весов.
- Малый VRAM требует выгрузки и замедляет работу.
- H3-Context-IR и 2K-регенерация не открыты.
- Официальные схемы ориентированы на несколько GPU.
- Нужны знания драйверов и зависимостей.
- Лицензия ограничивает регионы и способы использования.
10 Частые вопросы
01 Это действительно открытая модель?
Точнее — открытые веса. H3-Base опубликован по Community License, а не Apache 2.0; H3-Context-IR и H3-Regenerate-2K не открыты.
02 Работает ли MiniMax H3 с 8GB VRAM?
WanGP сообщает примерно 5–6GB для 5 секунд 832×480. Попробовать на 8GB можно, но нужны квантизация, выгрузка и достаточная RAM; скорость и качество не равны официальной полной точности.
03 Сколько места нужно?
Весь официальный репозиторий — около 498GB, один FL2VA — около 144GB. Основные файлы ComfyUI занимают 21–66.3GB, плюс энкодер, VAE, среда, кэш и результаты.
04 Что проще новичку: ComfyUI или WanGP?
Знакомым с узлами подойдет готовый процесс ComfyUI. При малом VRAM и желании получить веб-интерфейс с квантизацией и выгрузкой проще начать с WanGP.
05 Можно ли локально получить 2K?
Открытый H3-Base в основном выдает короткую сторону 768 пикселей. H3-Regenerate-2K на 5 августа 2026 года не открыт, поэтому нужен API MiniMax или сторонний апскейлер.
06 Локальная генерация полностью бесплатна?
Платы за каждый инференс нет, но остаются GPU, RAM, SSD, электричество, охлаждение, износ и время. Без готового оборудования сравните полную цену с онлайн-тарифом.
07 Можно ли использовать веса коммерчески?
Россия на 5 августа 2026 года не входит в исключенные регионы, поэтому лицензия дает ограниченные безвозмездные права при соблюдении условий и политики допустимого использования. Перед коммерческим запуском проверьте актуальные ответы по лицензии, регион, сценарий и тип контента.
08 FL2VA или Ref2VA?
Для текста, изображения и первого/последнего кадра выбирайте FL2VA. Ref2VA нужен для нескольких изображений, референсного видео, звука или черт персонажа.
Вывод