MiniMax H3 с открытыми весами: локальная установка, требования и экономия

София Цифрова
София Цифрова

Updated: 2026-08-06

10 мин , 1 просмотры

Когда MiniMax H3 получил открытые веса, моей первой мыслью было не «ура, теперь видео всегда бесплатны», а «отлично, теперь слово за видеокартой и счетом за электричество». Если мощный компьютер у вас уже есть, релиз действительно интересный: модель можно скачать, не платить API за каждый ролик, спокойно проверять промпты, ставить задачи в очередь и хранить материалы на своих дисках.

Но бесплатные веса не означают нулевую стоимость всей системы. Официальная конфигурация по-прежнему требовательна. Квантизация, выгрузка модели и инструменты для малого объема VRAM позволяют работать на потребительских GPU, но ценой дополнительной RAM, меньшего разрешения и ожидания, за которое можно успеть выпить кофе.

MiniMax H3 с открытыми весами: локальная установка и требования

Разберем с точки зрения любителя AI-видео, что именно открыто в генераторе видео MiniMax H3, потянет ли его ваш компьютер и что выгоднее: локальный запуск или онлайн-генерация.

 

01 Что означает релиз MiniMax H3?

Фразу «MiniMax H3 стал открытым» лучше уточнить: это модель с открытыми весами. MiniMax опубликовала на Hugging Face веса H3-Base, конфигурации и компоненты инференса. Их можно скачивать, развертывать, изменять и запускать через SGLang, vLLM, Diffusers, ComfyUI или инструменты сообщества.

Генерацию, которую раньше выполнял облачный сервер, можно перенести на свою машину. При достаточном оборудовании, месте и навыках количество запусков больше не связано напрямую с кредитами или счетом API. Это удобно для массовых тестов раскадровки, постоянства персонажей и рекламных вариантов.

Короткий вывод

Если подходящий GPU уже есть и вы готовы заниматься установкой и ждать, локальный запуск заметно снижает предельную стоимость массовой генерации. Для нескольких роликов время от времени или полного 2K-процесса онлайн-платформа обычно проще и может оказаться дешевле в целом.

Открытые веса — не вся официальная система

Полная система H3 состоит из H3-Context-IR, H3-Base и H3-Regenerate-2K. Опубликован только H3-Base. H3-Context-IR для понимания сложных мультимодальных материалов и H3-Regenerate-2K для повторной генерации в 2K остаются облачными компонентами.

 

02 Что именно опубликовано?

Согласно официальной карточке MiniMax H3, есть два основных варианта. Оба одновременно предсказывают видео и нативный стереозвук, но принимают разные данные.

ВариантВозможностиВходные данные
H3-Base-FL2VAТекст-в-видео, первый, последний или первый и последний кадрыТекст либо 0–2 изображения начального и конечного кадра
H3-Base-Ref2VAМультимодальные референсы, видео-в-видео, звук и персонажТекст с изображениями, видео и аудиореференсами
  • Длительность: 4–15 секунд.
  • Форматы: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 и другие.
  • Локальное разрешение Base: короткая сторона 768 пикселей.
  • Частота: 24 FPS.
  • Звук: стерео 32 кГц, нативная генерация атмосферы, музыки и речи.
  • Языки стабильной речи: 11, включая китайский, английский, японский, корейский и русский.

Открытый Ref2VA принимает до 9 изображений, 3 видео и 3 аудиофайлов, всего не более 12 смешанных файлов. У онлайн-продуктов лимиты могут отличаться, поэтому уточняйте, идет ли речь о локальных весах, официальном API или сторонней платформе.

 

03 Можно ли пользоваться MiniMax H3 бесплатно?

Если под «бесплатно» понимать отсутствие платы за каждый локальный инференс, да, в разрешенных регионах, при соблюдении MiniMax H3 Community License Agreement и политики допустимого использования.

На 5 августа 2026 года Россия не входит в список исключенных регионов, поэтому лицензия предоставляет ограниченное безвозмездное право использования и изменения при соблюдении ее условий. США, ЕС, Великобритания и Южная Корея исключены явно. Перед коммерческим внедрением в любом регионе читайте актуальную редакцию лицензии и при необходимости консультируйтесь с юристом.

Без оплаты за запускОстающиеся расходыОграничения
Локальный инференс и повторные тесты APIGPU, RAM, SSD, электричество, охлаждение и износРегион, правила использования и модули, доступные только через API

MiniMax не заявляет прав на результат генерации, но законность, права на изображение и авторские материалы, а также дальнейшее использование остаются вашей ответственностью. Модель можно забрать домой, ответственность — нет.

 

04 Требования: запустить и работать комфортно — не одно и то же

Ответ на вопрос «хватит ли 8GB VRAM?» зависит от весов, длительности, разрешения, допустимого ожидания и объема RAM для выгрузки модели.

ОборудованиеСпособОпубликованные данныеДля кого
Около 6–9GB VRAMWanGP, квантизация, выгрузка в CPU/RAMДанные сообщества: 5 секунд 832×480 — около 5–6GB; 15 секунд — 8–9GBДля знакомства при согласии на низкое разрешение и ожидание
Один GPU 24–32GBPruned, INT8, FP8 или GGUF с выгрузкойПрактичный потребительский диапазон по мнению сообщества, не официальный тест полной точностиДля авторов, знакомых с ComfyUI и настройками
2× RTX 5090 32GBSGLang TP2 и послойная выгрузкаОфициально: около 384GB RAM; 5 секунд, 1344×768, 50 шагов — 559.67 секундыМощная станция с сохранением официальной точности
4× H100/H200Официальный SGLang на нескольких GPUРекомендованные и проверенные конфигурацииКоманды, исследовательские центры, серверы

Официальный тест SGLang: полный запрос в 50 шагов на двух RTX 5090 занял около 9 минут 20 секунд, пик — около 26.3 GiB на GPU. Это доступнее серверных карт, но еще не простая установка в обычный игровой ПК.

Проект WanGP снижает VRAM до 5–9GB за счет квантизации, выгрузки и меньшего разрешения. Это данные конкретного инструмента сообщества, а не минимум официального BF16. Новыми узкими местами станут RAM, скорость SSD и время.

 

05 Какие веса выбрать: не скачивайте все 498GB

На 5 августа 2026 года официальный репозиторий занимает около 498GB, включая разные задачи, исходный и Diffusers-форматы. Полностью он не нужен.

Один официальный каталог FL2VA — около 144GB. В наборах MiniMax H3 для ComfyUI можно выбрать точность под оборудование.

Основные весаРазмерРекомендация
BF1666.3GBПолная точность, несколько GPU или мощная станция.
INT834GBКомпромисс размера и качества, нужна достаточная память.
Pruned BF1640.2GBМеньший объем при точности BF16.
Pruned FP8/INT821GBЛучший старт для потребительской системы.

21GB — не размер всей установки

Это один файл диффузионной модели. Нужны также текстовый энкодер Qwen3-VL, видео- и аудио-VAE, среда, кэш и место для результатов. Подготовьте быстрый SSD с запасом.

  • Текст, изображение, первый/последний кадры: FL2VA.
  • Персонаж, движение, видео или звук как референс: Ref2VA.
  • Мало VRAM/RAM: Pruned INT8/FP8 или GGUF.
  • Сравнение официального качества: BF16 и несколько GPU.

 

06 Три способа локальной установки MiniMax H3

Единственного правильного способа нет. Выбирайте по оборудованию и по тому, хотите ли вы тратить время на творчество или терминал.

Проверьте до установки

  • ОС: инструкции рассчитаны прежде всего на Windows 10/11 или Linux с NVIDIA GPU.
  • Драйвер: обновите NVIDIA; в готовом ComfyUI проверьте, что PyTorch/CUDA видит GPU.
  • RAM: при малом VRAM компоненты выгружаются в RAM. 32GB может не хватить.
  • SSD: 80–100GB для компактных весов; более 150GB для полного FL2VA плюс кэш и результаты.
  • Задача: текст, изображение и крайние кадры — FL2VA; референсы изображений, видео и звука — Ref2VA.

 

01 Установка через ComfyUI

Подойдет тем, кто знаком с узловыми процессами и хочет менять модель, семплирование и постобработку.

Шаг 1
Обновите ComfyUI

Используйте Manager, обновление настольной версии или Git. Старые версии могут не видеть узлы H3.

Шаг 2
Скачайте одни основные веса

На странице весов Comfy-Org выберите один файл под задачу.

  • FL2VA для потребительского GPU: minimax_h3_fl2va_pruned_int8_convrot.safetensors или minimax_h3_fl2va_pruned_fp8_scaled.safetensors.
  • Мультимодальные референсы: Pruned INT8/FP8 с ref2va в имени.
  • Мощная система: minimax_h3_fl2va_bf16.safetensors или Ref2VA BF16.

Поместите файл в:

ComfyUI/models/diffusion_models/
Шаг 3
Энкодер и два VAE

Одних диффузионных весов недостаточно: нужны текстовый энкодер Qwen3-VL и отдельные VAE для видео и звука.

  • Энкодер: qwen3vl_32b_minimax_h3_int8_convrot.safetensorsComfyUI/models/text_encoders/.
  • Видео-VAE: minimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/.
  • Аудио-VAE: minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/.

После загрузки структура каталогов будет примерно такой:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
    ├── text_encoders/
    │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
    └── vae/
        ├── minimax_h3_video_vae_fp16.safetensors
        └── minimax_h3_audio_vae_fp32.safetensors
Шаг 4
Импортируйте процесс

Скачайте JSON-шаблон под свою задачу и перетащите его на холст ComfyUI.

Шаг 5
Недорогой первый тест

Начните с 5 секунд, малого разрешения, 15–20 шагов и фиксированного seed. Проверьте текст или один первый кадр, видео и звук, а затем повышайте длительность, разрешение и число референсов.

 

02 Установка через WanGP

WanGP автоматически выбирает подходящую модель, выгружает компоненты в RAM и дает браузерный интерфейс. Поддерживаются FL2VA, Ref2VA, полная 33B и облегченная 20B Pruned.

Шаг 1
Получите официальный проект

Скачайте ZIP из официального репозитория DeepBeepMeep/Wan2GP или клонируйте:

git clone https://github.com/deepbeepmeep/Wan2GP.git
cd Wan2GP
Шаг 2
Запустите установщик

В Windows откройте scripts\install.bat, в Linux — scripts/install.sh. При первой установке выберите Auto Install, чтобы создать отдельную среду Python и поставить PyTorch, CUDA и ускорители для GPU.

# Linux
bash scripts/install.sh

В Windows обычно достаточно двойного щелчка по BAT. Модель можно добавить и в существующую стабильную среду WanGP.

Шаг 3
Запустите веб-интерфейс

Windows: scripts\run.bat. Linux:

bash scripts/run.sh

Откройте локальный адрес из терминала и выберите MiniMax H3. При первом выборе FL2VA или Ref2VA подходящие файлы будут скачаны, что займет время.

Шаг 4
Настройте первую генерацию
  • Для текста или первого кадра выберите MiniMax H3 FL2VA.
  • Начните с 832×480 и 5 секунд.
  • Используйте 15–20 шагов и фиксированный seed.
  • При малом VRAM оставьте Lower VRAM.
  • Если не хватает RAM, но GPU свободен, выберите Lower RAM.

Нагрузка не исчезает, а переходит на RAM, SSD и PCIe. Если браузер занимает много VRAM, запустите Chrome через scripts/start-chrome-no-gpu.bat или scripts/start-chrome-no-gpu.sh.

 

03 Развертывание через SGLang

SGLang — одна из рекомендованных платформ для нескольких H100, H200, B200, B300, RTX 5090 или AMD Instinct. Она предлагает асинхронный видео-API, очередь, топологии GPU и настройки производительности.

Шаг 1
Создайте среду и установите SGLang

Выполните официальную команду в отдельной среде Python на Linux-сервере.

uv pip install "sglang[diffusion]" --prerelease=allow
Шаг 2
Запустите FL2VA

Базовая официальная команда для четырех GPU:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --model-variant fl2va \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010

Для референсов замените --model-variant fl2va на --model-variant ref2va и используйте другой порт. Две RTX 5090 требуют TP2 и дополнительных параметров, поэтому воспользуйтесь подборщиком оборудования SGLang MiniMax H3.

Шаг 3
Проверьте загрузку

На самом сервере тестируйте через http://127.0.0.1:30010. С другого устройства используйте LAN IP, публичный IP или домен сервера. Поскольку пример содержит --host 0.0.0.0, не открывайте порт в интернет без брандмауэра, аутентификации или обратного прокси. Затем отправляйте T2VA/FL2VA через асинхронный API и опрашивайте статус для получения MP4.

Частые проблемы

  • Нет узлов H3: обновите ComfyUI и зависимости, перезапустите.
  • Весов нет в списке: проверьте каталог и лишний одноименный уровень.
  • Не хватает VRAM: Pruned INT8/FP8, короче видео, ниже разрешение, закройте другие GPU-программы.
  • VRAM хватает, система падает: не хватает RAM/swap; сократите выгрузку или энкодер.
  • Первый запуск «завис»: проверьте в терминале загрузку и кэш.
  • Видео без звука: проверьте аудио-VAE и специальный процесс H3.

Что выбрать?

  • Знаете ComfyUI: ComfyUI.
  • Мало VRAM, нужен простой интерфейс: WanGP.
  • Несколько мощных GPU, внутренний сервис: SGLang.
  • Не хотите ничего ставить: онлайн MiniMax H3.

 

07 Как сократить стоимость локальной генерации?

Не ставьте все параметры на максимум только потому, что веса «бесплатны». Сначала создайте дешевый цикл проб.

  • Сначала 5 секунд: проверьте персонажа, движение, камеру и звук, затем 10–15.
  • Сначала 480p/768p: подтвердите идею, потом увеличьте или перегенерируйте.
  • Квантизация/Pruned: INT8, FP8 и GGUF для черновиков.
  • Только нужный вариант: без референсов не скачивайте Ref2VA.
  • Фиксируйте seed и меняйте одно: так понятно, что сработало.
  • Используйте очередь: пусть компьютер считает несколько задач.
  • Учитывайте браузер: запуск Chrome без GPU может освободить примерно 1–5GB VRAM.

Упрощенная стоимость одного локального видео

Средняя мощность (кВт) × время генерации (ч) × тариф + износ оборудования + время установки и ожидания

Если оборудование уже есть и роликов много, средняя цена падает. Покупка двух RTX 5090, 384GB RAM и нового блока питания ради редких видео больше похожа на предоплату счета API в компьютерном магазине.

 

08 Локальный запуск или онлайн?

СитуацияЛучше локальноЛучше онлайн
ЧастотаМного ежедневных тестов и вариантовРедкие ролики, нестабильный объем
ОборудованиеУже есть мощный GPU, RAM и SSDНет оборудования и желания обновлять ПК ради модели
Время и навыкиГотовы работать с Python, CUDA, узлами и зависимостямиХотите открыть браузер, загрузить файлы и начать
Качество и функцииДопустимы 480p/768p, квантизация и ожиданиеНужны полное понимание промпта, скорость или 2K
КонфиденциальностьМатериалы остаются на своем устройствеПодходит облако по политике сервиса

Чтобы просто попробовать текст, изображение или референсы, не нужно скачивать сотни гигабайт. Откройте MiniMax H3 в LitVideo и тратьте время на промпт и кадр, а не на ночные переговоры с CUDA.

В каталоге AI-моделей видео можно сравнить качество, скорость и входные данные. Иногда выгоднее поручить локальным и облачным инструментам то, что каждый умеет лучше.

 

09 Плюсы и минусы открытых весов

Преимущества

  • Нет платы API за каждый локальный запуск.
  • Текст, крайние кадры и мультимодальные референсы.
  • Видео и стереозвук 32 кГц в одной модели.
  • Материалы, промпты и результаты остаются локально.
  • ComfyUI, WanGP, SGLang и квантизованные веса.
  • Подходит для массовых тестов, очередей и исследований.

Недостатки

  • Огромный размер полных официальных весов.
  • Малый VRAM требует выгрузки и замедляет работу.
  • H3-Context-IR и 2K-регенерация не открыты.
  • Официальные схемы ориентированы на несколько GPU.
  • Нужны знания драйверов и зависимостей.
  • Лицензия ограничивает регионы и способы использования.

 

10 Частые вопросы

 

01 Это действительно открытая модель?

Точнее — открытые веса. H3-Base опубликован по Community License, а не Apache 2.0; H3-Context-IR и H3-Regenerate-2K не открыты.

 

02 Работает ли MiniMax H3 с 8GB VRAM?

WanGP сообщает примерно 5–6GB для 5 секунд 832×480. Попробовать на 8GB можно, но нужны квантизация, выгрузка и достаточная RAM; скорость и качество не равны официальной полной точности.

 

03 Сколько места нужно?

Весь официальный репозиторий — около 498GB, один FL2VA — около 144GB. Основные файлы ComfyUI занимают 21–66.3GB, плюс энкодер, VAE, среда, кэш и результаты.

 

04 Что проще новичку: ComfyUI или WanGP?

Знакомым с узлами подойдет готовый процесс ComfyUI. При малом VRAM и желании получить веб-интерфейс с квантизацией и выгрузкой проще начать с WanGP.

 

05 Можно ли локально получить 2K?

Открытый H3-Base в основном выдает короткую сторону 768 пикселей. H3-Regenerate-2K на 5 августа 2026 года не открыт, поэтому нужен API MiniMax или сторонний апскейлер.

 

06 Локальная генерация полностью бесплатна?

Платы за каждый инференс нет, но остаются GPU, RAM, SSD, электричество, охлаждение, износ и время. Без готового оборудования сравните полную цену с онлайн-тарифом.

 

07 Можно ли использовать веса коммерчески?

Россия на 5 августа 2026 года не входит в исключенные регионы, поэтому лицензия дает ограниченные безвозмездные права при соблюдении условий и политики допустимого использования. Перед коммерческим запуском проверьте актуальные ответы по лицензии, регион, сценарий и тип контента.

 

08 FL2VA или Ref2VA?

Для текста, изображения и первого/последнего кадра выбирайте FL2VA. Ref2VA нужен для нескольких изображений, референсного видео, звука или черт персонажа.

Вывод

Главное в открытых весах MiniMax H3 не нулевая цена каждого запуска, а возможность самому выбирать оборудование, точность и обмен времени на меньшие расходы. Мощная готовая система и много тестов делают локальную очередь выгодной. На 8GB можно знакомиться через WanGP, принимая малое разрешение, выгрузку и ожидание. Для редкой генерации, без подходящего ПК или с потребностью в полном 2K-процессе онлайн остается проще. На платформе LitMedia AI можно сравнить инструменты для видео, изображений и музыки.

Вам также может понравиться