MiniMax H3 오픈 웨이트 소식을 들었을 때 제 첫 생각은 “이제 영상 생성이 영원히 공짜네!”가 아니라 “좋아, 이제 그래픽카드와 전기요금이 말할 차례군”이었습니다. 성능 좋은 PC를 이미 갖고 있다면 이번 공개는 꽤 매력적입니다. 모델을 로컬에 내려받으면 매 영상마다 API 비용을 내지 않고 프롬프트를 천천히 시험하고, 작업을 대기열에 넣고, 자료를 내 드라이브에 보관할 수 있습니다.
다만 모델 웨이트가 무료라고 전체 과정이 무비용인 것은 아닙니다. 공식 구성은 여전히 높은 사양을 요구합니다. 커뮤니티의 양자화, 모델 오프로딩, 저VRAM 도구로 소비자용 GPU에서도 가능해졌지만, 더 많은 시스템 메모리와 낮은 해상도, 커피를 다 마셔도 렌더링이 끝나지 않을 수 있는 기다림이 따라옵니다.

이 글에서는 AI 영상 애호가의 관점에서 MiniMax H3 AI 영상 생성기가 실제로 무엇을 공개했는지, 내 PC에서 돌아가는지, 로컬과 온라인 중 어느 쪽이 진짜 경제적인지 살펴봅니다.
목차
01 MiniMax H3 공개는 무엇을 뜻할까?
흔히 “MiniMax H3 오픈소스”라고 하지만 정확히는 오픈 웨이트입니다. MiniMax는 Hugging Face에 H3-Base 웨이트, 설정 파일, 추론 구성 요소를 공개했습니다. 개발자는 이를 다운로드·배포·수정하고 SGLang, vLLM, Diffusers, ComfyUI 또는 커뮤니티 도구에서 실행할 수 있습니다.
가장 큰 변화는 클라우드 서버가 하던 영상 생성을 내 장비로 옮길 수 있다는 점입니다. 충분한 장비, 저장 공간, 기술이 있다면 생성 횟수가 포인트나 API 청구서에 직접 묶이지 않습니다. 스토리보드, 캐릭터 일관성, 광고 버전을 많이 시험하는 제작자에게 특히 매력적입니다.
한 줄 결론
오픈 웨이트가 공식 서비스 전체 공개를 뜻하지는 않습니다
전체 H3 시스템은 H3-Context-IR, H3-Base, H3-Regenerate-2K로 구성됩니다. 공개된 것은 H3-Base뿐입니다. 복잡한 멀티모달 자료를 해석하는 H3-Context-IR과 결과를 2K로 다시 생성하는 H3-Regenerate-2K는 여전히 호스팅 서비스입니다.
02 무엇이 공개됐을까?
MiniMax H3 공식 모델 카드에 따르면 오픈 웨이트는 두 가지 주요 작업 버전으로 나뉩니다. 둘 다 영상과 네이티브 스테레오 오디오를 함께 예측하지만 입력 방식이 다릅니다.
| 모델 버전 | 기능 | 입력 방식 |
|---|---|---|
| H3-Base-FL2VA | 텍스트, 첫 프레임, 마지막 프레임, 첫·마지막 프레임 영상 생성 | 텍스트만 또는 첫·마지막 프레임용 이미지 0~2장 |
| H3-Base-Ref2VA | 멀티모달 참조 영상, 영상 변환, 음성·캐릭터 참조 | 텍스트와 이미지·영상·오디오 참조 자료 |
- 길이: 4~15초.
- 화면 비율: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 등.
- 로컬 Base 해상도: 기본 짧은 변 768픽셀.
- 프레임 레이트: 24 FPS.
- 오디오: 32 kHz 스테레오, 환경음·음악·대화 네이티브 생성.
- 안정적인 대화 언어: 중국어, 영어, 일본어, 한국어, 러시아어 등 11개 언어.
오픈 Ref2VA는 이미지 최대 9장, 영상 3개, 오디오 3개를 받을 수 있고 혼합 파일은 총 12개까지입니다. 온라인 제품의 한도는 다를 수 있으므로 로컬 웨이트, 공식 API, 제3자 플랫폼 중 무엇을 비교하는지 먼저 확인하세요.
03 MiniMax H3를 정말 무료로 쓸 수 있을까?
“무료”가 로컬 추론 때마다 모델 비용을 내지 않는다는 뜻이라면, 한국에서는 커뮤니티 라이선스를 근거로 그렇게 말할 수 없습니다. MiniMax H3 Community License Agreement는 적용 지역과 허용 범위를 명시합니다.
2026년 8월 5일 기준으로 대한민국은 미국, EU, 영국과 함께 커뮤니티 라이선스의 명시적 제외 지역입니다. 따라서 한국의 개인이나 기업은 오픈 웨이트를 내려받았다는 이유만으로 무료 로컬 이용이나 상업 이용이 허용된다고 가정하면 안 됩니다. 조직은 MiniMax에 정식 라이선스를 신청할 수 있으며, 전 세계에서 제공되는 호스팅 API 또는 온라인 서비스를 이용하는 방법도 있습니다. 배포 전 최신 라이선스와 이용 규정을 반드시 확인하세요.
| 웨이트 접근과 비용 | 남는 비용 | 중요한 제한 |
|---|---|---|
| 파일 공개와 이용 허가는 별개이며, 한국은 커뮤니티 라이선스 제외 지역 | GPU, RAM, SSD, 전기, 냉각, 감가상각 | 지역, 이용 규정, 정식 라이선스, API가 필요한 공식 모듈 |
MiniMax는 생성물에 대한 권리를 주장하지 않지만 적법성, 초상권·저작권, 후속 이용의 책임은 사용자에게 있습니다. 모델 파일을 집에 가져왔다고 책임까지 클라우드로 돌려보낼 수는 없습니다.
04 하드웨어 요구 사항: 실행과 쾌적한 실행은 다릅니다
“8GB VRAM으로 되나요?”의 답은 웨이트, 길이, 해상도, 기다릴 수 있는 시간, 오프로딩에 쓸 시스템 메모리에 따라 달라집니다.
| 장비 | 가능한 방식 | 공개 데이터 | 추천 대상 |
|---|---|---|---|
| 약 6~9GB VRAM | WanGP 최적화, 양자화, CPU/RAM 오프로딩 | 커뮤니티 주장: 832×480 5초 약 5~6GB, 15초 약 8~9GB | 낮은 해상도와 긴 대기를 감수하는 체험 사용자 |
| 24~32GB 단일 GPU | Pruned, INT8, FP8, GGUF와 오프로딩 | 커뮤니티가 실용적인 소비자 구간으로 보지만 공식 완전 정밀도 기준은 아님 | ComfyUI와 설정 조정에 익숙한 제작자 |
| 2× RTX 5090 32GB | SGLang TP2, 계층 오프로딩 | 공식 검증: 약 384GB급 RAM, 5초·1344×768·50스텝에 약 559.67초 | 공식 정밀도를 원하는 고급 워크스테이션 사용자 |
| 4× H100/H200 | 공식 SGLang 멀티 GPU | 상주 또는 GPU 분할을 위한 공식 권장·검증 구성 | 팀, 연구기관, 서버 배포 |
SGLang 공식 테스트에서는 RTX 5090 두 장의 50스텝 요청이 약 9분 20초, GPU당 피크가 약 26.3 GiB였습니다. 데이터센터 GPU보다 친숙해졌지만 일반 게이밍 PC에 꽂고 바로 쓰는 수준은 아닙니다.
WanGP 커뮤니티 프로젝트는 양자화, 계층 오프로딩, 저해상도로 5~9GB까지 낮춥니다. 이는 특정 커뮤니티 도구의 수치이며 공식 BF16 최소 사양이 아닙니다. RAM, SSD 속도, 생성 시간이 새 병목이 될 수 있습니다.
05 웨이트 선택: 498GB를 한꺼번에 받지 마세요
2026년 8월 5일 기준 공식 Hugging Face 저장소는 약 498GB입니다. 여러 작업 구역과 원본·Diffusers 형식을 모두 포함하므로 전부 받을 필요는 없습니다.
공식 FL2VA 한 디렉터리는 약 144GB입니다. ComfyUI용 MiniMax H3 웨이트에서 장비와 품질에 맞게 고를 수 있습니다.
| 주요 확산 웨이트 | 크기 | 권장 |
|---|---|---|
| BF16 | 66.3GB | 완전 정밀도, 멀티 GPU와 고급 워크스테이션. |
| INT8 | 34GB | 크기와 품질 절충, 충분한 메모리 필요. |
| Pruned BF16 | 40.2GB | BF16 정밀도를 유지하며 일부 용량 절감. |
| Pruned FP8/INT8 | 21GB | 소비자용 장비와 첫 설치에 적합. |
21GB가 전체 설치 용량은 아닙니다
주요 확산 모델 한 파일의 크기입니다. Qwen3-VL 텍스트 인코더, 영상 VAE, 오디오 VAE, 실행 환경, 캐시, 출력 공간도 필요하므로 여유 있는 고속 SSD를 준비하세요.
- 텍스트·이미지·첫/마지막 프레임: FL2VA.
- 인물·동작·영상·오디오 참조: Ref2VA.
- VRAM/RAM 제한: Pruned INT8/FP8 또는 GGUF.
- 공식 품질 비교: BF16과 멀티 GPU.
06 MiniMax H3 로컬 설치 방법 3가지
유일한 정답은 없습니다. 가진 장비와 창작·터미널 중 어디에 시간을 쓰고 싶은지에 따라 선택하세요.
설치 전 확인
- OS: Windows 10/11 또는 Linux와 NVIDIA GPU 중심.
- 드라이버: NVIDIA 드라이버를 업데이트하고 PyTorch/CUDA의 GPU 인식을 확인.
- RAM: 저VRAM 구성은 많은 구성 요소를 RAM으로 옮깁니다. 32GB는 빠듯할 수 있습니다.
- SSD: 경량 웨이트는 80~100GB, 공식 FL2VA는 150GB 이상과 캐시·출력 공간 확보.
- 작업: 텍스트·이미지·첫/마지막 프레임은 FL2VA, 이미지·영상·음성 참조는 Ref2VA.
01 ComfyUI 설치
노드 워크플로에 익숙하거나 모델, 샘플링, 후처리를 직접 바꾸고 싶은 제작자에게 적합합니다.
Manager, 데스크톱 업데이트, Git으로 최신 버전을 설치하세요. 구버전은 H3 노드를 찾지 못할 수 있습니다.
Comfy-Org 웨이트 페이지에서 용도에 맞는 하나를 고릅니다.
- 소비자용 GPU FL2VA:
minimax_h3_fl2va_pruned_int8_convrot.safetensors또는minimax_h3_fl2va_pruned_fp8_scaled.safetensors. - 멀티모달 참조: 파일명에
ref2va가 있는 Pruned INT8/FP8. - 고급 멀티 GPU:
minimax_h3_fl2va_bf16.safetensors또는 Ref2VA BF16.
저장 위치:
ComfyUI/models/diffusion_models/
MiniMax H3는 확산 웨이트 하나만으로 작동하지 않습니다. Qwen3-VL 텍스트 인코더와 영상·오디오용 VAE도 필요합니다.
- 텍스트:
qwen3vl_32b_minimax_h3_int8_convrot.safetensors→ComfyUI/models/text_encoders/. - 영상 VAE:
minimax_h3_video_vae_fp16.safetensors→ComfyUI/models/vae/. - 오디오 VAE:
minimax_h3_audio_vae_fp32.safetensors→ComfyUI/models/vae/.
정리한 뒤 폴더 구조는 대략 다음과 같습니다.
ComfyUI/
└── models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors
작업에 맞는 JSON 템플릿을 내려받아 ComfyUI 캔버스로 끌어놓습니다.
5초, 낮은 해상도, 15~20스텝, 고정 시드로 시작합니다. 텍스트만 또는 첫 프레임 한 장으로 영상과 소리를 확인한 뒤 길이·해상도·참조를 늘리세요.
02 WanGP 설치
하드웨어에 맞는 모델 자동 선택, RAM 오프로딩, 브라우저 UI가 장점입니다. FL2VA/Ref2VA, 33B와 경량 20B Pruned를 지원합니다.
DeepBeepMeep/Wan2GP 공식 GitHub에서 ZIP을 받거나 복제합니다.
git clone https://github.com/deepbeepmeep/Wan2GP.git
cd Wan2GP
Windows는 scripts\install.bat, Linux는 scripts/install.sh를 실행합니다. 처음에는 Auto Install로 전용 Python 환경과 GPU용 PyTorch, CUDA, 가속 패키지를 설치합니다.
# Linux
bash scripts/install.shWindows는 보통 BAT 파일을 더블클릭하면 됩니다. 기존 WanGP 환경에 추가할 수도 있습니다.
Windows는 scripts\run.bat, Linux는 다음을 실행합니다.
bash scripts/run.sh터미널의 로컬 URL을 브라우저에서 열고 MiniMax H3를 선택하세요. 처음에는 장비에 맞는 파일을 내려받아 시간이 걸립니다.
- 텍스트나 첫 프레임만 시험하면 MiniMax H3 FL2VA.
- 832×480, 5초부터.
- 15~20스텝, 시드 고정.
- 저VRAM 장비는 Lower VRAM.
- RAM이 부족하고 GPU가 남으면 Lower RAM.
부하는 사라지지 않고 RAM, SSD, PCIe로 이동합니다. 브라우저 VRAM 사용이 크면 scripts/start-chrome-no-gpu.bat 또는 scripts/start-chrome-no-gpu.sh를 사용하세요.
03 SGLang 배포
SGLang은 공식 권장 프레임워크 중 하나로 H100, H200, B200, B300, RTX 5090, AMD Instinct 등 멀티 GPU에 적합합니다. 비동기 영상 API, 대기열, GPU 토폴로지와 성능 설정을 제공합니다.
Linux 서버의 독립된 Python 환경에서 공식 설치 명령을 실행합니다.
uv pip install "sglang[diffusion]" --prerelease=allow
공식 문서의 4GPU 기본 구성입니다.
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--model-variant fl2va \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010참조 생성은 --model-variant fl2va를 --model-variant ref2va로 바꾸고 다른 포트를 사용합니다. RTX 5090 두 장은 추가 옵션이 필요하므로 4GPU 설정을 그대로 쓰지 말고 SGLang MiniMax H3 하드웨어 선택기를 이용하세요.
서버 자체에서 시험할 때는 http://127.0.0.1:30010, 다른 장치에서는 서버의 LAN IP, 공개 IP 또는 도메인을 사용합니다. 예시는 --host 0.0.0.0이므로 방화벽, 인증, 리버스 프록시 없이 공개 인터넷에 포트를 노출하지 마세요. 연결 후 비동기 API로 T2VA/FL2VA 작업을 보내고 상태를 조회해 MP4를 받습니다.
자주 생기는 설치 문제
- H3 노드가 없음: ComfyUI와 의존성을 업데이트하고 재시작.
- 웨이트가 목록에 없음: 폴더 위치와 중복 디렉터리 확인.
- VRAM 부족: Pruned INT8/FP8, 짧은 영상, 낮은 해상도 사용.
- VRAM은 충분한데 시스템 종료: RAM/스왑 부족. 오프로딩을 줄이거나 가벼운 인코더 사용.
- 첫 실행이 멈춘 듯함: 터미널의 다운로드·캐시 진행 확인.
- 영상만 있고 소리 없음: 오디오 VAE와 H3 전용 워크플로 확인.
무엇을 고를까?
- ComfyUI 경험자: ComfyUI.
- VRAM이 적고 쉬운 UI 선호: WanGP.
- 고급 GPU 여러 장으로 내부 서비스: SGLang.
- 설치하기 싫음: 온라인 MiniMax H3.
07 로컬 생성 비용을 더 줄이는 방법
“무료”라고 모든 설정을 최대로 올리지 말고 저렴한 시행착오 과정을 먼저 만드세요.
- 5초부터: 인물, 동작, 카메라, 소리를 확인한 뒤 10~15초로.
- 480p/768p부터: 방향 확인 후 업스케일 또는 고품질 재생성.
- 양자화/Pruned: INT8, FP8, GGUF를 초안에 활용.
- 필요한 구역만: 참조가 없으면 Ref2VA는 받지 않기.
- 시드 고정, 한 번에 하나만 변경: 무엇이 효과적인지 구분.
- 작업 대기열: 여러 작업을 묶어 기다리는 시간 절약.
- 브라우저 GPU도 계산: 환경에 따라 약 1~5GB VRAM을 확보할 수 있음.
로컬 영상 한 편의 단순 비용 공식
장비가 이미 있고 매일 많이 만들수록 평균 비용은 내려갑니다. 가끔 몇 편을 위해 RTX 5090 두 장, 384GB RAM, 새 전원공급장치를 산다면 무료라기보다 API 비용을 하드웨어 매장에 선불로 내는 셈입니다.
08 로컬 설치 vs 온라인 생성
| 상황 | 로컬 추천 | 온라인 추천 |
|---|---|---|
| 빈도 | 매일 대량 테스트와 배치 생성 | 가끔 만들고 양이 일정하지 않음 |
| 장비 | 고급 GPU, 충분한 RAM과 SSD 보유 | 적합한 장비가 없고 한 모델 때문에 업그레이드하기 싫음 |
| 시간·기술 | Python, CUDA, 노드, 의존성 관리 가능 | 브라우저에서 업로드 후 바로 생성 |
| 품질·기능 | 480p/768p, 양자화, 긴 대기 허용 | 완전한 이해, 빠른 출력, 2K 필요 |
| 개인정보 | 자료와 결과를 내 장치에 보관 | 플랫폼 정책에 따라 클라우드 사용 |
먼저 체험하려는 경우 수백 GB를 받을 필요가 없습니다. LitVideo MiniMax H3 텍스트 영상 도구에서 CUDA 버전과 밤늦게 협상하는 대신 프롬프트와 장면에 시간을 쓰세요.
AI 영상 모델 목록에서 품질, 속도, 입력 방식도 비교할 수 있습니다. 로컬이나 클라우드 하나만 고집하기보다 각 도구가 잘하는 일을 맡기는 것이 가장 저렴할 때도 있습니다.
09 오픈 웨이트 버전의 장단점
기대할 장점
- 로컬 추론의 회당 API 비용이 없음.
- 텍스트, 첫/마지막 프레임, 멀티모달 참조 지원.
- 영상과 32 kHz 스테레오를 한 모델에서 생성.
- 자료, 프롬프트, 결과를 내 장치에 유지.
- ComfyUI, WanGP, SGLang, 양자화 웨이트 사용 가능.
- 대량 테스트, 대기열, 맞춤 연구에 적합.
GPU 주문 전 알아둘 단점
- 공식 전체 웨이트와 저장 공간이 매우 큼.
- 저VRAM 버전은 오프로딩으로 느릴 수 있음.
- H3-Context-IR과 2K 재생성 미공개.
- 공식 배포는 여전히 멀티 GPU·고급 워크스테이션 중심.
- 설치, 의존성, 드라이버 지식 필요.
- 커뮤니티 라이선스에 지역·용도 제한.
10 자주 묻는 질문
01 진짜 오픈소스 모델인가요?
오픈 웨이트가 정확합니다. H3-Base는 Apache 2.0이 아닌 Community License로 공개됐고 H3-Context-IR과 H3-Regenerate-2K는 공개되지 않았습니다.
02 8GB VRAM으로 실행할 수 있나요?
WanGP 커뮤니티는 5초·832×480에 약 5~6GB를 주장합니다. 8GB도 체험할 수 있지만 양자화, 오프로딩, 충분한 RAM이 필요하며 공식 완전 정밀도와 같은 속도·품질은 아닙니다.
03 디스크 공간은 얼마나 필요한가요?
공식 전체 저장소 약 498GB, FL2VA 한 디렉터리 약 144GB입니다. ComfyUI 주요 웨이트는 21~66.3GB지만 인코더, VAE, 환경, 캐시, 출력 공간이 추가됩니다.
04 초보자는 ComfyUI와 WanGP 중 무엇이 좋나요?
ComfyUI 노드에 익숙하면 기존 워크플로가 자연스럽습니다. VRAM이 적고 웹 UI가 양자화와 오프로딩을 골라주길 원하면 WanGP가 시작하기 쉽습니다.
05 로컬에서 2K 영상을 만들 수 있나요?
공개 H3-Base는 주로 짧은 변 768픽셀입니다. 2K용 H3-Regenerate-2K는 2026년 8월 5일 현재 미공개이므로 MiniMax API 또는 제3자 업스케일러가 필요합니다.
06 로컬 생성은 완전히 무료인가요?
회당 추론료는 없을 수 있지만 GPU, RAM, SSD, 전기, 냉각, 감가상각, 시간이 듭니다. 다만 한국에서는 커뮤니티 라이선스가 제외되므로 비용과 별도로 정식 이용 권한부터 확인해야 합니다.
07 오픈 웨이트를 상업적으로 쓸 수 있나요?
한국은 커뮤니티 라이선스 제외 지역이므로 공개 웨이트를 무료로 상업 이용할 수 있다고 해석하면 안 됩니다. 조직은 MiniMax에 정식 라이선스를 신청하거나 전 세계에서 제공되는 호스팅 API를 이용할 수 있습니다. 도입 전 최신 라이선스 Q&A와 이용 규정을 확인하세요.
08 FL2VA와 Ref2VA 중 무엇을 받을까요?
텍스트, 이미지, 첫/마지막 프레임이면 FL2VA입니다. 여러 이미지, 참조 영상, 오디오, 인물 특성을 이용할 때만 Ref2VA를 선택하세요.
결론