MiniMax H3 開源之後,我第一個念頭不是「太好了,以後生成影片都不用錢」,而是「好,現在輪到顯卡和電費帳單說話了」。如果你本來就有一台效能不錯的電腦,這次開放權重確實很有吸引力:模型下載到本機後,不必每生成一支影片就支付 API 費用,也能慢慢測試提示詞、批次排隊,甚至把素材留在自己的硬碟裡。
不過,模型權重免費,不等於整套流程零成本。官方版本的硬體需求依然很高,社群雖然已經用量化、模型卸載與低顯存工具把門檻壓到消費級顯卡,但代價通常是更多系統記憶體、更低解析度,以及「泡完一杯咖啡,影片可能還在算」的等待時間。
這篇文章會用 AI 影片愛好者比較在意的方式,拆解 MiniMax H3 AI 影片生成器這次到底開放了什麼、你的電腦跑不跑得動,以及本機部署和線上生成哪一種真的比較省錢。
文章目錄
01 MiniMax H3 開源代表什麼?
大家習慣說「MiniMax H3 開源」,更精確的說法其實是開放模型權重。MiniMax 在 Hugging Face 上釋出 H3-Base 的模型權重、設定檔與推理所需元件,開發者可以下載、部署、修改,也可以透過 SGLang、vLLM、Diffusers、ComfyUI 或社群工具在自己的設備上執行。
這件事最直接的改變,是你可以把原本由雲端伺服器完成的影片生成工作搬回本機。只要設備、儲存空間和技術能力足夠,生成次數不再直接綁定點數或 API 帳單。對需要大量測試分鏡、角色一致性或廣告版本的創作者來說,這種自由度很迷人。
先用一句話說結論
開放權重不等於完整官方服務全開放
官方完整 H3 系統包含 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 三個部分。目前公開的是 H3-Base;負責理解複雜多模態素材的 H3-Context-IR,以及將結果重新生成為 2K 的 H3-Regenerate-2K,都還是託管服務。
02 這次到底開放了什麼?
根據 MiniMax H3 官方模型卡,開放權重分成兩個主要任務版本。它們都能同時預測影片與原生立體聲,只是接受素材的方式不同。
| 模型版本 | 可以做什麼 | 輸入方式 |
|---|---|---|
| H3-Base-FL2VA | 文生影片、首幀生影片、尾幀生影片、首尾幀生影片 | 純文字,或加入 0–2 張圖片作為首幀與尾幀 |
| H3-Base-Ref2VA | 多模態參考生影片、影片轉影片、聲音與角色參考 | 文字搭配圖片、影片和音訊參考素材 |
- 影片長度:4–15 秒。
- 畫面比例:支援 21:9、16:9、4:3、1:1、3:4、9:16 等常用比例。
- 本機 Base 解析度:預設短邊 768 像素。
- 幀率:24 FPS。
- 音訊:32 kHz 立體聲,可原生生成環境音、音樂與對話。
- 穩定對話語言:包含中文、英文、日文、韓文、俄文等 11 種語言。
開源版 Ref2VA 的官方規格最多接受 9 張圖片、3 段影片與 3 段音訊,混合輸入總數最多 12 個檔案。這和部分線上產品顯示的參考素材上限可能不同,因此比較時要先確認你談的是本機權重、官方 API,還是第三方平台版本。
03 MiniMax H3 真的可以免費使用嗎?
如果「免費」指的是不必為每次本機推理支付模型費用,答案是可以! 但前提是你位於授權適用地區,並遵守 MiniMax H3 Community License Agreement 與可接受使用政策。
截至 2026 年 8 月 5 日,這份授權提供有限、免權利金的使用與修改權,但明確把美國、歐盟、英國和韓國列為排除地區。台灣目前沒有被列在排除清單中;若你在其他地區部署,或打算把模型整合進商業服務,仍應先閱讀最新版授權,必要時尋求法律意見。
| 不用按次支付的部分 | 依然存在的成本 | 容易被忽略的限制 |
|---|---|---|
| 本機模型推理費、反覆測試的 API 費用 | GPU、系統記憶體、SSD、電費、散熱與硬體折舊 | 授權地區、可接受使用政策、部分官方模組仍需 API |
授權也寫明 MiniMax 不主張你生成內容的權利,但影片是否合法、是否侵犯肖像或著作權,以及後續如何使用,仍由使用者自行負責。簡單說,模型可以搬回家,責任不會一起被打包丟回雲端。
04 MiniMax H3 硬體需求:能跑和跑得舒服差很多
目前最熱鬧的問題就是「8GB 顯存能不能跑 MiniMax H3?」這裡的顯存是顯示記憶體(VRAM)的常見簡稱。答案不是單純的可以或不可以,而是要先問:用哪個權重、生成幾秒、什麼解析度、願意等多久,以及有多少系統記憶體可以拿來做模型卸載。
| 設備級別 | 目前可行方式 | 已公開數據 | 適合誰 |
|---|---|---|---|
| 約 6–9GB 顯存 | WanGP 社群最佳化、量化權重、CPU/RAM 卸載 | 社群聲稱 5 秒 832×480 約需 5–6GB;15 秒約需 8–9GB | 想嘗鮮、願意等待,也能接受較低解析度的人 |
| 24–32GB 單卡 | Pruned、INT8、FP8 或 GGUF 搭配模型卸載 | 社群普遍視為較實用的消費級區間,但不是官方完整精度基準 | 經常生成、熟悉 ComfyUI 或願意調整參數的創作者 |
| 2× RTX 5090 32GB | SGLang TP2 與分層卸載 | 官方驗證需約 384GB 級系統記憶體;5 秒、1344×768、50 步約 559.67 秒 | 想保留官方精度,並願意投資高階工作站的人 |
| 4× H100/H200 | 官方 SGLang 多卡部署 | 官方建議與實測配置,可讓完整模型常駐或進行多卡切分 | 團隊、研究機構與伺服器部署 |
SGLang 官方部署實測顯示,雙 RTX 5090 的 50 步完整請求約花 9 分 20 秒,每張 GPU 峰值約 26.3 GiB。這已經比資料中心 GPU 親民,但仍不是一般遊戲主機插上顯卡就能無痛起飛的等級。
另一邊,WanGP 社群專案透過量化、分層卸載和低解析度輸出,把顯存需求壓到 5–9GB。這些數據很令人興奮,但它們代表的是特定社群工具與設定,不是官方 BF16 權重的最低需求。系統記憶體、硬碟讀寫和生成時間仍可能成為新的瓶頸。
05 權重怎麼選?別一口氣下載 498GB
MiniMax 官方 Hugging Face 主倉庫截至 2026 年 8 月 5 日顯示約 498GB。這個數字看起來像在考驗 SSD 的信仰,但它同時包含不同任務分區,以及原始格式與 Diffusers 格式;一般使用者不需要把整個倉庫全部搬回家。
例如,單一官方 FL2VA 目錄約 144GB。若改用 ComfyUI 整理的 MiniMax H3 權重,可以依顯卡與畫質需求選擇不同精度。
| 主要擴散權重 | 單檔大小 | 選擇建議 |
|---|---|---|
| BF16 | 66.3GB | 保留完整精度,適合多卡或高階工作站。 |
| INT8 | 34GB | 在容量與品質之間折衷,仍需要充足記憶體與卸載空間。 |
| Pruned BF16 | 40.2GB | 減少部分模型容量,同時維持 BF16 精度。 |
| Pruned FP8/INT8 | 21GB | 較適合消費級設備與第一次本機部署。 |
21GB 不等於整套安裝只占 21GB
上表是主要擴散模型單檔大小。實際執行還需要 Qwen3-VL 文字編碼器、影片 VAE、音訊 VAE、程式環境、快取和輸出空間。下載前最好先準備一顆空間充足的高速 SSD。
- 只做文生、圖生或首尾幀:先下載 FL2VA。
- 需要人物、動作、影片或聲音參考:選擇 Ref2VA。
- 顯存與記憶體有限:從 Pruned INT8/FP8 或社群 GGUF 版本開始。
- 想忠實比較官方品質:再考慮 BF16 與多 GPU 部署。
06 三種 MiniMax H3 本機部署方法
MiniMax H3 本機部署沒有唯一正解。選工具時不用追求看起來最專業的那條路,而是看你手上有什麼設備,以及你想把時間花在創作還是終端機上。下面三條路線都能跑 H3,但安裝難度和硬體方向完全不同。
安裝前先確認這幾件事
- 作業系統:以下流程以 Windows 10/11 或 Linux 搭配 NVIDIA GPU 為主,這也是目前文件與社群支援最完整的組合。
- 顯示卡驅動程式:先更新 NVIDIA 驅動程式;若使用既有 ComfyUI,也要確認 PyTorch 與 CUDA 環境能正常辨識 GPU。
- 系統記憶體:低顯存方案會把大量模型元件卸載到 RAM。32GB 可能相當吃緊,記憶體越充足,模型切換與解碼通常越穩定。
- SSD 空間:精簡權重建議至少預留 80–100GB;若使用官方單一 FL2VA 完整目錄,最好準備 150GB 以上,並另外保留快取與輸出空間。
- 先選任務:文生、圖生與首尾幀控制選 FL2VA;需要圖片、影片或音訊參考才選 Ref2VA。
01 用 ComfyUI 安裝 MiniMax H3
ComfyUI 適合已經熟悉節點工作流,或想直接修改模型、取樣和後製節點的創作者。Comfy-Org 已提供整理過的 BF16、INT8、Pruned FP8/INT8 權重,以及文生影片、圖生影片與參考生影片範本。
使用 ComfyUI Manager、桌面版更新功能或原本的 Git 更新方式,將 ComfyUI 升到最新版。MiniMax H3 是剛加入的新模型,舊版本可能找不到對應節點或模型類型。
前往 Comfy-Org MiniMax H3 權重頁面。第一次安裝不必全部下載,依任務和設備挑一個即可:
- 消費級顯卡先測 FL2VA:
minimax_h3_fl2va_pruned_int8_convrot.safetensors或minimax_h3_fl2va_pruned_fp8_scaled.safetensors。 - 需要多模態參考:改選檔名包含
ref2va的對應 Pruned INT8/FP8 權重。 - 多卡高階工作站:可使用
minimax_h3_fl2va_bf16.safetensors或 Ref2VA BF16。
把下載的檔案放進:
ComfyUI/models/diffusion_models/
MiniMax H3 不是只有一個擴散權重就能工作。還需要 Qwen3-VL 文字編碼器,以及影片與音訊各自使用的 VAE。
- 文字編碼器:
qwen3vl_32b_minimax_h3_int8_convrot.safetensors,放進ComfyUI/models/text_encoders/。 - 影片 VAE:
minimax_h3_video_vae_fp16.safetensors,放進ComfyUI/models/vae/。 - 音訊 VAE:
minimax_h3_audio_vae_fp32.safetensors,同樣放進ComfyUI/models/vae/。
整理完成後,資料夾大致會長這樣:
ComfyUI/
└── models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors
下載與任務一致的 JSON 範本,再把檔案拖進 ComfyUI 畫布:
在節點中選擇剛才放入的模型、文字編碼器和 VAE。第一次建議使用 5 秒、較低解析度、15–20 個推理步數和固定種子。先生成純文字或單張首幀任務,確認影片與聲音都能正常輸出,再逐步增加時長、解析度與參考素材。
02 用 WanGP 安裝 MiniMax H3
WanGP 的強項是自動選擇較適合硬體的模型、把部分元件卸載到系統記憶體,並提供瀏覽器介面。它支援 MiniMax H3 FL2VA 與 Ref2VA,也提供完整 33B 和較輕量的 20B Pruned 版本。
從 DeepBeepMeep/Wan2GP 官方 GitHub下載 ZIP,或使用 Git 複製儲存庫:
git clone https://github.com/deepbeepmeep/Wan2GP.git
cd Wan2GP
Windows 使用者開啟 scripts\install.bat;Linux 使用者執行 scripts/install.sh。第一次安裝可選擇 Auto Install,讓指令稿建立獨立 Python 環境,並安裝適合目前 GPU 的 PyTorch、CUDA 與加速套件。
# Linux
bash scripts/install.sh
Windows 通常直接按兩下 BAT 檔案即可,不必先手動安裝整套 Python 相依套件。若電腦裡已經有穩定的 WanGP 環境,也可以在安裝程式中選擇加入既有環境。
安裝完成後,Windows 開啟 scripts\run.bat,Linux 執行:
bash scripts/run.sh
終端機會顯示本機網址,用瀏覽器開啟後,在模型清單選擇 MiniMax H3。第一次選擇 FL2VA 或 Ref2VA 時,WanGP 會下載與目前硬體相符的模型檔案,因此可能需要等待一段時間。
- 只測試文字或首幀時選擇 MiniMax H3 FL2VA。
- 畫面先設為 832×480,長度選擇 5 秒。
- 推理步數先用 15–20 步,並固定種子。
- 低顯存裝置保留 Lower VRAM 優先模式。
- 如果系統記憶體反而不足,而 GPU 還有空間,可在進階設定改選 Lower RAM。
低顯存不是魔法消失,而是把壓力搬到別的地方。顯存降低之後,系統記憶體、SSD 速度和 PCIe 傳輸都更重要;生成一支影片也可能需要更長時間。若瀏覽器本身占用太多 VRAM,可以使用 WanGP 的 scripts/start-chrome-no-gpu.bat 或 scripts/start-chrome-no-gpu.sh 開啟不使用 GPU 的 Chrome。
03 用 SGLang 部署 MiniMax H3
SGLang 是官方模型卡推薦的部署框架之一,適合 H100、H200、B200、B300、RTX 5090 或 AMD Instinct 等多卡環境。它能提供非同步影片 API、任務排隊、不同多卡拓撲與效能設定,更像是一套正式服務,而不是個人電腦上的創作介面。
在 Linux 伺服器的獨立 Python 環境中執行官方安裝指令:
uv pip install "sglang[diffusion]" --prerelease=allow
以下是官方文件使用的四卡 FL2VA 基本部署形式。模型會在第一次啟動時從 Hugging Face 下載:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--model-variant fl2va \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010
若要提供多模態參考生成服務,把 --model-variant fl2va 改為 --model-variant ref2va,並使用另一個連接埠。雙 RTX 5090 需要 TP2、記憶體模式與分層卸載等額外參數,不建議直接套用上面的四卡設定;請使用 SGLang MiniMax H3 硬體選擇器產生對應指令。
等待模型下載與權重載入完成。如果你正在部署伺服器本機操作,可透過 http://127.0.0.1:30010 測試服務;從其他裝置存取時,則要換成伺服器的區域網路 IP、公開 IP 或已設定的網域。由於範例使用 --host 0.0.0.0,請勿在沒有防火牆、身分驗證或反向代理保護的情況下直接向公用網路開放此連接埠。確認連線後,即可透過 SGLang 的非同步影片 API 送出 T2VA 或 FL2VA 工作,並輪詢任務狀態取得 MP4。
常見安裝問題
- ComfyUI 找不到 H3 節點:先更新 ComfyUI 與相依套件,再重新啟動。
- 模型清單沒有權重:確認檔案放在正確資料夾,且檔案沒有多一層同名目錄。
- 載入時顯存不足:改用 Pruned INT8/FP8、縮短影片、降低解析度,並關閉其他占用 GPU 的程式。
- 顯存夠但系統當機:通常是 RAM 或交換空間不足;減少卸載量或改用更精簡的文字編碼器。
- 第一次啟動像是卡住:大型權重可能仍在下載或寫入快取,先查看終端機是否持續顯示下載進度。
- 只有影片沒有聲音:確認已下載音訊 VAE,並使用 MiniMax H3 對應工作流,而不是一般無音訊影片範本。
不知道選哪個?
- 已經會 ComfyUI:直接用 ComfyUI 工作流。
- 顯存不多、希望介面簡單:先研究 WanGP。
- 有多張高階 GPU、要提供內部服務:使用 SGLang。
- 不想安裝任何東西:改用線上 MiniMax H3。
07 如何讓本機 MiniMax H3 更省錢?
本機部署真正省錢的關鍵,不是看到「免費」就把所有參數拉滿,而是先建立一套便宜的試錯流程。影片模型每次失敗都比圖片模型更花時間,所以測試順序非常重要。
- 先做 5 秒短片:先確認人物、動作、鏡頭和聲音,再延長到 10–15 秒。
- 先跑 480p 或 768p:低解析度確認方向,成功後再放大或重做高品質版本。
- 選擇量化或 Pruned 權重:INT8、FP8 與 GGUF 可以降低記憶體壓力,適合大量草稿。
- 只下載需要的分區:沒有多模態參考需求,就不必先下載 Ref2VA。
- 固定種子,一次改一項:不要同時重寫提示詞、素材、步數和鏡頭,否則很難判斷哪項設定有效。
- 排隊讓電腦慢慢算:把多個任務放進佇列,減少坐在電腦前等待的時間。
- 把瀏覽器的 GPU 占用也算進去:WanGP 提供停用 Chrome GPU 的啟動方式,依設備可能釋放約 1–5GB 顯存。
本機單支影片的簡化成本公式
假如你已經有設備,而且每天會生成很多版本,本機的平均成本會隨使用量下降。反過來說,如果你為了偶爾做幾支影片而購買雙 RTX 5090、384GB 記憶體和新電源供應器,那就不太像免費,更像是把 API 帳單一次預付給硬體店。
08 本機部署還是線上生成?
| 你的情況 | 比較適合本機部署 | 比較適合線上生成 |
|---|---|---|
| 生成頻率 | 每天大量測試、批次生成多個版本 | 偶爾做影片,生成量不固定 |
| 現有設備 | 已經有高階 GPU、充足記憶體與 SSD | 沒有合適設備,也不想為一個模型升級整台電腦 |
| 時間與技術 | 願意處理 Python、CUDA、節點與相依套件 | 希望打開瀏覽器、上傳素材就開始生成 |
| 畫質與完整功能 | 接受 480p/768p 草稿、量化品質與較長等待 | 需要官方完整提示理解、快速輸出或 2K 工作流 |
| 素材隱私 | 希望素材和生成結果保留在自己的設備 | 願意依照平台隱私政策使用雲端服務 |
如果你只是想先體驗 MiniMax H3 的文生影片、圖生影片或多模態參考能力,不必為了測試就下載上百 GB 權重。可以直接從 LitVideo MiniMax H3 文生影片工具開始,把時間花在提示詞和鏡頭上,而不是先和 CUDA 版本進行一場深夜談判。
你也可以先瀏覽 AI 影片模型清單,比較不同模型的畫質、生成速度和輸入方式。有時真正省錢的選擇不是堅持本機或雲端,而是讓不同工具各做自己最擅長的部分。
09 MiniMax H3 開源版優缺點
值得期待的優點
- 本機推理不必按生成次數支付 API 費用。
- 支援文字、首尾幀和多模態參考工作流。
- 影片與 32 kHz 立體聲可在同一模型中生成。
- 素材、提示詞與輸出可以保留在自己的設備。
- 可使用 ComfyUI、WanGP、SGLang 和量化權重。
- 適合大量測試、批次排隊與研究客製化流程。
下單顯卡前要知道的缺點
- 官方完整權重和儲存空間需求非常大。
- 低顯存版本需要模型卸載,生成速度可能很慢。
- 完整 H3-Context-IR 與 2K 再生成尚未開放。
- 官方推薦部署仍偏向多 GPU 或高階工作站。
- 安裝、相依套件與驅動程式需要一定技術基礎。
- 社群授權存在地區與使用方式限制。
10 MiniMax H3 開源常見問題
01 MiniMax H3 是真正的開源模型嗎?
更準確的說法是開放權重模型。MiniMax 公開了 H3-Base 權重與推理元件,但使用 MiniMax H3 Community License,而不是 Apache 2.0 等傳統開放原始碼授權;H3-Context-IR 與 H3-Regenerate-2K 也尚未開放。
02 8GB 顯存真的能執行 MiniMax H3 嗎?
社群的 WanGP 最佳化方案聲稱能以約 5–6GB 顯存生成 5 秒、832×480 影片,因此 8GB 有機會嘗鮮。但這需要量化、模型卸載與充足系統記憶體,速度和畫質不能等同官方完整精度部署。
03 MiniMax H3 需要多少硬碟空間?
官方完整倉庫顯示約 498GB,單一官方 FL2VA 目錄約 144GB。ComfyUI 的主要擴散權重單檔從 21GB 到 66.3GB 不等,但還需要文字編碼器、VAE、程式環境、快取和輸出空間。
04 ComfyUI 和 WanGP 哪個比較適合新手?
如果你已經熟悉 ComfyUI 節點,直接使用現成工作流會很自然;如果顯存有限,又希望透過網頁介面自動選擇量化和卸載策略,WanGP 通常比較容易開始。
05 本機版 MiniMax H3 可以生成 2K 影片嗎?
目前公開的 H3-Base 主要生成短邊 768 像素的影片。官方 2K 輸出依賴 H3-Regenerate-2K,而這個模組截至 2026 年 8 月 5 日尚未開放,需要搭配 MiniMax API,或使用第三方放大工具作為替代方案。
06 本機生成真的完全免費嗎?
不需要按次支付模型推理費,但仍有硬體、記憶體、SSD、電費、散熱、折舊和時間成本。如果沒有現成設備,先比較購買硬體與使用線上方案的總成本會更實際。
07 MiniMax H3 開源權重可以商用嗎?
社群授權在適用地區提供免權利金的有限使用權,但設有地區與可接受使用政策限制。商業部署前應閱讀最新版授權,並根據業務所在地、使用情境和內容類型進行合規評估。
08 FL2VA 和 Ref2VA 應該下載哪個?
只需要文生影片、圖生影片或首尾幀控制時選 FL2VA;需要使用多張圖片、參考影片、聲音或人物特徵引導新影片時,才下載 Ref2VA。
結論