MiniMax H3 開源了!免費本機部署、硬體需求與省錢攻略

林語晴
林語晴

更新於: 2026-08-05

9 分鐘閱讀 , 1 瀏覽

MiniMax H3 開源之後,我第一個念頭不是「太好了,以後生成影片都不用錢」,而是「好,現在輪到顯卡和電費帳單說話了」。如果你本來就有一台效能不錯的電腦,這次開放權重確實很有吸引力:模型下載到本機後,不必每生成一支影片就支付 API 費用,也能慢慢測試提示詞、批次排隊,甚至把素材留在自己的硬碟裡。

不過,模型權重免費,不等於整套流程零成本。官方版本的硬體需求依然很高,社群雖然已經用量化、模型卸載與低顯存工具把門檻壓到消費級顯卡,但代價通常是更多系統記憶體、更低解析度,以及「泡完一杯咖啡,影片可能還在算」的等待時間。

MiniMax H3 開源、本機部署與硬體需求指南

這篇文章會用 AI 影片愛好者比較在意的方式,拆解 MiniMax H3 AI 影片生成器這次到底開放了什麼、你的電腦跑不跑得動,以及本機部署和線上生成哪一種真的比較省錢。

 

01 MiniMax H3 開源代表什麼?

大家習慣說「MiniMax H3 開源」,更精確的說法其實是開放模型權重。MiniMax 在 Hugging Face 上釋出 H3-Base 的模型權重、設定檔與推理所需元件,開發者可以下載、部署、修改,也可以透過 SGLang、vLLM、Diffusers、ComfyUI 或社群工具在自己的設備上執行。

這件事最直接的改變,是你可以把原本由雲端伺服器完成的影片生成工作搬回本機。只要設備、儲存空間和技術能力足夠,生成次數不再直接綁定點數或 API 帳單。對需要大量測試分鏡、角色一致性或廣告版本的創作者來說,這種自由度很迷人。

先用一句話說結論

如果你已經擁有合適的 GPU,而且願意花時間安裝和等待,本機部署可以大幅降低大量生成時的邊際成本;如果你只是偶爾做幾支影片,或希望直接使用完整 2K 工作流,線上平台通常更省事,也可能更省總成本。

開放權重不等於完整官方服務全開放

官方完整 H3 系統包含 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 三個部分。目前公開的是 H3-Base;負責理解複雜多模態素材的 H3-Context-IR,以及將結果重新生成為 2K 的 H3-Regenerate-2K,都還是託管服務。

 

02 這次到底開放了什麼?

根據 MiniMax H3 官方模型卡,開放權重分成兩個主要任務版本。它們都能同時預測影片與原生立體聲,只是接受素材的方式不同。

模型版本 可以做什麼 輸入方式
H3-Base-FL2VA 文生影片、首幀生影片、尾幀生影片、首尾幀生影片 純文字,或加入 0–2 張圖片作為首幀與尾幀
H3-Base-Ref2VA 多模態參考生影片、影片轉影片、聲音與角色參考 文字搭配圖片、影片和音訊參考素材
  • 影片長度:4–15 秒。
  • 畫面比例:支援 21:9、16:9、4:3、1:1、3:4、9:16 等常用比例。
  • 本機 Base 解析度:預設短邊 768 像素。
  • 幀率:24 FPS。
  • 音訊:32 kHz 立體聲,可原生生成環境音、音樂與對話。
  • 穩定對話語言:包含中文、英文、日文、韓文、俄文等 11 種語言。

開源版 Ref2VA 的官方規格最多接受 9 張圖片、3 段影片與 3 段音訊,混合輸入總數最多 12 個檔案。這和部分線上產品顯示的參考素材上限可能不同,因此比較時要先確認你談的是本機權重、官方 API,還是第三方平台版本。

 

03 MiniMax H3 真的可以免費使用嗎?

如果「免費」指的是不必為每次本機推理支付模型費用,答案是可以! 但前提是你位於授權適用地區,並遵守 MiniMax H3 Community License Agreement 與可接受使用政策。

截至 2026 年 8 月 5 日,這份授權提供有限、免權利金的使用與修改權,但明確把美國、歐盟、英國和韓國列為排除地區。台灣目前沒有被列在排除清單中;若你在其他地區部署,或打算把模型整合進商業服務,仍應先閱讀最新版授權,必要時尋求法律意見。

不用按次支付的部分 依然存在的成本 容易被忽略的限制
本機模型推理費、反覆測試的 API 費用 GPU、系統記憶體、SSD、電費、散熱與硬體折舊 授權地區、可接受使用政策、部分官方模組仍需 API

授權也寫明 MiniMax 不主張你生成內容的權利,但影片是否合法、是否侵犯肖像或著作權,以及後續如何使用,仍由使用者自行負責。簡單說,模型可以搬回家,責任不會一起被打包丟回雲端。

 

04 MiniMax H3 硬體需求:能跑和跑得舒服差很多

目前最熱鬧的問題就是「8GB 顯存能不能跑 MiniMax H3?」這裡的顯存是顯示記憶體(VRAM)的常見簡稱。答案不是單純的可以或不可以,而是要先問:用哪個權重、生成幾秒、什麼解析度、願意等多久,以及有多少系統記憶體可以拿來做模型卸載。

設備級別 目前可行方式 已公開數據 適合誰
約 6–9GB 顯存 WanGP 社群最佳化、量化權重、CPU/RAM 卸載 社群聲稱 5 秒 832×480 約需 5–6GB;15 秒約需 8–9GB 想嘗鮮、願意等待,也能接受較低解析度的人
24–32GB 單卡 Pruned、INT8、FP8 或 GGUF 搭配模型卸載 社群普遍視為較實用的消費級區間,但不是官方完整精度基準 經常生成、熟悉 ComfyUI 或願意調整參數的創作者
2× RTX 5090 32GB SGLang TP2 與分層卸載 官方驗證需約 384GB 級系統記憶體;5 秒、1344×768、50 步約 559.67 秒 想保留官方精度,並願意投資高階工作站的人
4× H100/H200 官方 SGLang 多卡部署 官方建議與實測配置,可讓完整模型常駐或進行多卡切分 團隊、研究機構與伺服器部署

SGLang 官方部署實測顯示,雙 RTX 5090 的 50 步完整請求約花 9 分 20 秒,每張 GPU 峰值約 26.3 GiB。這已經比資料中心 GPU 親民,但仍不是一般遊戲主機插上顯卡就能無痛起飛的等級。

另一邊,WanGP 社群專案透過量化、分層卸載和低解析度輸出,把顯存需求壓到 5–9GB。這些數據很令人興奮,但它們代表的是特定社群工具與設定,不是官方 BF16 權重的最低需求。系統記憶體、硬碟讀寫和生成時間仍可能成為新的瓶頸。

 

05 權重怎麼選?別一口氣下載 498GB

MiniMax 官方 Hugging Face 主倉庫截至 2026 年 8 月 5 日顯示約 498GB。這個數字看起來像在考驗 SSD 的信仰,但它同時包含不同任務分區,以及原始格式與 Diffusers 格式;一般使用者不需要把整個倉庫全部搬回家。

例如,單一官方 FL2VA 目錄約 144GB。若改用 ComfyUI 整理的 MiniMax H3 權重,可以依顯卡與畫質需求選擇不同精度。

主要擴散權重 單檔大小 選擇建議
BF16 66.3GB 保留完整精度,適合多卡或高階工作站。
INT8 34GB 在容量與品質之間折衷,仍需要充足記憶體與卸載空間。
Pruned BF16 40.2GB 減少部分模型容量,同時維持 BF16 精度。
Pruned FP8/INT8 21GB 較適合消費級設備與第一次本機部署。

21GB 不等於整套安裝只占 21GB

上表是主要擴散模型單檔大小。實際執行還需要 Qwen3-VL 文字編碼器、影片 VAE、音訊 VAE、程式環境、快取和輸出空間。下載前最好先準備一顆空間充足的高速 SSD。

  • 只做文生、圖生或首尾幀:先下載 FL2VA。
  • 需要人物、動作、影片或聲音參考:選擇 Ref2VA。
  • 顯存與記憶體有限:從 Pruned INT8/FP8 或社群 GGUF 版本開始。
  • 想忠實比較官方品質:再考慮 BF16 與多 GPU 部署。

 

06 三種 MiniMax H3 本機部署方法

MiniMax H3 本機部署沒有唯一正解。選工具時不用追求看起來最專業的那條路,而是看你手上有什麼設備,以及你想把時間花在創作還是終端機上。下面三條路線都能跑 H3,但安裝難度和硬體方向完全不同。

安裝前先確認這幾件事

  • 作業系統:以下流程以 Windows 10/11 或 Linux 搭配 NVIDIA GPU 為主,這也是目前文件與社群支援最完整的組合。
  • 顯示卡驅動程式:先更新 NVIDIA 驅動程式;若使用既有 ComfyUI,也要確認 PyTorch 與 CUDA 環境能正常辨識 GPU。
  • 系統記憶體:低顯存方案會把大量模型元件卸載到 RAM。32GB 可能相當吃緊,記憶體越充足,模型切換與解碼通常越穩定。
  • SSD 空間:精簡權重建議至少預留 80–100GB;若使用官方單一 FL2VA 完整目錄,最好準備 150GB 以上,並另外保留快取與輸出空間。
  • 先選任務:文生、圖生與首尾幀控制選 FL2VA;需要圖片、影片或音訊參考才選 Ref2VA。

 

01 用 ComfyUI 安裝 MiniMax H3

ComfyUI 適合已經熟悉節點工作流,或想直接修改模型、取樣和後製節點的創作者。Comfy-Org 已提供整理過的 BF16、INT8、Pruned FP8/INT8 權重,以及文生影片、圖生影片與參考生影片範本。

步驟 1
更新 ComfyUI

使用 ComfyUI Manager、桌面版更新功能或原本的 Git 更新方式,將 ComfyUI 升到最新版。MiniMax H3 是剛加入的新模型,舊版本可能找不到對應節點或模型類型。

步驟 2
下載一個主要擴散權重

前往 Comfy-Org MiniMax H3 權重頁面。第一次安裝不必全部下載,依任務和設備挑一個即可:

  • 消費級顯卡先測 FL2VA:minimax_h3_fl2va_pruned_int8_convrot.safetensorsminimax_h3_fl2va_pruned_fp8_scaled.safetensors
  • 需要多模態參考:改選檔名包含 ref2va 的對應 Pruned INT8/FP8 權重。
  • 多卡高階工作站:可使用 minimax_h3_fl2va_bf16.safetensors 或 Ref2VA BF16。

把下載的檔案放進:

ComfyUI/models/diffusion_models/
步驟 3
下載文字編碼器與兩個 VAE

MiniMax H3 不是只有一個擴散權重就能工作。還需要 Qwen3-VL 文字編碼器,以及影片與音訊各自使用的 VAE。

  • 文字編碼器:qwen3vl_32b_minimax_h3_int8_convrot.safetensors,放進 ComfyUI/models/text_encoders/
  • 影片 VAE:minimax_h3_video_vae_fp16.safetensors,放進 ComfyUI/models/vae/
  • 音訊 VAE:minimax_h3_audio_vae_fp32.safetensors,同樣放進 ComfyUI/models/vae/

整理完成後,資料夾大致會長這樣:

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
    ├── text_encoders/
    │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
    └── vae/
        ├── minimax_h3_video_vae_fp16.safetensors
        └── minimax_h3_audio_vae_fp32.safetensors
步驟 4
匯入對應工作流

下載與任務一致的 JSON 範本,再把檔案拖進 ComfyUI 畫布:

步驟 5
完成第一次低成本測試

在節點中選擇剛才放入的模型、文字編碼器和 VAE。第一次建議使用 5 秒、較低解析度、15–20 個推理步數和固定種子。先生成純文字或單張首幀任務,確認影片與聲音都能正常輸出,再逐步增加時長、解析度與參考素材。

 

02 用 WanGP 安裝 MiniMax H3

WanGP 的強項是自動選擇較適合硬體的模型、把部分元件卸載到系統記憶體,並提供瀏覽器介面。它支援 MiniMax H3 FL2VA 與 Ref2VA,也提供完整 33B 和較輕量的 20B Pruned 版本。

步驟 1
取得官方 WanGP 專案

DeepBeepMeep/Wan2GP 官方 GitHub下載 ZIP,或使用 Git 複製儲存庫:

git clone https://github.com/deepbeepmeep/Wan2GP.git
cd Wan2GP
步驟 2
執行一鍵安裝程式

Windows 使用者開啟 scripts\install.bat;Linux 使用者執行 scripts/install.sh。第一次安裝可選擇 Auto Install,讓指令稿建立獨立 Python 環境,並安裝適合目前 GPU 的 PyTorch、CUDA 與加速套件。

# Linux
bash scripts/install.sh

Windows 通常直接按兩下 BAT 檔案即可,不必先手動安裝整套 Python 相依套件。若電腦裡已經有穩定的 WanGP 環境,也可以在安裝程式中選擇加入既有環境。

步驟 3
啟動 WanGP 網頁介面

安裝完成後,Windows 開啟 scripts\run.bat,Linux 執行:

bash scripts/run.sh

終端機會顯示本機網址,用瀏覽器開啟後,在模型清單選擇 MiniMax H3。第一次選擇 FL2VA 或 Ref2VA 時,WanGP 會下載與目前硬體相符的模型檔案,因此可能需要等待一段時間。

步驟 4
設定第一次生成
  • 只測試文字或首幀時選擇 MiniMax H3 FL2VA
  • 畫面先設為 832×480,長度選擇 5 秒。
  • 推理步數先用 15–20 步,並固定種子。
  • 低顯存裝置保留 Lower VRAM 優先模式。
  • 如果系統記憶體反而不足,而 GPU 還有空間,可在進階設定改選 Lower RAM

低顯存不是魔法消失,而是把壓力搬到別的地方。顯存降低之後,系統記憶體、SSD 速度和 PCIe 傳輸都更重要;生成一支影片也可能需要更長時間。若瀏覽器本身占用太多 VRAM,可以使用 WanGP 的 scripts/start-chrome-no-gpu.batscripts/start-chrome-no-gpu.sh 開啟不使用 GPU 的 Chrome。

 

03 用 SGLang 部署 MiniMax H3

SGLang 是官方模型卡推薦的部署框架之一,適合 H100、H200、B200、B300、RTX 5090 或 AMD Instinct 等多卡環境。它能提供非同步影片 API、任務排隊、不同多卡拓撲與效能設定,更像是一套正式服務,而不是個人電腦上的創作介面。

步驟 1
建立環境並安裝 SGLang Diffusion

在 Linux 伺服器的獨立 Python 環境中執行官方安裝指令:

uv pip install "sglang[diffusion]" --prerelease=allow
步驟 2
啟動 FL2VA 服務

以下是官方文件使用的四卡 FL2VA 基本部署形式。模型會在第一次啟動時從 Hugging Face 下載:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --model-variant fl2va \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010

若要提供多模態參考生成服務,把 --model-variant fl2va 改為 --model-variant ref2va,並使用另一個連接埠。雙 RTX 5090 需要 TP2、記憶體模式與分層卸載等額外參數,不建議直接套用上面的四卡設定;請使用 SGLang MiniMax H3 硬體選擇器產生對應指令。

步驟 3
確認服務完成載入

等待模型下載與權重載入完成。如果你正在部署伺服器本機操作,可透過 http://127.0.0.1:30010 測試服務;從其他裝置存取時,則要換成伺服器的區域網路 IP、公開 IP 或已設定的網域。由於範例使用 --host 0.0.0.0,請勿在沒有防火牆、身分驗證或反向代理保護的情況下直接向公用網路開放此連接埠。確認連線後,即可透過 SGLang 的非同步影片 API 送出 T2VA 或 FL2VA 工作,並輪詢任務狀態取得 MP4。

常見安裝問題

  • ComfyUI 找不到 H3 節點:先更新 ComfyUI 與相依套件,再重新啟動。
  • 模型清單沒有權重:確認檔案放在正確資料夾,且檔案沒有多一層同名目錄。
  • 載入時顯存不足:改用 Pruned INT8/FP8、縮短影片、降低解析度,並關閉其他占用 GPU 的程式。
  • 顯存夠但系統當機:通常是 RAM 或交換空間不足;減少卸載量或改用更精簡的文字編碼器。
  • 第一次啟動像是卡住:大型權重可能仍在下載或寫入快取,先查看終端機是否持續顯示下載進度。
  • 只有影片沒有聲音:確認已下載音訊 VAE,並使用 MiniMax H3 對應工作流,而不是一般無音訊影片範本。

不知道選哪個?

  • 已經會 ComfyUI:直接用 ComfyUI 工作流。
  • 顯存不多、希望介面簡單:先研究 WanGP。
  • 有多張高階 GPU、要提供內部服務:使用 SGLang。
  • 不想安裝任何東西:改用線上 MiniMax H3。

 

07 如何讓本機 MiniMax H3 更省錢?

本機部署真正省錢的關鍵,不是看到「免費」就把所有參數拉滿,而是先建立一套便宜的試錯流程。影片模型每次失敗都比圖片模型更花時間,所以測試順序非常重要。

  • 先做 5 秒短片:先確認人物、動作、鏡頭和聲音,再延長到 10–15 秒。
  • 先跑 480p 或 768p:低解析度確認方向,成功後再放大或重做高品質版本。
  • 選擇量化或 Pruned 權重:INT8、FP8 與 GGUF 可以降低記憶體壓力,適合大量草稿。
  • 只下載需要的分區:沒有多模態參考需求,就不必先下載 Ref2VA。
  • 固定種子,一次改一項:不要同時重寫提示詞、素材、步數和鏡頭,否則很難判斷哪項設定有效。
  • 排隊讓電腦慢慢算:把多個任務放進佇列,減少坐在電腦前等待的時間。
  • 把瀏覽器的 GPU 占用也算進去:WanGP 提供停用 Chrome GPU 的啟動方式,依設備可能釋放約 1–5GB 顯存。

本機單支影片的簡化成本公式

平均功耗(kW)× 生成時間(小時)× 電價+硬體折舊+你的安裝與等待時間

假如你已經有設備,而且每天會生成很多版本,本機的平均成本會隨使用量下降。反過來說,如果你為了偶爾做幾支影片而購買雙 RTX 5090、384GB 記憶體和新電源供應器,那就不太像免費,更像是把 API 帳單一次預付給硬體店。

 

08 本機部署還是線上生成?

你的情況 比較適合本機部署 比較適合線上生成
生成頻率 每天大量測試、批次生成多個版本 偶爾做影片,生成量不固定
現有設備 已經有高階 GPU、充足記憶體與 SSD 沒有合適設備,也不想為一個模型升級整台電腦
時間與技術 願意處理 Python、CUDA、節點與相依套件 希望打開瀏覽器、上傳素材就開始生成
畫質與完整功能 接受 480p/768p 草稿、量化品質與較長等待 需要官方完整提示理解、快速輸出或 2K 工作流
素材隱私 希望素材和生成結果保留在自己的設備 願意依照平台隱私政策使用雲端服務

如果你只是想先體驗 MiniMax H3 的文生影片、圖生影片或多模態參考能力,不必為了測試就下載上百 GB 權重。可以直接從 LitVideo MiniMax H3 文生影片工具開始,把時間花在提示詞和鏡頭上,而不是先和 CUDA 版本進行一場深夜談判。

你也可以先瀏覽 AI 影片模型清單,比較不同模型的畫質、生成速度和輸入方式。有時真正省錢的選擇不是堅持本機或雲端,而是讓不同工具各做自己最擅長的部分。

 

09 MiniMax H3 開源版優缺點

值得期待的優點

  • 本機推理不必按生成次數支付 API 費用。
  • 支援文字、首尾幀和多模態參考工作流。
  • 影片與 32 kHz 立體聲可在同一模型中生成。
  • 素材、提示詞與輸出可以保留在自己的設備。
  • 可使用 ComfyUI、WanGP、SGLang 和量化權重。
  • 適合大量測試、批次排隊與研究客製化流程。

下單顯卡前要知道的缺點

  • 官方完整權重和儲存空間需求非常大。
  • 低顯存版本需要模型卸載,生成速度可能很慢。
  • 完整 H3-Context-IR 與 2K 再生成尚未開放。
  • 官方推薦部署仍偏向多 GPU 或高階工作站。
  • 安裝、相依套件與驅動程式需要一定技術基礎。
  • 社群授權存在地區與使用方式限制。

 

10 MiniMax H3 開源常見問題

 

01 MiniMax H3 是真正的開源模型嗎?

更準確的說法是開放權重模型。MiniMax 公開了 H3-Base 權重與推理元件,但使用 MiniMax H3 Community License,而不是 Apache 2.0 等傳統開放原始碼授權;H3-Context-IR 與 H3-Regenerate-2K 也尚未開放。

 

02 8GB 顯存真的能執行 MiniMax H3 嗎?

社群的 WanGP 最佳化方案聲稱能以約 5–6GB 顯存生成 5 秒、832×480 影片,因此 8GB 有機會嘗鮮。但這需要量化、模型卸載與充足系統記憶體,速度和畫質不能等同官方完整精度部署。

 

03 MiniMax H3 需要多少硬碟空間?

官方完整倉庫顯示約 498GB,單一官方 FL2VA 目錄約 144GB。ComfyUI 的主要擴散權重單檔從 21GB 到 66.3GB 不等,但還需要文字編碼器、VAE、程式環境、快取和輸出空間。

 

04 ComfyUI 和 WanGP 哪個比較適合新手?

如果你已經熟悉 ComfyUI 節點,直接使用現成工作流會很自然;如果顯存有限,又希望透過網頁介面自動選擇量化和卸載策略,WanGP 通常比較容易開始。

 

05 本機版 MiniMax H3 可以生成 2K 影片嗎?

目前公開的 H3-Base 主要生成短邊 768 像素的影片。官方 2K 輸出依賴 H3-Regenerate-2K,而這個模組截至 2026 年 8 月 5 日尚未開放,需要搭配 MiniMax API,或使用第三方放大工具作為替代方案。

 

06 本機生成真的完全免費嗎?

不需要按次支付模型推理費,但仍有硬體、記憶體、SSD、電費、散熱、折舊和時間成本。如果沒有現成設備,先比較購買硬體與使用線上方案的總成本會更實際。

 

07 MiniMax H3 開源權重可以商用嗎?

社群授權在適用地區提供免權利金的有限使用權,但設有地區與可接受使用政策限制。商業部署前應閱讀最新版授權,並根據業務所在地、使用情境和內容類型進行合規評估。

 

08 FL2VA 和 Ref2VA 應該下載哪個?

只需要文生影片、圖生影片或首尾幀控制時選 FL2VA;需要使用多張圖片、參考影片、聲音或人物特徵引導新影片時,才下載 Ref2VA。

結論

MiniMax H3 開放權重,真正有趣的地方不是把「每次生成多少錢」變成零,而是讓創作者可以自己決定要用什麼設備、什麼精度,以及願意拿多少時間換取較低成本。已經有高階硬體、需要大量測試的人,會很享受本機排隊生成的自由;只有 8GB 左右顯存的人也能透過 WanGP 嘗鮮,只是要接受低解析度、記憶體卸載和更長等待。至於偶爾生成、沒有合適設備,或希望直接使用完整 2K 工作流的人,線上平台仍然是更輕鬆的選擇。你也可以回到 LitMedia AI 創作平台,繼續比較不同 AI 影片、圖片和音樂工具。

猜你喜歡