MiniMax H3 本地部署硬件与环境配置指南
MiniMax H3 是由 MiniMax 开源的通用全模态生成系统,能够基于文本、图像、视频和音频输入,生成最高 2K 分辨率、最长 15 秒并带有原生立体声音频的视频。本文整理 H3-Base 本地部署所需的硬件配置与环境要求,帮助开发者评估自己的设备是否满足运行条件。需要说明的是,实在Agent 已经内置了该模型,如果你使用实在 Agent 服务,无需自行处理以下部署配置。
一、模型版本说明
MiniMax H3 开源部分为 H3-Base(33B 参数),包含两个检查点:
- FL2VA:支持文生视频、首帧生视频、尾帧生视频、首尾帧生视频
- Ref2VA:支持参考图像(最多 9 张)、参考视频(最多 3 段)、参考音频(最多 3 段)的全模态参考生成
完整 2K 输出需要配合官方 H3-Context-IR API 和 H3-Regenerate-2K API 使用。本地部署默认输出 768p 分辨率。
二、硬件配置要求
2.1 显存(VRAM)要求
显存是本地部署最主要的瓶颈。根据不同的优化方案,要求如下:
| 部署方案 | 最低显存 | 说明 |
|---|---|---|
| NF4 量化 + Disk Offload | 约 6 GB | 纯文生视频(t2v)场景,权重存放在磁盘,按层流式加载 |
| NF4 量化(DiffSynth-Studio) | 7–8 GB | 框架自动管理显存,根据可用显存动态加载参数 |
| 非量化原生部署 | 12 GB+ | 推荐配置,需 64GB 系统内存 |
| DGX Spark 部署 | 110 GiB+ | 完整 FL2VA 检查点部署 |
如果你使用 NF4 量化版本配合 DiffSynth-Studio,通过 "vram_limit" 参数可以手动调节显存占用阈值,调小可进一步降低显存需求(代价是推理速度变慢)。
2.2 GPU 支持
H3 对 NVIDIA CUDA GPU 有原生支持。此外,以下硬件平台也已完成适配:
- AMD Instinct MI355X、MI300X(通过 ROCm + SGLang)
- 摩尔线程 MTT S5000
- 沐曦 曦云 C 系列 GPU
- NVIDIA RTX 3060 及以上消费级显卡
- NVIDIA RTX 5090(支持专用层卸载方案)
- Apple Silicon(Mac,通过 MLX 适配)
2.3 系统内存与存储
- 系统内存:推荐 64GB 以上
- 磁盘空间:模型权重下载约 42.5 GB(最小);完整 FL2VA 检查点约 144 GB
- NF4 量化版本各组件大小:FL2VA DiT 主干 ~16 GB、Ref2VA DiT 主干 ~16 GB、文本编码器 ~15 GB、视频 VAE ~1.6 GB、音频 VAE ~271 MB
三、软件环境要求
3.1 推理框架
H3 支持以下推理框架,可根据需求选择:
- SGLang(推荐,官方文档提供完整部署指引)
- vLLM(含 vLLM-Omni)
- DiffSynth-Studio(ModelScope 官方推荐,NF4 量化版本最佳搭档)
- ComfyUI(版本 0.30.0 以上原生支持)
3.2 环境安装示例(DiffSynth-Studio + NF4 量化)
git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio
pip install -e "[quant]"NF4 反量化依赖 bitsandbytes 的 CUDA kernel,需确保 CUDA 环境可用。processor 和 tokenizer 需从原始仓库 MiniMax/MiniMax-H3 获取。
3.3 SGLang 安装
uv pip install "sglang[diffusion]" --prerelease=allow四、模型获取方式
模型权重可从以下平台下载:
- Hugging Face:
MiniMaxAI/MiniMax-H3 - ModelScope:
MiniMax/MiniMax-H3 - NF4 量化版本:
DiffSynth-Studio/MiniMax-H3-NF4
五、部署路径选择
根据你的需求,可以选择以下三种方式:
- 官方 API 直出(最省事) :直接调用 MiniMax API 生成 2K 视频,无需本地 GPU。API 端点为
https://api.minimaxi.com(国内)或https://api.minimax.io(海外)。需在 platform.minimaxi.com 注册并获取 API Key。 - 本地部署 H3-Base(768p) :通过 SGLang、vLLM 或 DiffSynth-Studio 在本地运行开源检查点。适合需要本地迭代和验证的场景。
- Full 2K 工作流:本地 H3-Base + 官方 Context-IR API + Regenerate-2K API 组合使用。
⚠️ 重要提示:官方建议即使本地部署了 H3-Base,也应先通过 H3-Context-IR API 处理输入,再将增强后的提示词喂给本地模型——Context-IR 对最终生成质量影响显著。
六、常见硬件适配参考
根据现有社区反馈,以下硬件配置可以顺利运行 H3:
- RTX 3060:可以运行 NF4 量化版本
- RTX 5090:支持专用层卸载方案
- NVIDIA DGX Spark(GB10, 128GB 统一内存):已验证兼容
- Google Colab G4(RTX PRO 6000 Blackwell, ~96GB VRAM):可运行
总结
MiniMax H3 本地部署的核心门槛在于显存。NF4 量化方案可将显存需求降至 6–8 GB,使 RTX 3060 级别显卡即可运行基础功能;非量化部署则需要 12 GB 以上显存 和 64 GB 系统内存。推理框架推荐 SGLang 或 DiffSynth-Studio,模型权重可从 Hugging Face 或 ModelScope 获取。如果你使用实在 Agent,该模型已经内置,无需自行处理上述部署工作。

