MiniMax H3 是什么?
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的新一代通用全模态生成模型,也是 MiniMax 推出的首款开源多模态生成模型。它能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。本文简要介绍 H3 的核心能力、使用方式,以及在实在 Agent 中的集成情况。
📌 本文大纲
- 核心能力:全模态理解与生成
- 两种使用方式:API 与开源部署
- 在实在 Agent 中的集成
- 典型应用场景
- 总结
一、核心能力:全模态理解与生成
H3 突破了传统单一任务的边界,不再区分文生图、图生视频、音效生成等独立任务,而是在同一个系统中统一处理。它支持以下输入与输出规格:
- 输出时长:4–15 秒
- 输出宽高比:支持 21:9、16:9、4:3、1:1、3:4、9:16 等
- 输出分辨率:默认较短边 768 像素,可通过 H3-Regenerate-2K 实现 2K 分辨率
- 输出帧率:24 FPS
- 输出音频:32 kHz 立体声
- 支持语言:稳定支持 11 种语言,包括中文、英语、日语、韩语等
H3 系统本身由三个模块组成:
- H3-Context-IR:托管式预处理系统,负责深入理解多模态输入指令,将其转换为模型可直接生成的结构化表示
- H3-Base:根据上下文中间表示生成 768p 的音频与视频
- H3-Regenerate-2K:将 768p 结果以 2K 分辨率重新生成,提升细节与视觉保真度
二、两种使用方式:API 与开源部署
方式一:通过 API 调用(推荐)
H3 提供标准的 API 接入方式,适合开发者和各类 Agent 平台集成。
- 全球接入:
platform.minimax.io - 国内接入:
platform.minimaxi.com
API 文档地址:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create
定价方面,2K 分辨率下为 0.8 元/秒,约为业内同类旗舰模型的三分之一。
方式二:开源部署与本地使用
2026 年 8 月 3 日,MiniMax 正式开源 H3 模型权重。开发者可以:
- 从 GitHub 仓库获取模型与提示词指南:
https://github.com/MiniMax-AI/MiniMax-H3 - 在 ComfyUI 等社区平台直接使用
- 部署到本地环境,按需定制
H3 在设计初期就考虑了多款国产芯片的兼容性,华为昇腾、摩尔线程、壁仞科技、海光信息等芯片厂商已完成适配。
三、在实在 Agent 中的集成
实在Agent 已内置 MiniMax H3 模型。 实在 Agent 是实在智能研发的企业级通用智能体产品,融合自研 TARS 垂直大模型与 ISSUT 屏幕语义识别技术,打造“思考-决策-自主执行”一体化复合智能体。它兼容字节豆包、阿里 Qwen、DeepSeek 等多款主流大模型,支持多模型路由调度。
MiniMax H3 作为实在 Agent 内置的多模态生成模型之一,用户无需额外配置 API 密钥或进行复杂部署,即可在实在 Agent 的工作流中直接调用 H3 的视频生成能力。具体使用流程如下:
- 在实在 Agent 平台中创建或编辑工作流
- 从模型组件中选择 MiniMax H3
- 通过自然语言或结构化参数描述视频需求(场景、分辨率、时长、风格等)
- 实在 Agent 自动将需求转化为 H3 API 调用,完成视频生成与交付
四、典型应用场景
根据官方介绍和早期用户反馈,H3 适用于以下商业场景:
- 广告与品牌:生成产品广告片、品牌宣传视频
- 电商:制作商品展示视频、动态海报
- 游戏:生成游戏 UI 动效、游戏开场动画
- 影视与设计:电影片头、动态海报、UI/UX 动效
H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现突出。
总结
MiniMax H3 是一个通用全模态生成模型,支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、15 秒时长、带原生立体声的视频。你可以通过 API(platform.minimax.io 或 platform.minimaxi.com)调用,也可以从 GitHub 获取开源版本自行部署。实在 Agent 已内置该模型,用户可直接在平台工作流中调用 H3,无需额外配置即可获得专业的视频生成能力。



