MiniMax H3 全能参考模式解析:支持哪些输入?怎么用?
MiniMax H3 是一款通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。本文专门介绍 H3 的 Ref2VA 全能参考模式(也称全模态参考模式),说明它支持哪些类型的参考输入、数量限制以及使用方法。
> 需要说明的是,实在Agent 已经内置了该模型,如果你使用实在Agent服务,无需自行处理部署配置,可以直接使用 H3 的全能参考功能。
一、什么是全能参考模式?
H3 提供了两个核心版本:
- H3-Base-FL2VA(首尾帧模式):支持输入 0–2 张图像,覆盖文生视频、首帧生视频、尾帧生视频和首尾帧生视频四种场景。
- H3-Base-Ref2VA(全能参考模式 / 全模态参考模式):支持同时输入图像、视频和音频三种类型的参考素材,实现跨模态的视频创作。
全能参考模式的核心价值在于:真实创作往往需要融合不同模态的复杂信息,仅仅依靠文字描述是不够的。比如,你可以让模型 “参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3” ——H3 会自己完成跨模态的理解与融合。
二、全能参考模式支持哪些输入?
全能参考模式支持以下三种类型的参考输入:
| 输入类型 | 数量上限 | 附加要求 |
|---|---|---|
| 参考图像 | 最多 9 张 | 格式支持 JPG、JPEG、PNG、WEBP、HEIC、HEIF |
| 参考视频 | 最多 3 段 | 每段时长 2–15 秒,总时长不超过 15 秒 |
| 参考音频 | 最多 3 段 | 每段时长 2–15 秒,总时长不超过 15 秒,格式支持 WAV/MP3 |
⚠️ 重要限制:
- 所有类型输入文件合计最多 12 个。
- 音频不能作为唯一输入,必须与图像或视频一同输入。
- 参考生视频模式与首尾帧模式互斥,不能混用。
三、怎么用全能参考模式?
3.1 通过 API 调用
H3 的视频生成 V2 接口通过多模态 input 数组驱动。在必填的文本提示词之外,可同时附加:
role="reference_image"的图片role="reference_video"的视频role="reference_audio"的音频
接口地址:
- 提交任务:
POST https://www.dmxapi.cn/v1/responses - 获取结果:
POST https://www.dmxapi.cn/v1/responses(凭 task_id 查询)
完整 API 文档可参考 docs.aimlapi.com 或 doc.dmxapi.cn。
3.2 通过 ComfyUI 本地部署
ComfyUI 在 H3 发布当日就提供了原生支持。社区还开发了 CS-H3 多模态参考导演台 节点,可以在 “宫格模式” 和 “全能参考” 之间切换,将图片、视频、音频参考整理成一条可编辑时间线。
安装方式:
将文件夹放入:ComfyUI/custom_nodes/CS-H3-Multimodal-Director
然后完全重启 ComfyUI3.3 通过官方平台
你也可以通过 MiniMax 官方 Web 应用或桌面应用直接使用 H3:
- Web 应用(国内):hailuoai.com
- Web 应用(全球):hailuoai.video
- 桌面应用(国内):hub.minimaxi.com
- 桌面应用(全球):hub.minimax.io
四、全能参考模式的实际应用价值
全能参考模式让视频创作从单纯的文字驱动扩展到图片、视频、音频的混合驱动。典型的商业场景包括:
- 广告与品牌:参考产品图片 + 品牌视频素材 + 配乐音频,生成一致的品牌宣传视频
- 电商:多张产品图 + 动作参考视频 + 解说音频,自动生成产品展示视频
- 游戏与 UI/UX:参考游戏画面 + 参考镜头运动 + 背景音乐,生成游戏预告片
- 电影片头与动态海报:参考视觉风格 + 参考音频氛围
五、全能参考模式 vs 首尾帧模式
| 对比维度 | 全能参考模式(Ref2VA) | 首尾帧模式(FL2VA) |
|---|---|---|
| 参考素材类型 | 图像 + 视频 + 音频 | 仅图像(0–2 张) |
| 最大参考数量 | 12 个文件(9 图 + 3 视频 + 3 音频) | 2 张图像 |
| 适用场景 | 复杂多模态创作、品牌一致性、动作迁移 | 文生视频、图生视频、首尾帧控制 |
| 是否互斥 | 是(不能与首尾帧模式混用) | 是(不能与参考模式混用) |
总结
MiniMax H3 的全能参考模式(Ref2VA) 确实支持多模态参考输入,最多可同时使用 9 张图像、3 段视频和 3 段音频(合计不超过 12 个文件),实现跨模态的视频创作。音频不能单独作为输入,必须配合图像或视频。你可以通过 API、ComfyUI 本地部署或官方平台使用该功能。该模式与首尾帧模式互斥,适用于广告、电商、游戏等需要融合多种素材的商业场景。如果你使用实在Agent,该模型已经内置,可以直接体验全能参考模式。

