MiniMax H3 多图参考可以多少个图?
2026-08-06 11:36:52阅读 1
MiniMax H3 是一款通用型全模态生成系统,能够统一理解文本、图像、视频和音频,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。H3 的多图参考能力在“全能参考模式(Ref2VA)”下,最多支持 9 张图像。
需要说明的是,实在Agent 已经内置了该模型,如果你使用实在Agent服务,无需自行处理任何多图参考的配置工作,可以直接在Agent工作流中调用 H3 的多图参考能力。
一、全能参考模式:核心规格
H3 提供两个版本,其中 H3-Base-Ref2VA(全能参考模式) 专为需要融合多种素材的复杂创作而设计。其多图参考的核心规格如下:
- 图像数量:最多 9 张。
- 其他参考素材:除图像外,还可同时输入最多 3 段视频 和 3 段音频。
- 总数限制:所有类型的输入文件(图像、视频、音频)合计最多 12 个。
二、多图参考的实际能力
H3 的多图参考能力不仅仅是“看图”,而是理解多张图像之间的关系,并融合生成一个连贯的视频。
- 锁定角色一致性:H3 可以从最多 9 张参考图像中锁定一个角色,并在不同场景中保持其身份特征(如比例、材质、轮廓)一致。
- 理解复杂指令:模型能够理解 "图1负责人物身份与服装;图2只负责产品外形" 这类复杂的跨图像指令。
- 融合多模态创作:可以将 9 张图像与视频、音频混合使用,实现 "参考视频 1 的镜头运动,让图 2 中的人物唱歌" 这类复杂的跨模态创作。
三、适用场景
9 张图像的参考容量为以下场景提供了强大的支持:
- 广告与品牌宣传:使用多张产品图、不同角度的品牌素材图,生成风格统一的宣传视频。
- 角色与故事创作:为同一个角色提供多个角度、不同表情或服装的参考图,确保其在视频的多个镜头中保持一致。
- 电商展示:结合多张产品细节图,自动生成全方位展示的商品视频。
- 复杂场景构建:通过多张图像分别提供场景、角色、道具等不同元素,再由模型融合成一个完整的视频画面。
四、与首尾帧模式的区别
H3 的另一个版本 H3-Base-FL2VA(首尾帧模式) 在图像输入上有不同的规格:
| 对比维度 | 全能参考模式(Ref2VA) | 首尾帧模式(FL2VA) |
|---|---|---|
| 图像数量 | 最多 9 张 | 0、1 或 2 张 |
| 其他参考 | 可同时输入视频和音频 | 仅图像 |
| 适用场景 | 复杂多素材融合创作 | 文生视频、图生视频、首尾帧控制 |
| 是否互斥 | 与首尾帧模式互斥,不能混用 | 与全能参考模式互斥 |
总结
MiniMax H3 在全能参考模式(Ref2VA) 下,最多支持 9 张图像 作为参考输入。这 9 张图像可以与最多 3 段视频和 3 段音频混合使用,所有文件合计不超过 12 个。该模式的核心价值在于能够从多张图像中提取并锁定关键特征(如角色身份),实现跨场景的一致性生成。如果你需要更简单的首尾帧控制,则应使用仅支持 0-2 张图像 of FL2VA 模式。如果你使用实在Agent,该模型已经内置,可以直接体验其强大的多图参考功能。

