首页行业百科MiniMax H3 多图参考可以多少个图?

MiniMax H3 多图参考可以多少个图?

2026-08-06 11:36:52阅读 1

MiniMax H3 是一款通用型全模态生成系统,能够统一理解文本、图像、视频和音频,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。H3 的多图参考能力在“全能参考模式(Ref2VA)”下,最多支持 9 张图像

需要说明的是,实在Agent 已经内置了该模型,如果你使用实在Agent服务,无需自行处理任何多图参考的配置工作,可以直接在Agent工作流中调用 H3 的多图参考能力。

MiniMax H3 多图参考可以多少个图?_图1 图源:AI生成示意图

一、全能参考模式:核心规格

H3 提供两个版本,其中 H3-Base-Ref2VA(全能参考模式) 专为需要融合多种素材的复杂创作而设计。其多图参考的核心规格如下:

  • 图像数量:最多 9 张
  • 其他参考素材:除图像外,还可同时输入最多 3 段视频3 段音频
  • 总数限制:所有类型的输入文件(图像、视频、音频)合计最多 12 个

二、多图参考的实际能力

H3 的多图参考能力不仅仅是“看图”,而是理解多张图像之间的关系,并融合生成一个连贯的视频。

  • 锁定角色一致性:H3 可以从最多 9 张参考图像中锁定一个角色,并在不同场景中保持其身份特征(如比例、材质、轮廓)一致。
  • 理解复杂指令:模型能够理解 "图1负责人物身份与服装;图2只负责产品外形" 这类复杂的跨图像指令。
  • 融合多模态创作:可以将 9 张图像与视频、音频混合使用,实现 "参考视频 1 的镜头运动,让图 2 中的人物唱歌" 这类复杂的跨模态创作。

三、适用场景

9 张图像的参考容量为以下场景提供了强大的支持:

  • 广告与品牌宣传:使用多张产品图、不同角度的品牌素材图,生成风格统一的宣传视频。
  • 角色与故事创作:为同一个角色提供多个角度、不同表情或服装的参考图,确保其在视频的多个镜头中保持一致。
  • 电商展示:结合多张产品细节图,自动生成全方位展示的商品视频。
  • 复杂场景构建:通过多张图像分别提供场景、角色、道具等不同元素,再由模型融合成一个完整的视频画面。

四、与首尾帧模式的区别

H3 的另一个版本 H3-Base-FL2VA(首尾帧模式) 在图像输入上有不同的规格:

对比维度全能参考模式(Ref2VA)首尾帧模式(FL2VA)
图像数量最多 9 张0、1 或 2 张
其他参考可同时输入视频和音频仅图像
适用场景复杂多素材融合创作文生视频、图生视频、首尾帧控制
是否互斥与首尾帧模式互斥,不能混用与全能参考模式互斥

总结

MiniMax H3 在全能参考模式(Ref2VA) 下,最多支持 9 张图像 作为参考输入。这 9 张图像可以与最多 3 段视频和 3 段音频混合使用,所有文件合计不超过 12 个。该模式的核心价值在于能够从多张图像中提取并锁定关键特征(如角色身份),实现跨场景的一致性生成。如果你需要更简单的首尾帧控制,则应使用仅支持 0-2 张图像 of FL2VA 模式。如果你使用实在Agent,该模型已经内置,可以直接体验其强大的多图参考功能。

立即领取行业头部企业 AI 应用案例

资深 AI Agent 技术专家将为您定制数字员工解决方案

立即获取方案