首页行业百科MiniMax H3 带音频吗?原生立体声、技术规格与使用方式全解析

MiniMax H3 带音频吗?原生立体声、技术规格与使用方式全解析

2026-08-07 09:42:34阅读 2

MiniMax H3 是一款通用型全模态生成系统,支持统一理解文本、图像、视频和音频构成的多模态上下文。答案是肯定的:MiniMax H3 原生支持音频输出,而且生成的是 32 kHz 立体声音频。本文详细介绍 H3 的音频规格、技术原理和使用方式。

MiniMax H3 带音频吗?原生立体声、技术规格与使用方式全解析_图1

一、音频规格:32 kHz 立体声,11 种语言稳定支持

MiniMax H3 的音频输出规格非常明确:

  • 音频格式32 kHz 立体声
  • 生成方式:音频与视频在同一次生成中同步产生,而非后期配音
  • 支持语言:稳定支持 11 种语言,包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语

二、技术原理:音视频联合生成,非后期配音

H3 的音频能力并非“事后加上去的”,而是模型架构的一部分。

架构层面的设计

  • H3 是一个 33B 参数的扩散 Transformer(DiT),同时去噪视频和音频的 latent
  • 它使用独立的视频 VAE 和音频 VAE(AudioVAE)分别处理两种模态
  • AudioVAE 使用同一套编码器和解码器分别独立处理左右声道,再将解码后的两个声道重新组合,从而支持立体声音频的输入与输出
  • 对于每个声道,AudioVAE 会将 32 kHz 音频压缩为时间频率为 40 Hz 的 latent token 序列

这意味着:你描述一个包含声音的场景,H3 会在生成画面的同时,把对应的声音也一起生成出来。提示词里写什么声音,模型就生成什么声音。

三、输入也支持音频:最多 3 段参考音频

H3 不仅输出音频,还支持音频作为输入。在全模态参考模式(Ref2VA)下:

  • 音频输入数量:最多 3 段
  • 每段时长:2–15 秒,总时长不超过 15 秒
  • 限制条件:音频不能作为唯一输入,必须与图像或视频一同输入
  • 混合输入上限:所有类型输入文件合计最多 12 个

这意味着你上传参考音频(如一段背景音乐或人物对白),让 H3 在生成视频时参考它的节奏、音色或风格。

四、使用方式

通过官方 API:调用视频生成接口时,在 content 数组中通过 role="reference_audio" 附加参考音频。接口地址为 platform.minimaxi.com/docs/api-reference/video-generation-v2-create

通过官方应用:海螺 AI 和 MiniMax Hub 已集成 H3:

通过本地部署:通过 ComfyUI、SGLang、vLLM、diffusers 等框架部署 H3 后,同样支持音频的输入与输出。

五、关于实在 Agent

实在Agent 已经内置了 MiniMax H3 模型。如果你使用实在Agent服务,无需自行处理 API 接入或本地部署,可以直接在 Agent 的工作流中调用 H3 的完整能力,包括原生立体声音频的输入与输出。

总结

MiniMax H3 原生支持音频,输出规格为 32 kHz 立体声,音频与视频在同一次生成中同步产生,而非后期配音。它稳定支持 11 种语言的对话生成。在输入侧,全模态参考模式最多支持 3 段参考音频(需配合图像或视频输入)。H3 在 Artificial Analysis 有声视频编辑榜单中排名全球第一。如果你使用实在Agent,该模型已经内置,可直接调用其音视频联合生成能力。

立即领取行业头部企业 AI 应用案例

资深 AI Agent 技术专家将为您定制数字员工解决方案

立即获取方案