MiniMax H3 提示词规范与写法指南
MiniMax H3 是一款支持文本、图像、视频、音频多模态输入的视频生成模型。与以往将提示词当作简单画面描述的视频模型不同,H3 使用 Contextual Omni Representation,将语言作为连接所有模态的计算桥梁。这意味着提示词的质量直接决定了输出质量。本文介绍 H3 提示词的官方规范在哪里找,以及如何写出符合规范的有效提示词。
需要说明的是,实在Agent 已经内置了该模型,如果你使用实在 Agent 服务,无需自行处理部署配置,可以直接参考本文的提示词写法进行创作。
一、提示词规范在哪里找
H3 的提示词规范主要分布在以下官方和社区渠道:
1.1 官方 GitHub 仓库
MiniMax 官方在 github.com/MiniMax-AI/MiniMax-H3 中提供了专门的提示词编写技能文档:
skills/h3-prompt-writing/SKILL.md:官方提示词编写指南,涵盖 T2VA、I2VA、FL2VA、L2VA 和 Ref2VA 等所有模式references/base-en.txt:基础模式的提示词结构模板(T2VA/I2VA/FL2VA/L2VA)references/ref-en.txt:全参考模式(Ref2VA)的六段式改写格式
这些是最权威的规范来源,建议优先阅读。
1.2 官方平台文档
- MiniMax 平台 API 文档:platform.minimaxi.com 提供 API 调用时的提示词示例
- MiniMax Research 博客:www.minimaxi.com 发布模型技术解读
1.3 社区整理资源
- 提示词工程指南:社区整理的
awesome-minimax-h3/minimax-video/references/prompt-engineering.md,包含镜头运动词典、灯光词典等实用参考 - 提示词合集:社区已整理超过 222 条提示词,覆盖电影感、动画、产品广告等类型
- 故事板提示词生成工具:社区开发的 Skill 可帮助生成符合官方规范的结构化提示词
二、提示词的核心结构
H3 的提示词不是一段散文式的画面描述,而是一个结构化的控制文档。官方提示词框架将视频控制分为六个层次:
| 控制层 | 要解决的问题 | 可观察表达 |
|---|---|---|
| 目的 | 这条视频为什么存在 | 商品展示、剧情钩子、玩法演示 |
| 不变量 | 什么绝不能漂移 | 人物身份、产品结构、品牌字样 |
| 事件 | 画面中实际发生什么 | 动作顺序、对象关系、状态变化 |
| 摄影 | 观众如何看见它 | 景别、机位、运镜、对焦 |
| 质感 | 它看起来属于什么世界 | 光线、色彩、材质、媒介 |
| 声音 | 观众如何听见它 | 对白、音乐、环境声、音效 |
先解决不变量、事件和摄影,再补质感。只写“高级、电影感、炸裂”不能形成可执行镜头。
三、按模式选择提示词结构
H3 支持多种生成模式,不同模式的提示词结构不同:
| 模式 | 输入 | 提示词结构 |
|---|---|---|
| T2VA | 纯文本 | 纯文本生成视频,构建完整的音视频时间线 |
| I2VA | 1 张图 | 从首帧出发向前发展 |
| FL2VA | 0-2 张图 | 描述首尾帧之间的连续路径 |
| L2VA | 1 张图(尾帧) | 推断合理开头并收敛到给定尾帧 |
| Ref2VA | 图像≤9,视频≤3,音频≤3 | 全参考模式,六段式结构 |
3.1 基础模式(T2VA/I2VA/FL2VA/L2VA)的提示词结构
基础模式按以下顺序组织:
"integrated_multimodal_description":整合的多模态描述,按时间线描述画面内容"overall_soundscape":整体声音景观(环境声、对白等)"non_diegetic_music":非剧情音乐(背景配乐)
3.2 全参考模式(Ref2VA)的提示词结构
Ref2VA 使用六段式结构,顺序如下:
"subject_definitions":主体定义(人物、产品等)"summary":视频概要"retention_analysis":保留分析(哪些特征需要保持一致)"detailed_description":详细描述(按时间线展开)"overall_soundscape":整体声音景观"non_diegetic_music":非剧情音乐
四、提示词写法核心技巧
4.1 用好素材绑定
用一句话明确绑定素材与职责:
“图1严格负责人物身份与服装;图2只负责产品外形和标签;视频1负责动作、机位与节奏;音频1负责音乐节拍。”
随后把关键不变量展开为可观察特征,不要在每段重新描述整套素材。
4.2 处理多素材时的主次关系
当多份素材都包含人物或场景时,必须明确:
- 哪一份决定身份
- 哪一份只提供姿势、光线或风格
- 冲突部分以哪一份为准
不要让“图1参考人物”和“视频1保持原人物”同时存在而不说明优先级。
4.3 时间轴写法
单镜头:使用连续链条——起始构图 → 主动作 → 相机反应 → 状态变化 → 结束构图,不要人为拆成多个时间段。
多镜头:按时间段分配功能:
- 开端:识别主体或建立钩子
- 中段:展示变化、冲突或核心内容
- 结尾:产品定格、情绪落点或循环衔接
每段只保留一个主要视觉任务。动作、镜头和转场之间写清因果关系,例如“扇面扫满画面形成遮挡,遮挡最满时切到下一场景”比“炫酷转场”更可执行。
4.4 声音描述不能省略
H3 是音视频联合生成的模型。如果不写声音方向,音频部分可能变成“奇怪的语音杂音”。必须在提示词中明确描述:
- 对白内容
- 环境声
- 背景音乐
- 音效及卡点
4.5 善用镜头和灯光术语
H3 能够理解专业的摄影术语。以下术语可以直接使用:
镜头运动:Dolly zoom(希区柯克变焦)、Crane shot(升降镜头)、Steadicam(斯坦尼康)、Whip pan(甩镜头)、Rack focus(焦点转移)、Push in(推进)、Pull out(拉远)、Tracking(跟拍)、Orbital(环绕)、Handheld(手持)
灯光风格:Golden hour(黄金时刻)、Rembrandt lighting(伦勃朗光)、Split lighting(分割光)、Rim light(轮廓光)、Chiaroscuro(明暗对照)、Neon noir(霓虹 noir)、Silhouette(剪影)
五、提示词长度参考
根据社区对官方 45 条示例提示词的分析,提示词中位长度约 130 个中文字符,最长的达到 657 和 858 个字符。提示词并不是越长越好——关键是结构完整、描述精准,而不是堆砌字数。
六、实用资源推荐
- 官方提示词编写指南:github.com/MiniMax-AI/MiniMax-H3/tree/main/skills/h3-prompt-writing
- 提示词工程指南:github.com/joeVenner/awesome-minimax-h3
- 提示词合集(222+ 条) :www.cnblogs.com/ChinaManor/articles/22169160
- 故事板提示词生成 Skill:github.com/sjh00/MiniMax-H3-Storyboard-Prompt-Generator-Skill
总结
MiniMax H3 的提示词规范可在官方 GitHub 仓库("skills/h3-prompt-writing/")和官方平台文档中找到。H3 的提示词是结构化控制文档而非散文描述,按“目的→不变量→事件→摄影→质感→声音”六层组织。不同模式(T2VA/I2VA/FL2VA/L2VA/Ref2VA)使用不同的结构模板。关键技巧包括:明确素材绑定与主次关系、按时间线合理分配镜头功能、必须包含声音描述、善用专业镜头和灯光术语。提示词中位长度约 130 个中文字符。如果你使用实在 Agent,该模型已经内置,可以直接参考以上写法进行创作。



