首页行业百科MiniMax H3 提示词规范与写法指南

MiniMax H3 提示词规范与写法指南

2026-08-06 11:05:30阅读 8

MiniMax H3 是一款支持文本、图像、视频、音频多模态输入的视频生成模型。与以往将提示词当作简单画面描述的视频模型不同,H3 使用 Contextual Omni Representation,将语言作为连接所有模态的计算桥梁。这意味着提示词的质量直接决定了输出质量。本文介绍 H3 提示词的官方规范在哪里找,以及如何写出符合规范的有效提示词。

需要说明的是,实在Agent 已经内置了该模型,如果你使用实在 Agent 服务,无需自行处理部署配置,可以直接参考本文的提示词写法进行创作。

MiniMax H3 提示词规范与写法指南_图1 图源:AI生成示意图

一、提示词规范在哪里找

H3 的提示词规范主要分布在以下官方和社区渠道:

1.1 官方 GitHub 仓库

MiniMax 官方在 github​.com/MiniMax-AI/MiniMax-H3 中提供了专门的提示词编写技能文档:

  • skills/h3-prompt-writing/SKILL.md:官方提示词编写指南,涵盖 T2VA、I2VA、FL2VA、L2VA 和 Ref2VA 等所有模式
  • references/base-en.txt:基础模式的提示词结构模板(T2VA/I2VA/FL2VA/L2VA)
  • references/ref-en.txt:全参考模式(Ref2VA)的六段式改写格式

这些是最权威的规范来源,建议优先阅读。

1.2 官方平台文档

1.3 社区整理资源

  • 提示词工程指南:社区整理的 awesome-minimax-h3/minimax-video/references/prompt-engineering.md,包含镜头运动词典、灯光词典等实用参考
  • 提示词合集:社区已整理超过 222 条提示词,覆盖电影感、动画、产品广告等类型
  • 故事板提示词生成工具:社区开发的 Skill 可帮助生成符合官方规范的结构化提示词

二、提示词的核心结构

H3 的提示词不是一段散文式的画面描述,而是一个结构化的控制文档。官方提示词框架将视频控制分为六个层次:

控制层要解决的问题可观察表达
目的这条视频为什么存在商品展示、剧情钩子、玩法演示
不变量什么绝不能漂移人物身份、产品结构、品牌字样
事件画面中实际发生什么动作顺序、对象关系、状态变化
摄影观众如何看见它景别、机位、运镜、对焦
质感它看起来属于什么世界光线、色彩、材质、媒介
声音观众如何听见它对白、音乐、环境声、音效

先解决不变量、事件和摄影,再补质感。只写“高级、电影感、炸裂”不能形成可执行镜头。

三、按模式选择提示词结构

H3 支持多种生成模式,不同模式的提示词结构不同:

模式输入提示词结构
T2VA纯文本纯文本生成视频,构建完整的音视频时间线
I2VA1 张图从首帧出发向前发展
FL2VA0-2 张图描述首尾帧之间的连续路径
L2VA1 张图(尾帧)推断合理开头并收敛到给定尾帧
Ref2VA图像≤9,视频≤3,音频≤3全参考模式,六段式结构

3.1 基础模式(T2VA/I2VA/FL2VA/L2VA)的提示词结构

基础模式按以下顺序组织:

  1. "integrated_multimodal_description":整合的多模态描述,按时间线描述画面内容
  2. "overall_soundscape":整体声音景观(环境声、对白等)
  3. "non_diegetic_music":非剧情音乐(背景配乐)

3.2 全参考模式(Ref2VA)的提示词结构

Ref2VA 使用六段式结构,顺序如下:

  1. "subject_definitions":主体定义(人物、产品等)
  2. "summary":视频概要
  3. "retention_analysis":保留分析(哪些特征需要保持一致)
  4. "detailed_description":详细描述(按时间线展开)
  5. "overall_soundscape":整体声音景观
  6. "non_diegetic_music":非剧情音乐

四、提示词写法核心技巧

4.1 用好素材绑定

用一句话明确绑定素材与职责:

“图1严格负责人物身份与服装;图2只负责产品外形和标签;视频1负责动作、机位与节奏;音频1负责音乐节拍。”

随后把关键不变量展开为可观察特征,不要在每段重新描述整套素材。

4.2 处理多素材时的主次关系

当多份素材都包含人物或场景时,必须明确:

  • 哪一份决定身份
  • 哪一份只提供姿势、光线或风格
  • 冲突部分以哪一份为准

不要让“图1参考人物”和“视频1保持原人物”同时存在而不说明优先级。

4.3 时间轴写法

单镜头:使用连续链条——起始构图 → 主动作 → 相机反应 → 状态变化 → 结束构图,不要人为拆成多个时间段。

多镜头:按时间段分配功能:

  • 开端:识别主体或建立钩子
  • 中段:展示变化、冲突或核心内容
  • 结尾:产品定格、情绪落点或循环衔接

每段只保留一个主要视觉任务。动作、镜头和转场之间写清因果关系,例如“扇面扫满画面形成遮挡,遮挡最满时切到下一场景”比“炫酷转场”更可执行。

4.4 声音描述不能省略

H3 是音视频联合生成的模型。如果不写声音方向,音频部分可能变成“奇怪的语音杂音”。必须在提示词中明确描述:

  • 对白内容
  • 环境声
  • 背景音乐
  • 音效及卡点

4.5 善用镜头和灯光术语

H3 能够理解专业的摄影术语。以下术语可以直接使用:

镜头运动:Dolly zoom(希区柯克变焦)、Crane shot(升降镜头)、Steadicam(斯坦尼康)、Whip pan(甩镜头)、Rack focus(焦点转移)、Push in(推进)、Pull out(拉远)、Tracking(跟拍)、Orbital(环绕)、Handheld(手持)

灯光风格:Golden hour(黄金时刻)、Rembrandt lighting(伦勃朗光)、Split lighting(分割光)、Rim light(轮廓光)、Chiaroscuro(明暗对照)、Neon noir(霓虹 noir)、Silhouette(剪影)

五、提示词长度参考

根据社区对官方 45 条示例提示词的分析,提示词中位长度约 130 个中文字符,最长的达到 657 和 858 个字符。提示词并不是越长越好——关键是结构完整、描述精准,而不是堆砌字数。

六、实用资源推荐

总结

MiniMax H3 的提示词规范可在官方 GitHub 仓库"skills/h3-prompt-writing/")和官方平台文档中找到。H3 的提示词是结构化控制文档而非散文描述,按“目的→不变量→事件→摄影→质感→声音”六层组织。不同模式(T2VA/I2VA/FL2VA/L2VA/Ref2VA)使用不同的结构模板。关键技巧包括:明确素材绑定与主次关系、按时间线合理分配镜头功能、必须包含声音描述、善用专业镜头和灯光术语。提示词中位长度约 130 个中文字符。如果你使用实在 Agent,该模型已经内置,可以直接参考以上写法进行创作。

立即领取行业头部企业 AI 应用案例

资深 AI Agent 技术专家将为您定制数字员工解决方案

立即获取方案