MiniMax H3 提示词写作完全指南:三段式结构、运镜体系与常见错误
如果你在用 MiniMax H3 生成视频,大概已经发现:同一个模型,提示词写得好坏,出来的片子差距极大。
H3 的特点是「视频和音频一次生成」——它同时产出画面、环境音和配乐。这也意味着它的提示词不是随手写一段描述,而是有一套固定的结构化格式。写对了,模型按你的分镜走;写错了,它要么忽略你的意图,要么给你一段平淡的画面。
这篇指南把官方写作规范拆开讲清楚,包括格式、每条硬规则、以及最容易踩的坑。
一、先记住三条最容易踩的坑
- 第一个镜头绝不加时间戳。只有
[Shot 2]及之后才写At 00:03.500,这样的切点。 - 对白标签
<d>里只放语言标记和原话。说话人的身份、动作、语气、编号全部写在标签外面;标签内的内容逐字保留,不翻译、不改标点。 - 画面上的文字保留原文,不要翻译——用英文双引号括起来即可:
A red neon sign reading "营业中" glows above the doorway.
二、先分清两种输出格式
H3 有两类任务模式,格式完全不同。搞混是新手最常见的错误。
2.1 基础模式——三段式
适用于 T2VA(文生视频)/ I2VA(首帧)/ FL2VA(首尾帧)/ L2VA(尾帧):
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
2.2 全参考模式(Ref2VA)——六段式
这是最容易搞错的地方:Ref2VA 不是三段式,而是六个部分,顺序固定:
| 部分 | 作用 |
|---|---|
subject_definitions | 定义被引用的内容及其标签 |
summary | 任务类型前缀 + 目标视频与引用关系摘要 |
retention_analysis | 每项被引用内容如何被保留、转移或复用 |
detailed_description | 主体:按播放顺序逐镜头描述 |
overall_soundscape | 环境音 |
non_diegetic_music | 只有观众能听到的配乐 |
四种引用标签,一旦分配,在所有部分里含义不变:
| 标签 | 含义 |
|---|---|
<Subject N> | 从参考素材中抽象出来的可见内容(人物、物体、场景、服装、风格、动作) |
<Picture N> | 作为具体目标帧或分镜锚点的参考图 |
<Video N> | 提供剪辑源、续接起点或整片时间结构的参考视频 |
<Audio N> | 被复制或引用的音频 |
注意一个细节:<Video N> 和 <Audio N> 独立编号。同一个源视频可以同时是 <Video 1> 和 <Audio 2>,编号不同不代表来源不同。
三、第一个字段:integrated_multimodal_description
这是主体,逐镜头描述画面。每一个细节都要对应画面上真实存在的东西。
3.1 开头先声明风格
在 [Shot 1] 的最开头,先给出整体风格和初始构图。常用风格词:
Cinematic、live-action、2D-animated、3D CG、claymation、watercolor、vintage film
[Shot 1] Live-action, cinematic, a medium-wide shot frames...
不写风格,模型会自己猜,结果往往偏平淡。
3.2 镜头与切镜头
- 首镜头写
[Shot 1],不带时间戳 - 之后每个镜头写
[Shot N] At MM:SS.mmm, ...,时间戳严格递增,且必须落在视频总时长内 - 普通切镜头用这五种说法之一:
the camera cuts to/the shot cuts to/the shot transitions to/the shot changes to/the shot switches to - 交叉溶解、淡入淡出、划像只在明确需要时才用
一个重要的判断标准:一次切镜头应该带来新信息——新的主体、空间、状态、视角或时间。如果只是距离远近或轻微角度变化,用运镜,不要切镜头。
3.3 运镜:类型 + 幅度 + 速度
运镜要写成自然的英文动作句,而不是把标签堆在句尾。完整的表达有三个维度:
| 运动类型 | 含义 |
|---|---|
Zoom In / Zoom Out | 变焦,机身不动 |
Push In / Pull Out | 机身前进 / 后退 |
Pan Left / Pan Right | 镜头水平摇,机身不动 |
Truck Left / Truck Right | 机身水平平移 |
Tilt Up / Tilt Down | 镜头垂直摇,机身不动 |
Pedestal Up / Pedestal Down | 整机升降 |
Arc Shot | 环绕主体 |
Tracking Shot | 跟随移动主体 |
Static Shot | 完全固定 |
Shake Slightly / Shake Strongly | 抖动 |
POV | 主观视角 |
Roll Clockwise / Roll Counterclockwise | 沿镜头轴滚转 |
幅度用 with small amplitude / with large amplitude,速度用 at slow speed / at fast speed。
关键点:中等幅度和常速通常省略——写出来反而是冗余。
The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.
The camera pans right with large amplitude at fast speed, revealing the open doorway.
The camera holds a static shot as the runner exits the frame.
3.4 说话人、对白与旁白
谁说话,谁就有编号。用 (S1)、(S2),多人同时发声用复合编号 (S1,S2)。
三条规则:
- 同一个说话人跨镜头保持同一个编号
- 从不发声的角色不给编号
- 说话人首次出现时,给足辨识信息:角色类型、年龄、性别、是否在画面内、音高、音色、语速、口音
修饰语、编号、动作、语气写在 <d> 外面;<d> 里面只有语言标记和原话:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>
<d> 里的内容逐字保留——不翻译、不改标点、不缩写。听不清的地方写 [unclear],不要猜、不要改写。
旁白必须用固定短语 says in an off-screen voiceover,而且每个旁白块之后要说明角色嘴唇保持闭合:
The man (S1) says in an off-screen voiceover: <d>[English] I still remember that road.</d> while his lips remain completely closed.
3.5 跨剪辑、截断与画面文字
- 同一句台词跨剪辑:在两个连接点都放
<scenetrans>,并明确说明音频延续 - 语音被视频结尾截断:用
<cutoff> - 画面上的文字(招牌、字幕、霓虹灯)用英文双引号括起来,保留原文语言,不翻译
A red neon sign reading "营业中" glows above the doorway.
Text on screen reads "BREAKING NEWS" in white block letters.
四、第二个字段:overall_soundscape
整段视频的环境音。1 到 4 句英文,合成一段。
写什么:环境声、物理动作声、非语言人声——风、雨、车流、脚步、布料摩擦、碰撞、呼吸、笑声、喘息。
三个注意点:
- 不要复述对白、歌唱和角色能听到的音乐(那些已经在第一个字段里了)
- 写具体的声源,不要写形容词:"rain on a metal awning" 优于 "atmospheric sound"
- 句数有上限:最多 4 句。声源多于 4 个时,合并到同一句里,而不是再加一句
overall_soundscape: Steady rain taps against the café windows while low room ambience continues underneath. The entrance bell rings once, followed by wet footsteps and the soft scrape of a chair.
五、第三个字段:non_diegetic_music
只有观众能听到的配乐——角色听不到的那种。1 到 3 句英文。
- 只写器乐、速度、节奏、动态变化,例如 "sparse piano notes with long decay, slow tempo, rising in volume"
- 不要用抽象情绪词("忧郁"、"史诗感"、"充满希望"),也不要解释配乐的情感作用
- 角色能听到的音乐(收音机、电视、有人唱歌)属于剧情内的声音,要写在第一个字段里,不是这里
- 没有配乐时写
N/A
non_diegetic_music: Sparse piano notes at a slow tempo, joined by sustained low strings that gradually increase in volume before fading out.
六、四种基础模式的差别
| 模式 | 输入 | 写法要点 |
|---|---|---|
| T2VA | 纯文本 | 没有图片对齐指令,直接从三个字段开始 |
| I2VA | 首帧图 | 从首帧向前发展:首帧锚定 → 动作起始 → 连续发展 → 结果或反应 |
| FL2VA | 首帧 + 尾帧 | 描述两帧之间的路径,不是两段静态描述;通常倾向单镜头让模型连续插值 |
| L2VA | 尾帧图 | 从尾帧倒推一个合理的前序状态,逐步收敛到尾帧 |
带图片的模式需要一段对齐指令,而且它必须是整个提示词的第一行,后面跟一个空行:
# I2VA
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
# FL2VA
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.
(S.SS 是有效时长,强制保留两位小数。)
顺带一个选择建议:FL2VA 的原始输出质量通常优于 Ref2VA。官方原话是「FL2VA 只用关键帧训练,通常能给出更好的原始输出;Ref2VA 能接受更多参考素材,但基础质量较低」。所以如果你的场景不需要大量参考图,优先用 FL2VA。
七、常见错误清单
写完提示词,对照这张表过一遍:
- 首镜头带了时间戳
- 时间戳没有严格递增,或超出了视频时长
- 描述的总时长与你要求的时长对不上(H3 单段支持 4–15 秒)
- 没有在
[Shot 1]开头声明风格 - 只是距离或角度变化就切了镜头(应该用运镜)
- 用了
with medium amplitude或at moderate speed(通常该省略) - 说话人编号跨镜头变了,或者给不发声的角色也编了号
<d>里混进了动作、语气、身份描述- 对白被翻译、改写或"润色"了
- 旁白块之后没有说明嘴唇闭合
overall_soundscape超过 4 句,或复述了对白non_diegetic_music用了抽象情绪词,或把角色能听到的音乐写了进去- 画面上的文字被翻译成了英文
- 用了 "cinematic"、"beautiful" 这类抽象词当描述(除非是在声明风格)
八、进阶:值得关注的生态工具
官方在 github.com/MiniMax-AI/MiniMax-H3 的 skills/ 目录下提供了完整的写作技能包,包括基础模式和全参考模式两份详解,另有 8 个场景技能(3D 动画、品牌宣传、游戏开场、极简产品广告、MV 字幕、拼贴解说等)。生态索引见 MiniMax-AI/awesome-minimax-h3-integration。
社区里几个有代表性的提示词工具:
- OpenH3-IR —— 遵循官方格式,思路是「先写出文档,再检查并修正错误」,而不是替你重写
- ComfyUI-MiniMax-H3-Promptor —— 把
<Picture X>直接嵌进叙述动作行,避免标注与正文脱节 - ComfyUI-MiniMax-H3-Guide —— 把身份、关键帧、运动、声音、配乐拆成显式角色再编译成 H3 文本
- awesome-MiniMax-H3-cases —— 2000+ 可播放案例,内含 600 多条完整公开提示词,适合当范例库
⚠️ 官方有一条明确建议:一次只用一个提示词工具。不同工具的输出格式约定不统一,混用容易互相冲突。
结语
H3 的提示词写作,本质上是把导演的意图翻译成模型能精确执行的指令。它的格式约束看着繁琐,但每一条背后都有原因:
- 时间戳严格递增 → 模型据此切分镜头边界
- 运镜写成自然句 → 模型理解动作而非标签
- 音轨分成三层 → 环境音、对白、配乐走不同的生成路径
- 保留原文不翻译 → 画面文字和台词需要原样呈现
把这些规则当成语法而不是"建议",写出来的提示词质量会有明显差别。
祝你拍出想要的那个镜头。