MiniMax H3 提示词指南:官方结构写法,附真实片段实测
如何写 MiniMax H3 提示词:官方三段式结构、对白标签、镜头时间轴与参考素材标签,并用四段片段做了实测。
以 Markdown 阅读MiniMax H3 被设计为读取一种三段式的结构化提示词:沿时间轴展开的画面与对白、整体声音环境,以及背景音乐(如有)。 MiniMax 把将普通请求转换成这种格式的步骤称为 H3-Context-IR,并说它“critical to the quality of the final output”(对最终输出质量至关重要)。[1] 基于 MiniMax H3 构建的 SD Video 默认会在生成前改写你的提示词。在我们的四段测试片段中,普通提示词和按官方结构写的提示词得到的结果同样可用,而关闭改写则改变了镜头和声音混音。
本指南介绍官方结构,对白、切镜和参考素材的写法,以及测试的结果。
MiniMax H3 提示词长什么样?
对于文本、图片和关键帧模式,官方指南按固定顺序使用三个字段:[2]
- integrated_multimodal_description:主体部分。按时间顺序写视觉风格、构图、主体、动作、运镜、镜头切换、谁在说话、说了什么,以及与画面动作对应的声音。
- overall_soundscape:贯穿整个片段的环境音、动作音效和非语言的人声。
- non_diegetic_music:只有观众能听到的背景音乐,没有则写
N/A。
下面是我们测试中按这种结构写的一个简短示例:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/A官方指南要求这些段落用英文书写,而对白、歌词和画面中可见的文字保留原语言。[3]
MiniMax H3 提示词里的对白怎么写?
给每个说话人一个固定的 ID,例如 (S1) 或 (S2),在标签外描述音色,<d>…</d> 里只放语言标签和要说的话:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>标签里的文字会被逐字保留,所以要写成它应该被说出来的样子。同一个说话人在不同镜头中保持同一个 ID,从不开口的角色不分配 ID。旁白的写法,指南用的是“says in an off-screen voiceover”(以画外音说),然后注明画面中角色的嘴唇保持闭合。[2]
镜头和切镜的时间怎么控制?
把每个镜头标成 [Shot 1]、[Shot 2],并给出切镜时间:“[Shot 2] At 00:05.000, the camera cuts to a close-up of…”([Shot 2] 在 00:05.000 处,镜头切到……的特写)。时间轴加起来必须等于片段时长,即 4 到 15 秒。[2][3] 在我们的测试中,普通句子也有效:“At 3 seconds, cut to a close-up of steam rising from the bread”(在第 3 秒切到面包冒出热气的特写)在大约 3 秒处产生了一次切镜(见下文片段 C)。
对白需要在所在镜头里留出时间。SD Video 自己的建议是每秒约 2.5 个词的对白,所以一段 5 秒的片段只能容纳一句短句。[4]
如何在提示词中引用图片、视频和音频?
参考素材通过标签引用,按类型、按发送顺序编号:<Picture 1>、<Video 1>、<Audio 1>。官方指南要求每个标签在提示词的所有段落中保持一致。[3] 在完整参考模式下,官方改写使用六个段落而不是三个:主体定义、摘要、保留分析(每个参考素材要保留什么)、详细描述、声音环境和音乐。[3]
一个带标签的普通提示词往往就够了。这段片段使用了一段 3 秒的大提琴演奏参考视频,提示词是“The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.”(<Video 1> 中的大提琴手持续拉出一个长弓,固定镜头,温暖的室内底噪,大提琴的音符,没有背景音乐。):
SD Video 参考生视频,480p,5 秒,一段参考视频。
用多段参考视频是什么效果?
一段参考视频加一句简短的提示词。参考素材是一段 6 秒的滑冰者片段,提示词是“The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.”(<Video 1> 中的滑冰者在黄昏的户外冰场上滑行,镜头保持不动,冰刀刮过冰面,远处有交谈声,没有音乐。):
一段参考视频,480p,5 秒。
同样的提示词和参考素材,把 duration 设为 10:
一段参考视频,480p,10 秒。
两段参考视频按发送顺序编号。这里 <Video 1> 是滑冰者,<Video 2> 是一段 8.6 秒的舞蹈片段,提示词是“The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.”(<Video 1> 中的滑冰者在黄昏时观看 <Video 2> 中的舞者在冰上表演,固定镜头,冰刀刮擦声,没有音乐。):
两段参考视频,480p,5 秒。
这里 <Video 1> 是那段 3 秒的大提琴手片段,<Video 2> 是舞蹈片段,提示词是“The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.”(<Video 1> 中的大提琴手演奏,<Video 2> 中的舞者在她身旁缓慢移动,固定镜头,大提琴的音符,脚步声,没有背景音乐。):
两段参考视频,480p,5 秒。
aspect_ratio 保持 adaptive 时,片段会采用第一段参考视频的画面形状。舞蹈片段是竖屏的,所以这两条结果都是 480 × 832 的竖屏。两条使用了相同的提示词和相同的参考素材,没有固定 seed,所以每次运行各自选了自己的 seed,两条结果也不一样。提示词是“The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.”(<Video 1> 中的舞者在空荡的练功房里重复同样的动作,固定镜头,木地板上的脚步声,没有音乐。):
同一请求运行两次,480p,5 秒,竖屏。
结构化格式比普通提示词效果更好吗?
我们在基于 MiniMax H3 构建的 SD Video 上用四种方式生成了同一个面包店场景:文生视频,480p,5 秒,16:9,seed 42。每个提示词只跑了一次,所以请把这些结果看作单次观察,而不是平均值。
A. 普通提示词。 面包师放下面包,在缓慢推近的镜头中对着镜头说出台词。
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. 官方结构。 即上文第一节展示的提示词。结果与 A 接近:动作相同,台词说得正确,画面稍宽一些。
C. 带定时切镜的普通提示词。 台词在大约 2.5 秒处说完,镜头在 3 到 3.5 秒之间切到面包特写。
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. 关闭改写的提示词 A(prompt_enhancement: disabled)。镜头离得更远、几乎不动,门铃声先响,台词在大约 3.5 秒处才开始。音轨安静得多:平均电平比另外三段片段低约 20 dB。
这说明了什么:
| 提示词 | 台词是否说对 | 变化 |
|---|---|---|
| A. 普通 | 是 | 基准 |
| B. 官方结构 | 是 | 与 A 非常接近 |
| C. 普通,3 秒切镜 | 是 | 切镜落在要求的位置 |
| D. 普通,关闭改写 | 是 | 更宽的固定镜头,台词更晚,音频安静得多 |
当服务会改写你的提示词时,一个清晰的普通提示词就够了。当你关闭改写,或者在没有 H3-Context-IR 的情况下运行开源权重时,就需要自己按结构来写,因为这时没有任何环节会把你的文本转换成模型期望的格式。
写好 MiniMax H3 提示词的技巧
- 让时间轴与片段时长匹配;不要为 5 秒的片段描述 10 秒的动作。[3]
- 用具体的视觉和声音细节,而不是“cinematic”(电影感)或“beautiful”(漂亮)这类词。[3]
- 描述声音:室内底噪、动作音效以及它们的远近。如果不想要背景音乐,就写
no music。[4] - 对白保持简短,每几秒一句:自然语言写法放在引号里,结构化写法放进
<d>标签。 - 迭代一个镜头时,固定 seed,每次只改一处。[4]
- 使用关键帧时,说明首帧或尾帧如何与动作衔接。[3]
SD Video 页面提供可以试写提示词的 playground,API 文档列出了所有参数,包括 prompt_enhancement。
提示词常见问题
MiniMax H3 提示词要用英文写吗?
官方指南用英文写描述性段落,对白、歌词和画面文字保留原语言。[3] 其他语言的对白放在 <d> 标签里,并带上对应的语言标签。
H3-Context-IR 是什么?
它是 MiniMax 的预处理步骤,读取你发送的文本和媒体,并把它们改写成 H3 用来生成的结构化表示。它不在开源发布中;MiniMax 以 API 形式提供它,并公开了提示词指南,方便开发者自己实现。[1][5]
SD Video 的 prompt_enhancement 有什么作用?
它控制生成前对提示词的改写:turbo(默认)、quality,或 disabled,即按原文发送。改写不会改动 <Picture 1> 这类参考素材标签。[4]
MiniMax H3 提示词应该写多长?
长到足以覆盖整条时间轴。MiniMax 自己改写后的示例,单个片段就有几百个词,SD Video 的指南也指出细节写得多不会有坏处。[1][4]
参考资料
- MiniMax. MiniMax-H3 模型卡. 2026 年 10 月 4 日检索自 huggingface.co。
- MiniMax. h3-prompt-writing: base mode reference(references/base-en.txt). 2026 年 10 月 4 日检索自 github.com。
- MiniMax. H3 Prompt Writing skill. 2026 年 10 月 4 日检索自 github.com。
- SeedRouter. SD Video API reference. 2026 年 10 月 4 日检索自 seedrouter.ai。
- MiniMax. Create H3-Context-IR Task. 2026 年 10 月 4 日检索自 platform.minimax.io。



