MiniMax H3 プロンプトガイド:公式の構成を実際のクリップで検証
MiniMax H3 のプロンプトの書き方を解説。公式の 3 部構成、セリフのタグ、ショットのタイミング、参照ラベルを 4 本のクリップで検証しました。
Markdown で読むMiniMax H3 は、3 つの部分からなる構造化された形式でプロンプトを読むように作られています。タイムラインに沿った映像とセリフ、全体のサウンドスケープ、そして背景音楽(ある場合)です。 MiniMax は普通のリクエストをこの形式に変換するステップを H3-Context-IR と呼び、それが「critical to the quality of the final output」(最終的な出力の品質に不可欠)だと述べています。[1] MiniMax H3 をベースにした SD Video は、デフォルトで生成前にプロンプトを書き換えます。4 本の検証クリップでは、普通のプロンプトと公式の構成で書いたプロンプトは同じくらい使える結果になり、書き換えをオフにするとショットと音のミックスが変わりました。
このガイドでは、公式の構成、セリフ・カット・参照の書き方、そして検証の結果を紹介します。
MiniMax H3 のプロンプトはどんな形?
テキスト、画像、キーフレームの各モードでは、公式ガイドは 3 つのフィールドを決まった順番で使います。[2]
- integrated_multimodal_description:本文です。ビジュアルスタイル、構図、被写体、動作、カメラ、ショットの切り替え、誰が話し何を言うか、画面上の動作に結びついた音を、時間順に書きます。
- overall_soundscape:クリップ全体を通した環境音、動作音、言葉以外の人の声。
- non_diegetic_music:観客にだけ聞こえる背景音楽。なければ
N/A。
この構成で書いた短い例(検証で使ったもの)です。
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/A公式ガイドはこれらのセクションを英語で書くよう求めており、セリフ、歌詞、画面に映る文字は元の言語のままにします。[3]
MiniMax H3 のプロンプトでセリフはどう書く?
話者ごとに (S1) や (S2) のような固定 ID を付け、声の特徴はタグの外に書き、<d>…</d> の中には言語タグと話す言葉だけを入れます。[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>タグ内の言葉はそのまま使われるので、話してほしいとおりに正確に書きます。同じ話者はショットをまたいでも同じ ID を使い、一度も話さないキャラクターには ID を付けません。ナレーションについては、ガイドは「says in an off-screen voiceover」(画面外のボイスオーバーで話す)という表現を使い、画面上のキャラクターの唇は閉じたままだと明記しています。[2]
ショットとカットのタイミングはどう指定する?
各ショットを [Shot 1]、[Shot 2] と記し、カットの時刻を書きます。「[Shot 2] At 00:05.000, the camera cuts to a close-up of…」([Shot 2] 00:05.000 に、カメラが…のクローズアップにカット)のように書きます。タイムラインの合計はクリップの長さ、つまり 4〜15 秒と一致する必要があります。[2][3] 検証では普通の文でも機能しました。「At 3 seconds, cut to a close-up of steam rising from the bread」(3 秒の時点で、パンから立ちのぼる湯気のクローズアップにカット)と書くと、約 3 秒でカットが入りました(下のクリップ C)。
セリフにはショットの中で余裕が必要です。SD Video 自身のガイドではセリフは 1 秒あたり約 2.5 語なので、5 秒のクリップに入るのは短い一文です。[4]
プロンプトで画像・動画・音声を参照するには?
参照素材はラベルで指定し、種類ごとに送った順に番号を付けます:<Picture 1>、<Video 1>、<Audio 1>。公式ガイドは、各ラベルをプロンプトのすべてのセクションで同じにするよう求めています。[3] フル参照モードでは、公式の書き換えは 3 つではなく 6 つのセクションを使います。被写体の定義、要約、保持の分析(各参照から何を残すか)、詳細な描写、サウンドスケープ、音楽です。[3]
ラベルを 1 つ入れた普通のプロンプトで十分なことも多くあります。このクリップでは、チェロを演奏する 3 秒の参照動画と、「The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.」(<Video 1> のチェロ奏者が長いボウイングを 1 回弾き続ける。固定カメラ、温かみのある室内の環境音、チェロの音色、BGM なし。)というプロンプトを使いました。
SD Video の参照から動画、480p、5 秒、参照動画 1 本。
参照動画を増やすとどうなりますか?
参照動画 1 本と短いプロンプトの組み合わせです。参照はスケーターを撮った 6 秒のクリップで、プロンプトは「The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.」(<Video 1> のスケーターたちが夕暮れの屋外リンクを滑る。カメラは固定、氷を削るスケートの音、遠くの話し声、音楽なし。)です。
参照動画 1 本、480p、5 秒。
同じプロンプトと参照で、duration を 10 にした場合です。
参照動画 1 本、480p、10 秒。
参照動画が 2 本の場合、送った順にラベルが付きます。ここでは <Video 1> がスケーター、<Video 2> が 8.6 秒のダンスのクリップで、プロンプトは「The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.」(<Video 1> のスケーターたちが、夕暮れの氷上で踊る <Video 2> のダンサーを見つめる。固定カメラ、スケートが氷を削る音、音楽なし。)です。
参照動画 2 本、480p、5 秒。
こちらは <Video 1> が 3 秒のチェロ奏者のクリップ、<Video 2> がダンスのクリップで、プロンプトは「The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.」(<Video 1> のチェロ奏者が演奏し、そのそばで <Video 2> のダンサーがゆっくり動く。固定カメラ、チェロの音色、足音、BGM なし。)です。
参照動画 2 本、480p、5 秒。
aspect_ratio を adaptive のままにすると、クリップは 1 本目の参照動画の形に合わせられます。ダンスのクリップは縦長なので、この 2 本の結果は 480 × 832 の縦長になりました。どちらも同じプロンプトと同じ参照を使い、seed は固定していないため、実行ごとにそれぞれ seed が選ばれ、結果が異なります。プロンプトは「The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.」(<Video 1> のダンサーが誰もいないスタジオで同じ動きを繰り返す。固定カメラ、木の床を踏む足音、音楽なし。)です。
同じリクエストを 2 回実行、480p、5 秒、縦長。
構造化された形式は普通のプロンプトより良い?
MiniMax H3 をベースにした SD Video で、同じパン屋のシーンを 4 通りに生成しました。テキストから動画、480p、5 秒、16:9、seed 42 です。各プロンプトは 1 回ずつしか実行していないので、平均ではなく単発の観察として読んでください。
A. 普通のプロンプト。 パン職人がパンを置き、ゆっくりしたプッシュインの中でカメラに向かってセリフを言います。
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. 公式の構成。 最初のセクションで紹介したプロンプトです。結果は A に近く、同じ動作、正しく話されたセリフ、やや広めの画角でした。
C. カット時刻を指定した普通のプロンプト。 セリフは約 2.5 秒で終わり、3〜3.5 秒の間にパンのクローズアップへカットします。
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. 書き換えをオフにしたプロンプト A(prompt_enhancement: disabled)。カメラはより引いた位置でほとんど動かず、ドアベルが先に鳴り、セリフは約 3.5 秒で始まります。音声はずっと静かで、平均レベルはほかの 3 本より約 20 dB 低く測定されました。
ここから言えること:
| プロンプト | セリフは正しいか | 変わった点 |
|---|---|---|
| A. 普通 | はい | 基準 |
| B. 公式の構成 | はい | A とほぼ同じ |
| C. 普通、3 秒でカット | はい | 指定どおりの位置でカット |
| D. 普通、書き換えオフ | はい | 引きの固定ショット、セリフが遅い、音声がかなり静か |
サービスがプロンプトを書き換えてくれる場合は、わかりやすい普通のプロンプトで十分です。書き換えをオフにするとき、または H3-Context-IR なしでオープンウェイトを動かすときは、構成を自分で書きましょう。その場合、テキストをモデルが想定する形式に変換してくれるものがないからです。
MiniMax H3 のプロンプトを上達させるコツ
- タイムラインをクリップの長さに合わせる。5 秒のクリップに 10 秒分の動作を書かない。[3]
- 「cinematic」(映画的)や「beautiful」(美しい)のような言葉ではなく、具体的な映像と音のディテールを使う。[3]
- 音を描写する:室内の環境音、動作音、それらの距離感。BGM が不要なら
no musicと書く。[4] - セリフは短く、数秒に一文にする。通常のプロンプトでは引用符で囲み、構造化形式では
<d>タグに入れる。 - ショットを詰めるときは seed を固定し、一度に 1 か所だけ変える。[4]
- キーフレームを使うときは、最初または最後のフレームが動作とどうつながるかを書く。[3]
SD Video のページにはプロンプトを試せる Playground があり、API リファレンスには prompt_enhancement を含むすべてのパラメータが載っています。
プロンプトに関するよくある質問
MiniMax H3 のプロンプトは英語で書くべきですか?
公式ガイドは描写のセクションを英語で書き、セリフ、歌詞、画面上の文字は元の言語のままにしています。[3] ほかの言語のセリフは、言語タグを付けて <d> タグの中に入れます。
H3-Context-IR とは何ですか?
送ったテキストとメディアを読み取り、H3 が生成に使う構造化表現に書き換える MiniMax の前処理ステップです。オープンソース版には含まれていません。MiniMax はこれを API として提供し、開発者が独自に作れるようにプロンプトのガイドを公開しています。[1][5]
SD Video の prompt_enhancement は何をしますか?
生成前のプロンプトの書き換えを制御します。turbo(デフォルト)、quality、または書いたとおりに送る disabled です。書き換えで <Picture 1> のような参照ラベルが変わることはありません。[4]
MiniMax H3 のプロンプトはどれくらいの長さにすべきですか?
タイムライン全体をカバーできる長さです。MiniMax 自身の書き換え例は 1 本のクリップで数百語に及び、SD Video のガイドも細かく書いても不利にならないとしています。[1][4]
参考文献
- MiniMax. MiniMax-H3 モデルカード. 2026 年 10 月 4 日に huggingface.co から取得。
- MiniMax. h3-prompt-writing: base mode reference(references/base-en.txt). 2026 年 10 月 4 日に github.com から取得。
- MiniMax. H3 Prompt Writing スキル. 2026 年 10 月 4 日に github.com から取得。
- SeedRouter. SD Video API reference. 2026 年 10 月 4 日に seedrouter.ai から取得。
- MiniMax. Create H3-Context-IR Task. 2026 年 10 月 4 日に platform.minimax.io から取得。



