MiniMax H3 Prompt-Guide: die offizielle Struktur, an echten Clips getestet
So schreibst du MiniMax H3 Prompts: die offizielle dreiteilige Struktur, Dialog-Tags, Shot-Timing und Referenz-Labels, getestet an vier Clips.
Als Markdown lesenMiniMax H3 ist darauf ausgelegt, Prompts in einer strukturierten Form mit drei Teilen zu lesen: Bild und Dialog entlang einer Zeitachse, die gesamte Klangkulisse und eventuelle Hintergrundmusik. MiniMax nennt den Schritt, der eine einfache Anfrage in diese Form bringt, H3-Context-IR, und bezeichnet ihn als "critical to the quality of the final output" (entscheidend für die Qualität des Ergebnisses).[1] SD Video, das auf MiniMax H3 basiert, schreibt deinen Prompt vor der Generierung standardmäßig um. In unseren vier Test-Clips lieferten ein einfacher Prompt und ein Prompt in der offiziellen Struktur gleich brauchbare Ergebnisse, während das Abschalten der Umschreibung die Einstellung und den Ton-Mix veränderte.
Dieser Guide behandelt die offizielle Struktur, wie du Dialog, Schnitte und Referenzen schreibst, und was die Tests gezeigt haben.
Wie sieht ein MiniMax H3 Prompt aus?
Für die Modi Text, Bild und Keyframe verwendet der offizielle Guide drei Felder in fester Reihenfolge:[2]
- integrated_multimodal_description: der Hauptteil. Bildstil, Komposition, Figuren, Handlungen, Kamera, Einstellungswechsel, wer spricht und was gesagt wird sowie die Geräusche zu den Aktionen im Bild, in zeitlicher Reihenfolge.
- overall_soundscape: Atmo, Aktionsgeräusche und nonverbale menschliche Laute über den ganzen Clip.
- non_diegetic_music: Hintergrundmusik, die nur das Publikum hört, oder
N/Afür keine.
Ein kurzes Beispiel in dieser Struktur aus unseren Tests:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/ADie offiziellen Vorgaben verlangen diese Abschnitte auf Englisch, während Dialog, Liedtexte und sichtbarer Text in ihrer Originalsprache bleiben.[3]
Wie schreibst du Dialog in einem MiniMax H3 Prompt?
Gib jeder sprechenden Figur eine feste ID wie (S1) oder (S2), beschreib die Stimme außerhalb des Tags und setz nur ein Sprach-Tag und die gesprochenen Worte in <d>…</d>:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>Die Worte im Tag werden wörtlich übernommen, schreib sie also genau so, wie sie gesprochen werden sollen. Eine Figur behält ihre ID über alle Einstellungen, und Figuren, die nie sprechen, bekommen keine ID. Für eine Erzählstimme nutzt der Guide die Formulierung "says in an off-screen voiceover" (spricht als Off-Stimme) und hält dann fest, dass die Lippen der Figur im Bild geschlossen bleiben.[2]
Wie timest du Einstellungen und Schnitte?
Markiere jede Einstellung als [Shot 1], [Shot 2] und gib den Schnittzeitpunkt an: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". Die Zeitachse muss genau die Clip-Länge ergeben, also 4 bis 15 Sekunden.[2][3] In unserem Test funktioniert auch ein einfacher Satz: "At 3 seconds, cut to a close-up of steam rising from the bread" ergab einen Schnitt bei etwa 3 Sekunden (Clip C unten).
Dialog braucht Platz in seiner Einstellung. Die Vorgabe von SD Video liegt bei etwa 2,5 Wörtern Dialog pro Sekunde, ein 5-Sekunden-Clip fasst also einen kurzen Satz.[4]
Wie referenzierst du Bilder, Videos und Audio?
Referenzen werden über Labels angesprochen, pro Typ in der Reihenfolge nummeriert, in der du sie sendest: <Picture 1>, <Video 1>, <Audio 1>. Laut offiziellem Guide soll jedes Label in allen Abschnitten des Prompts gleich bleiben.[3] Für den vollen Referenzmodus nutzt die offizielle Umschreibung sechs statt drei Abschnitte: Subjektdefinitionen, eine Zusammenfassung, eine Retention-Analyse (was von jeder Referenz erhalten bleiben soll), die ausführliche Beschreibung, die Klangkulisse und die Musik.[3]
Ein einfacher Prompt mit einem Label reicht oft aus. Dieser Clip nutzte ein 3 Sekunden langes Referenzvideo eines Cellisten bzw. einer Cellistin und den Prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (die Person am Cello aus <Video 1> spielt einen langen Bogenstrich weiter):
Referenz-zu-Video auf SD Video, 480p, 5 Sekunden, ein Referenzvideo.
Wie sehen mehrere Referenzvideos aus?
Ein Referenzvideo und ein kurzer Prompt. Die Referenz ist ein 6 Sekunden langer Clip mit Eisläufern, der Prompt lautet "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (die Eisläufer aus <Video 1> gleiten in der Dämmerung über eine Freiluftbahn):
Ein Referenzvideo, 480p, 5 Sekunden.
Derselbe Prompt und dieselbe Referenz mit duration auf 10:
Ein Referenzvideo, 480p, 10 Sekunden.
Zwei Referenzvideos werden in der Reihenfolge gekennzeichnet, in der sie gesendet werden. Hier ist <Video 1> der Clip mit den Eisläufern und <Video 2> ein 8,6 Sekunden langer Tanzclip, mit dem Prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (die Eisläufer aus <Video 1> sehen in der Dämmerung der tanzenden Person aus <Video 2> auf dem Eis zu):
Zwei Referenzvideos, 480p, 5 Sekunden.
Hier ist <Video 1> der 3 Sekunden lange Cello-Clip und <Video 2> der Tanzclip, mit dem Prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (die Person am Cello aus <Video 1> spielt, während die tanzende Person aus <Video 2> sich langsam daneben bewegt):
Zwei Referenzvideos, 480p, 5 Sekunden.
Bleibt aspect_ratio auf adaptive, übernimmt der Clip das Format des ersten Referenzvideos. Der Tanzclip ist vertikal, deshalb kamen diese beiden Takes vertikal in 480 × 832 heraus. Beide nutzten denselben Prompt und dieselbe Referenz ohne festen seed, also wählte jeder Durchlauf seinen eigenen Seed, und die Takes unterscheiden sich. Der Prompt lautete "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (die tanzende Person aus <Video 1> wiederholt dieselben Bewegungen in einem leeren Studio):
Dieselbe Anfrage zweimal ausgeführt, 480p, 5 Sekunden, vertikal.
Schlägt das strukturierte Format einen einfachen Prompt?
Wir haben dieselbe Bäckerei-Szene auf vier Arten mit SD Video generiert, das auf MiniMax H3 basiert: Text-zu-Video, 480p, 5 Sekunden, 16:9, seed 42. Jeder Prompt lief einmal, lies die Ergebnisse also als Einzelbeobachtungen, nicht als Durchschnittswerte.
A. Einfacher Prompt. Der Bäcker legt das Brot ab und spricht den Satz während einer langsamen Kamerafahrt nach vorn in die Kamera.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Offizielle Struktur. Der Prompt aus dem ersten Abschnitt oben. Das Ergebnis liegt nah an A: dieselbe Handlung, der Satz korrekt gesprochen, ein etwas weiterer Bildausschnitt.
C. Einfacher Prompt mit getimtem Schnitt. Der Satz endet bei etwa 2,5 Sekunden, und zwischen 3 und 3,5 Sekunden wird auf die Nahaufnahme des Brots geschnitten.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Prompt A mit abgeschalteter Umschreibung (prompt_enhancement: disabled). Die Kamera steht weiter weg und bewegt sich kaum, die Türglocke kommt zuerst, und der Satz beginnt bei etwa 3,5 Sekunden. Die Tonspur ist deutlich leiser: Ihr Durchschnittspegel lag gemessen etwa 20 dB unter den anderen drei Clips.
Was das nahelegt:
| Prompt | Satz korrekt gesprochen | Was sich änderte |
|---|---|---|
| A. Einfach | Ja | Ausgangspunkt |
| B. Offizielle Struktur | Ja | Sehr nah an A |
| C. Einfach, Schnitt bei 3 s | Ja | Schnitt kam wie gewünscht |
| D. Einfach, Umschreibung aus | Ja | Weitere statische Einstellung, Satz später, viel leiserer Ton |
Wenn der Dienst deinen Prompt umschreibt, reicht ein klarer einfacher Prompt. Schreib die Struktur selbst, wenn du die Umschreibung abschaltest oder die offenen Gewichte ohne H3-Context-IR betreibst, denn dann wandelt nichts deinen Text in die Form um, die das Modell erwartet.
Tipps für bessere MiniMax H3 Prompts
- Passe die Zeitachse an die Clip-Länge an; beschreib keine 10 Sekunden Handlung für einen 5-Sekunden-Clip.[3]
- Nutze konkrete Bild- und Tondetails statt Wörtern wie "cinematic" oder "beautiful".[3]
- Beschreib den Ton: Raumklang, Aktionsgeräusche und wie weit sie entfernt sind. Schreib
no music, wenn du keine Musik darunter willst.[4] - Halte Dialog kurz, ein Satz pro paar Sekunden: in Anführungszeichen im einfachen Prompt, in
<d>-Tags in der strukturierten Form. - Fixiere den Seed und ändere immer nur eine Sache, wenn du an einer Einstellung feilst.[4]
- Sag bei Keyframes, wie das erste oder letzte Bild mit der Handlung zusammenhängt.[3]
Auf der SD Video Seite gibt es einen Playground zum Ausprobieren von Prompts, und die API-Referenz listet jeden Parameter auf, auch prompt_enhancement.
Fragen zum Prompting
Sollten MiniMax H3 Prompts auf Englisch sein?
Die offiziellen Vorgaben schreiben die beschreibenden Abschnitte auf Englisch und lassen Dialog, Liedtexte und Text im Bild in ihrer Originalsprache.[3] Dialog in einer anderen Sprache kommt mit seinem Sprach-Tag in das <d>-Tag.
Was ist H3-Context-IR?
Das ist der Vorverarbeitungsschritt von MiniMax, der deinen Text und deine Medien liest und sie in die strukturierte Darstellung umschreibt, aus der H3 generiert. Er ist nicht Teil der Open-Source-Veröffentlichung; MiniMax bietet ihn als API an und veröffentlicht die Prompt-Vorgaben, damit Entwickler eigene Lösungen bauen können.[1][5]
Was macht prompt_enhancement bei SD Video?
Es steuert die Umschreibung deines Prompts vor der Generierung: turbo (Standard), quality oder disabled, um deinen Text unverändert zu senden. Referenz-Labels wie <Picture 1> ändert die Umschreibung nicht.[4]
Wie lang sollte ein MiniMax H3 Prompt sein?
Lang genug, um die ganze Zeitachse abzudecken. Die von MiniMax selbst umgeschriebenen Beispiele umfassen für einen einzigen Clip mehrere hundert Wörter, und laut den Vorgaben von SD Video werden Details nicht bestraft.[1][4]
Quellen
- MiniMax. Modellkarte MiniMax-H3. Abgerufen am 4. Oktober 2026 von huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Abgerufen am 4. Oktober 2026 von github.com.
- MiniMax. Skill H3 Prompt Writing. Abgerufen am 4. Oktober 2026 von github.com.
- SeedRouter. SD Video API reference. Abgerufen am 4. Oktober 2026 von seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Abgerufen am 4. Oktober 2026 von platform.minimax.io.



