Guide des prompts MiniMax H3 : la structure officielle, testée sur de vrais clips
Écrire un prompt MiniMax H3 : structure officielle en trois parties, balises de dialogue, timing des plans et labels de référence, testés sur quatre clips.
Lire en MarkdownMiniMax H3 est conçu pour lire des prompts sous une forme structurée en trois parties : l’image et les dialogues le long d’une timeline, l’ambiance sonore globale et une éventuelle musique de fond. MiniMax appelle H3-Context-IR l’étape qui convertit une demande simple dans cette forme, et la décrit comme "critical to the quality of the final output" (décisive pour la qualité du résultat).[1] SD Video, basé sur MiniMax H3, réécrit votre prompt par défaut avant la génération. Sur nos quatre clips de test, un prompt simple et un prompt rédigé selon la structure officielle ont donné des résultats tout aussi exploitables, alors que la désactivation de la réécriture a changé le plan et le mixage sonore.
Ce guide présente la structure officielle, la façon d’écrire dialogues, coupes et références, et ce que les tests ont montré.
À quoi ressemble un prompt MiniMax H3 ?
Pour les modes texte, image et keyframe, le guide officiel utilise trois champs dans un ordre fixe :[2]
- integrated_multimodal_description : le corps principal. Style visuel, composition, sujets, actions, caméra, changements de plan, qui parle et ce qui est dit, ainsi que les sons liés aux actions à l’écran, dans l’ordre chronologique.
- overall_soundscape : l’ambiance, les bruits d’action et les sons humains non verbaux sur l’ensemble du clip.
- non_diegetic_music : la musique de fond que seul le public entend, ou
N/As’il n’y en a pas.
Un court exemple dans cette structure, issu de nos tests :
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/ALes consignes officielles demandent ces sections en anglais, tandis que les dialogues, les paroles et le texte visible restent dans leur langue d’origine.[3]
Comment écrire des dialogues dans un prompt MiniMax H3 ?
Donnez à chaque personnage qui parle un identifiant stable comme (S1) ou (S2), décrivez la voix en dehors de la balise et ne mettez dans <d>…</d> qu’une balise de langue et les mots prononcés :[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>Les mots placés dans la balise sont repris tels quels : écrivez-les exactement comme ils doivent être prononcés. Un personnage garde le même identifiant d’un plan à l’autre, et ceux qui ne parlent jamais n’en ont pas. Pour un narrateur, le guide utilise la formule "says in an off-screen voiceover" (dit en voix off), puis précise que les lèvres du personnage à l’écran restent fermées.[2]
Comment minuter les plans et les coupes ?
Marquez chaque plan avec [Shot 1], [Shot 2] et indiquez le moment de la coupe : "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". La timeline doit correspondre à la durée du clip, de 4 à 15 secondes.[2][3] Dans notre test, une phrase simple fonctionne aussi : "At 3 seconds, cut to a close-up of steam rising from the bread" a produit une coupe vers 3 secondes (clip C ci-dessous).
Un dialogue a besoin de place dans son plan. Les consignes de SD Video tablent sur environ 2,5 mots de dialogue par seconde : un clip de 5 secondes contient donc une phrase courte.[4]
Comment référencer des images, des vidéos et de l’audio ?
Les références sont désignées par des labels, numérotés par type dans l’ordre d’envoi : <Picture 1>, <Video 1>, <Audio 1>. Le guide officiel demande de garder chaque label identique dans toutes les sections du prompt.[3] Pour le mode références complet, la réécriture officielle utilise six sections au lieu de trois : définition des sujets, résumé, analyse de ce qu’il faut conserver de chaque référence, description détaillée, ambiance sonore et musique.[3]
Un prompt simple avec un seul label suffit souvent. Ce clip a utilisé une vidéo de référence de 3 secondes montrant une personne au violoncelle, avec le prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (la personne au violoncelle dans <Video 1> poursuit un long coup d’archet) :
Références vers vidéo sur SD Video, 480p, 5 secondes, une vidéo de référence.
À quoi ressemblent plusieurs vidéos de référence ?
Une vidéo de référence et un prompt court. La référence est un clip de 6 secondes montrant des patineurs, et le prompt est "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (les patineurs de <Video 1> glissent sur une patinoire en plein air au crépuscule) :
Une vidéo de référence, 480p, 5 secondes.
Le même prompt et la même référence avec duration réglé sur 10 :
Une vidéo de référence, 480p, 10 secondes.
Deux vidéos de référence sont numérotées dans l’ordre d’envoi. Ici, <Video 1> est le clip des patineurs et <Video 2> un clip de danse de 8,6 secondes, avec le prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (les patineurs de <Video 1> regardent la personne qui danse dans <Video 2> évoluer sur la glace au crépuscule) :
Deux vidéos de référence, 480p, 5 secondes.
Ici, <Video 1> est le clip de violoncelle de 3 secondes et <Video 2> le clip de danse, avec le prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (la personne au violoncelle dans <Video 1> joue pendant que la personne qui danse dans <Video 2> bouge lentement à côté) :
Deux vidéos de référence, 480p, 5 secondes.
Avec aspect_ratio laissé sur adaptive, le clip prend le format de la première vidéo de référence. Le clip de danse est vertical : ces deux prises sont donc sorties en vertical, en 480 × 832. Les deux ont utilisé le même prompt et la même référence sans seed fixe : chaque exécution a choisi son propre seed, et les prises diffèrent. Le prompt était "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (la personne qui danse dans <Video 1> répète les mêmes mouvements dans un studio vide) :
La même requête exécutée deux fois, 480p, 5 secondes, vertical.
Le format structuré fait-il mieux qu’un prompt simple ?
Nous avons généré la même scène de boulangerie de quatre façons sur SD Video, basé sur MiniMax H3 : texte vers vidéo, 480p, 5 secondes, 16:9, seed 42. Chaque prompt n’a tourné qu’une fois : lisez donc ces résultats comme des observations isolées, pas comme des moyennes.
A. Prompt simple. Le boulanger pose le pain et dit sa réplique face caméra pendant un lent travelling avant.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Structure officielle. Le prompt présenté dans la première section ci-dessus. Le résultat est proche de A : la même action, la réplique correctement prononcée, un cadre un peu plus large.
C. Prompt simple avec coupe minutée. La réplique se termine vers 2,5 secondes et le plan coupe sur le gros plan du pain entre 3 et 3,5 secondes.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Prompt A avec la réécriture désactivée (prompt_enhancement: disabled). La caméra est plus éloignée et bouge à peine, la sonnette arrive en premier et la réplique commence vers 3,5 secondes. La bande son est nettement plus faible : son niveau moyen mesuré était inférieur d’environ 20 dB à celui des trois autres clips.
Ce que cela suggère :
| Prompt | Réplique correcte | Ce qui a changé |
|---|---|---|
| A. Simple | Oui | Référence |
| B. Structure officielle | Oui | Très proche de A |
| C. Simple, coupe à 3 s | Oui | Coupe placée où demandé |
| D. Simple, réécriture désactivée | Oui | Plan fixe plus large, réplique plus tardive, son beaucoup plus faible |
Quand le service réécrit votre prompt, un prompt simple et clair suffit. Rédigez vous-même la structure si vous désactivez la réécriture, ou si vous exécutez les poids ouverts sans H3-Context-IR, car rien ne convertit alors votre texte dans la forme attendue par le modèle.
Conseils pour de meilleurs prompts MiniMax H3
- Adaptez la timeline à la durée du clip ; ne décrivez pas 10 secondes d’action pour un clip de 5 secondes.[3]
- Donnez des détails visuels et sonores concrets plutôt que des mots comme "cinematic" ou "beautiful".[3]
- Décrivez le son : ambiance de la pièce, bruits d’action et leur distance. Écrivez
no musicsi vous ne voulez pas de fond musical.[4] - Gardez les dialogues courts, une phrase toutes les quelques secondes : entre guillemets dans un prompt simple, dans des balises
<d>dans la forme structurée. - Fixez le seed et ne changez qu’une chose à la fois quand vous retravaillez un plan.[4]
- Avec des keyframes, indiquez comment la première ou la dernière image se relie à l’action.[3]
La page SD Video propose un Playground pour essayer vos prompts, et la référence de l’API liste tous les paramètres, dont prompt_enhancement.
Questions sur les prompts
Faut-il écrire les prompts MiniMax H3 en anglais ?
Les consignes officielles rédigent les sections descriptives en anglais et gardent les dialogues, les paroles et le texte à l’écran dans leur langue d’origine.[3] Un dialogue dans une autre langue se place dans la balise <d> avec sa balise de langue.
Qu’est-ce que H3-Context-IR ?
C’est l’étape de prétraitement de MiniMax qui lit le texte et les médias envoyés et les réécrit dans la représentation structurée à partir de laquelle H3 génère. Elle ne fait pas partie de la version open source ; MiniMax la propose sous forme d’API et publie ses consignes de prompt pour que les développeurs puissent créer la leur.[1][5]
À quoi sert prompt_enhancement sur SD Video ?
Il contrôle la réécriture de votre prompt avant la génération : turbo (par défaut), quality, ou disabled pour envoyer votre texte tel quel. La réécriture ne modifie pas les labels de référence comme <Picture 1>.[4]
Quelle longueur pour un prompt MiniMax H3 ?
Assez long pour couvrir toute la timeline. Les exemples réécrits par MiniMax elle-même atteignent plusieurs centaines de mots pour un seul clip, et les consignes de SD Video précisent que le détail n’est pas pénalisé.[1][4]
Références
- MiniMax. Fiche du modèle MiniMax-H3. Consulté le 4 octobre 2026 sur huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Consulté le 4 octobre 2026 sur github.com.
- MiniMax. Skill H3 Prompt Writing. Consulté le 4 octobre 2026 sur github.com.
- SeedRouter. SD Video API reference. Consulté le 4 octobre 2026 sur seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Consulté le 4 octobre 2026 sur platform.minimax.io.



