Guida ai prompt di MiniMax H3: la struttura ufficiale, testata su clip reali
Come scrivere prompt per MiniMax H3: struttura ufficiale in tre parti, tag di dialogo, tempi delle inquadrature e riferimenti, testati su quattro clip.
Leggi in MarkdownMiniMax H3 è progettato per leggere i prompt in una forma strutturata in tre parti: immagine e dialoghi lungo una timeline, il paesaggio sonoro complessivo ed eventuale musica di sottofondo. MiniMax chiama H3-Context-IR il passaggio che trasforma una richiesta semplice in questa forma, e lo definisce "critical to the quality of the final output" (decisivo per la qualità del risultato).[1] SD Video, basato su MiniMax H3, riscrive il tuo prompt per impostazione predefinita prima della generazione. Nelle nostre quattro clip di prova, un prompt semplice e un prompt scritto con la struttura ufficiale hanno dato risultati ugualmente utilizzabili, mentre disattivare la riscrittura ha cambiato l'inquadratura e il mix audio.
Questa guida spiega la struttura ufficiale, come scrivere dialoghi, stacchi e riferimenti, e cosa hanno mostrato i test.
Com'è fatto un prompt di MiniMax H3?
Per le modalità testo, immagine e keyframe, la guida ufficiale usa tre campi in ordine fisso:[2]
- integrated_multimodal_description: il corpo principale. Stile visivo, composizione, soggetti, azioni, camera, cambi di inquadratura, chi parla e cosa dice, e i suoni legati alle azioni in scena, in ordine cronologico.
- overall_soundscape: ambiente, suoni delle azioni e suoni umani non verbali per tutta la clip.
- non_diegetic_music: musica di sottofondo che sente solo il pubblico, oppure
N/Ase non c'è.
Un breve esempio in questa struttura, dai nostri test:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/ALe indicazioni ufficiali chiedono queste sezioni in inglese, mentre dialoghi, testi delle canzoni e scritte visibili restano nella lingua originale.[3]
Come si scrivono i dialoghi in un prompt di MiniMax H3?
Dai a ogni personaggio che parla un ID stabile come (S1) o (S2), descrivi la voce fuori dal tag e metti dentro <d>…</d> solo un tag di lingua e le parole pronunciate:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>Le parole dentro il tag vengono mantenute alla lettera, quindi scrivile esattamente come vanno pronunciate. Un personaggio mantiene lo stesso ID in tutte le inquadrature, e chi non parla mai non riceve un ID. Per un narratore, la guida usa la formula "says in an off-screen voiceover" (dice con voce fuori campo) e poi specifica che le labbra del personaggio in scena restano chiuse.[2]
Come si danno i tempi a inquadrature e stacchi?
Segna ogni inquadratura come [Shot 1], [Shot 2] e indica il momento dello stacco: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". La timeline deve coprire esattamente la durata della clip, da 4 a 15 secondi.[2][3] Nel nostro test funziona anche una frase semplice: "At 3 seconds, cut to a close-up of steam rising from the bread" ha prodotto uno stacco intorno ai 3 secondi (clip C qui sotto).
Il dialogo ha bisogno di spazio nella sua inquadratura. Le indicazioni di SD Video parlano di circa 2,5 parole di dialogo al secondo, quindi in una clip da 5 secondi sta una frase breve.[4]
Come si richiamano immagini, video e audio di riferimento?
I riferimenti si indicano con etichette, numerate per tipo nell'ordine in cui li invii: <Picture 1>, <Video 1>, <Audio 1>. La guida ufficiale chiede di mantenere ogni etichetta identica in tutte le sezioni del prompt.[3] Per la modalità a riferimenti completa, la riscrittura ufficiale usa sei sezioni invece di tre: definizione dei soggetti, un riepilogo, un'analisi di cosa conservare da ogni riferimento, la descrizione dettagliata, il paesaggio sonoro e la musica.[3]
Spesso basta un prompt semplice con un'etichetta. Questa clip ha usato un video di riferimento di 3 secondi di una persona che suona il violoncello e il prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (chi suona il violoncello in <Video 1> prosegue con una lunga arcata):
Da riferimenti a video su SD Video, 480p, 5 secondi, un video di riferimento.
Come appaiono più video di riferimento?
Un video di riferimento e un prompt breve. Il riferimento è una clip di 6 secondi con dei pattinatori, e il prompt è "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (i pattinatori di <Video 1> scivolano su una pista all'aperto al tramonto):
Un video di riferimento, 480p, 5 secondi.
Lo stesso prompt e lo stesso riferimento con duration impostato a 10:
Un video di riferimento, 480p, 10 secondi.
Due video di riferimento vengono numerati nell'ordine di invio. Qui <Video 1> è la clip dei pattinatori e <Video 2> una clip di danza di 8,6 secondi, con il prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (i pattinatori di <Video 1> guardano chi balla in <Video 2> esibirsi sul ghiaccio al tramonto):
Due video di riferimento, 480p, 5 secondi.
Qui <Video 1> è la clip di violoncello di 3 secondi e <Video 2> la clip di danza, con il prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (chi suona il violoncello in <Video 1> suona mentre chi balla in <Video 2> si muove lentamente accanto):
Due video di riferimento, 480p, 5 secondi.
Con aspect_ratio lasciato su adaptive, la clip prende il formato del primo video di riferimento. La clip di danza è verticale, quindi queste due riprese sono uscite in verticale, a 480 × 832. Entrambe hanno usato lo stesso prompt e lo stesso riferimento senza un seed fisso, quindi ogni esecuzione ha scelto il proprio seed e le riprese sono diverse. Il prompt era "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (chi balla in <Video 1> ripete gli stessi movimenti in uno studio vuoto):
La stessa richiesta eseguita due volte, 480p, 5 secondi, verticale.
Il formato strutturato batte un prompt semplice?
Abbiamo generato la stessa scena del panificio in quattro modi su SD Video, basato su MiniMax H3: da testo a video, 480p, 5 secondi, 16:9, seed 42. Ogni prompt è stato eseguito una sola volta, quindi leggi i risultati come singole osservazioni, non come medie.
A. Prompt semplice. Il fornaio appoggia la pagnotta e dice la battuta in camera durante una lenta carrellata in avanti.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Struttura ufficiale. Il prompt mostrato nella prima sezione qui sopra. Il risultato è vicino ad A: stessa azione, battuta pronunciata correttamente, inquadratura un po' più larga.
C. Prompt semplice con stacco a tempo. La battuta finisce intorno ai 2,5 secondi e l'inquadratura stacca sul primo piano del pane tra i 3 e i 3,5 secondi.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Prompt A con la riscrittura disattivata (prompt_enhancement: disabled). La camera è più lontana e si muove appena, il campanello della porta arriva per primo e la battuta inizia intorno ai 3,5 secondi. La colonna sonora è molto più bassa: il suo livello medio misurato era circa 20 dB sotto quello delle altre tre clip.
Cosa suggerisce:
| Prompt | Battuta corretta | Cosa è cambiato |
|---|---|---|
| A. Semplice | Sì | Riferimento |
| B. Struttura ufficiale | Sì | Molto vicino ad A |
| C. Semplice, stacco a 3 s | Sì | Stacco dove richiesto |
| D. Semplice, riscrittura disattivata | Sì | Inquadratura fissa più larga, battuta più tardi, audio molto più basso |
Quando il servizio riscrive il tuo prompt, basta un prompt semplice e chiaro. Scrivi tu la struttura quando disattivi la riscrittura o quando esegui i pesi aperti senza H3-Context-IR, perché in quel caso niente converte il tuo testo nella forma che il modello si aspetta.
Consigli per prompt di MiniMax H3 migliori
- Adatta la timeline alla durata della clip; non descrivere 10 secondi di azione per una clip da 5 secondi.[3]
- Usa dettagli visivi e sonori concreti invece di parole come "cinematic" o "beautiful".[3]
- Descrivi l'audio: suono d'ambiente, suoni delle azioni e a che distanza sono. Scrivi
no musicse non vuoi un sottofondo musicale.[4] - Tieni i dialoghi brevi, una frase ogni pochi secondi: tra virgolette in un prompt semplice, dentro i tag
<d>nella forma strutturata. - Fissa il seed e cambia una cosa alla volta quando lavori su un'inquadratura.[4]
- Con i keyframe, indica come il primo o l'ultimo fotogramma si collega all'azione.[3]
La pagina di SD Video ha un playground per provare i prompt, e la reference dell'API elenca tutti i parametri, compreso prompt_enhancement.
Domande sui prompt
I prompt di MiniMax H3 vanno scritti in inglese?
Le indicazioni ufficiali scrivono le sezioni descrittive in inglese e lasciano dialoghi, testi delle canzoni e scritte in scena nella lingua originale.[3] Un dialogo in un'altra lingua va dentro il tag <d> con il suo tag di lingua.
Cos'è H3-Context-IR?
È il passaggio di pre-elaborazione di MiniMax che legge il testo e i media che invii e li riscrive nella rappresentazione strutturata da cui H3 genera. Non fa parte della release open source; MiniMax lo offre come API e pubblica le indicazioni per i prompt, così gli sviluppatori possono costruirne uno proprio.[1][5]
Cosa fa prompt_enhancement su SD Video?
Controlla la riscrittura del tuo prompt prima della generazione: turbo (predefinito), quality, oppure disabled per inviare il testo così com'è. La riscrittura non modifica le etichette di riferimento come <Picture 1>.[4]
Quanto deve essere lungo un prompt di MiniMax H3?
Abbastanza da coprire tutta la timeline. Gli esempi riscritti dalla stessa MiniMax arrivano a diverse centinaia di parole per una singola clip, e le indicazioni di SD Video precisano che i dettagli non penalizzano.[1][4]
Riferimenti
- MiniMax. Scheda del modello MiniMax-H3. Consultato il 4 ottobre 2026 su huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Consultato il 4 ottobre 2026 su github.com.
- MiniMax. Skill H3 Prompt Writing. Consultato il 4 ottobre 2026 su github.com.
- SeedRouter. SD Video API reference. Consultato il 4 ottobre 2026 su seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Consultato il 4 ottobre 2026 su platform.minimax.io.



