MiniMax H3 prompty: oficjalna struktura sprawdzona na prawdziwych klipach
Jak pisać prompty do MiniMax H3: oficjalna trzyczęściowa struktura, tagi dialogów, timing ujęć i etykiety referencji, sprawdzone na czterech klipach.
Czytaj jako MarkdownMiniMax H3 jest zaprojektowany do czytania promptów w ustrukturyzowanej formie z trzech części: obraz i dialogi na osi czasu, ogólne tło dźwiękowe i ewentualna muzyka w tle. Krok, który zamienia zwykłe polecenie w tę formę, MiniMax nazywa H3-Context-IR i określa jako „critical to the quality of the final output” (kluczowy dla jakości efektu).[1] SD Video, oparty na MiniMax H3, domyślnie przepisuje twój prompt przed generowaniem. W naszych czterech klipach testowych prosty prompt i prompt w oficjalnej strukturze dały równie użyteczne wyniki, a wyłączenie przepisywania zmieniło ujęcie i miks dźwięku.
Ten poradnik omawia oficjalną strukturę, sposób pisania dialogów, cięć i referencji oraz to, co pokazały testy.
Jak wygląda prompt do MiniMax H3?
W trybach tekstu, obrazu i klatek kluczowych oficjalny poradnik używa trzech pól w stałej kolejności:[2]
- integrated_multimodal_description: główna część. Styl wizualny, kompozycja, postacie, akcje, kamera, zmiany ujęć, kto mówi i co, oraz dźwięki związane z akcjami w kadrze, w kolejności czasowej.
- overall_soundscape: tło, dźwięki akcji i niewerbalne ludzkie odgłosy przez cały klip.
- non_diegetic_music: muzyka w tle, którą słyszy tylko widz, albo
N/A, jeśli jej nie ma.
Krótki przykład w tej strukturze z naszych testów:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/AOficjalne wytyczne każą pisać te sekcje po angielsku, a dialogi, teksty piosenek i widoczny tekst zostawiać w oryginalnym języku.[3]
Jak pisać dialogi w prompcie do MiniMax H3?
Nadaj każdej mówiącej postaci stały identyfikator, np. (S1) lub (S2), opisz głos poza tagiem, a w <d>…</d> umieść tylko tag języka i wypowiadane słowa:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>Słowa w tagu są zachowywane dosłownie, więc pisz je dokładnie tak, jak mają zabrzmieć. Postać zachowuje ten sam identyfikator we wszystkich ujęciach, a postacie, które nic nie mówią, nie dostają go wcale. Dla narratora poradnik używa sformułowania „says in an off-screen voiceover” (mówi głosem z offu), a potem zaznacza, że usta postaci w kadrze pozostają zamknięte.[2]
Jak ustawić czas ujęć i cięć?
Oznacz każde ujęcie jako [Shot 1], [Shot 2] i podaj moment cięcia: „[Shot 2] At 00:05.000, the camera cuts to a close-up of…”. Oś czasu musi sumować się do długości klipu, czyli od 4 do 15 sekund.[2][3] W naszym teście działa też zwykłe zdanie: „At 3 seconds, cut to a close-up of steam rising from the bread” dało cięcie mniej więcej w 3. sekundzie (klip C poniżej).
Dialog potrzebuje miejsca w swoim ujęciu. Wytyczne samego SD Video mówią o około 2,5 słowa dialogu na sekundę, więc w 5-sekundowym klipie mieści się jedno krótkie zdanie.[4]
Jak odwoływać się do obrazów, wideo i audio?
Do referencji odwołujesz się etykietami, numerowanymi osobno dla każdego typu w kolejności wysyłania: <Picture 1>, <Video 1>, <Audio 1>. Oficjalny poradnik prosi, by każda etykieta była taka sama we wszystkich sekcjach promptu.[3] W pełnym trybie referencji oficjalne przepisanie używa sześciu sekcji zamiast trzech: definicji postaci, podsumowania, analizy tego, co zachować z każdej referencji, szczegółowego opisu, tła dźwiękowego i muzyki.[3]
Często wystarcza prosty prompt z jedną etykietą. Ten klip wykorzystał 3-sekundowe wideo referencyjne z osobą grającą na wiolonczeli i prompt „The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.” (osoba grająca na wiolonczeli z <Video 1> ciągnie jedno długie pociągnięcie smyczkiem):
Referencje na wideo w SD Video, 480p, 5 sekund, jedno wideo referencyjne.
Jak wyglądają wyniki z kilkoma wideo referencyjnymi?
Jedno wideo referencyjne i krótki prompt. Referencja to 6-sekundowy klip z łyżwiarzami, a prompt brzmi „The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.” (łyżwiarze z <Video 1> suną o zmierzchu po odkrytym lodowisku):
Jedno wideo referencyjne, 480p, 5 sekund.
Ten sam prompt i ta sama referencja z duration ustawionym na 10:
Jedno wideo referencyjne, 480p, 10 sekund.
Dwa wideo referencyjne są numerowane w kolejności wysłania. Tutaj <Video 1> to klip z łyżwiarzami, a <Video 2> to 8,6-sekundowy klip taneczny, z promptem „The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.” (łyżwiarze z <Video 1> patrzą o zmierzchu, jak osoba tańcząca z <Video 2> występuje na lodzie):
Dwa wideo referencyjne, 480p, 5 sekund.
Tutaj <Video 1> to 3-sekundowy klip z wiolonczelą, a <Video 2> to klip taneczny, z promptem „The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.” (osoba grająca na wiolonczeli z <Video 1> gra, a osoba tańcząca z <Video 2> porusza się powoli obok):
Dwa wideo referencyjne, 480p, 5 sekund.
Gdy aspect_ratio zostaje na adaptive, klip przyjmuje format pierwszego wideo referencyjnego. Klip taneczny jest pionowy, więc te dwa ujęcia wyszły pionowe, w 480 × 832. Oba użyły tego samego promptu i tej samej referencji bez stałego seed, więc każde uruchomienie wybrało własny seed i ujęcia się różnią. Prompt brzmiał „The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.” (osoba tańcząca z <Video 1> powtarza te same ruchy w pustym studiu):
To samo żądanie uruchomione dwa razy, 480p, 5 sekund, pionowo.
Czy ustrukturyzowany format wygrywa z prostym promptem?
Wygenerowaliśmy tę samą scenę w piekarni na cztery sposoby w SD Video, opartym na MiniMax H3: tekst na wideo, 480p, 5 sekund, 16:9, seed 42. Każdy prompt uruchomiliśmy raz, więc traktuj wyniki jako pojedyncze obserwacje, a nie średnie.
A. Prosty prompt. Piekarz odkłada bochenek i wypowiada kwestię do kamery podczas powolnego najazdu.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Oficjalna struktura. Prompt pokazany w pierwszej sekcji powyżej. Wynik jest zbliżony do A: ta sama akcja, kwestia wypowiedziana poprawnie, nieco szerszy kadr.
C. Prosty prompt z cięciem w czasie. Kwestia kończy się w okolicach 2,5 s, a cięcie na zbliżenie chleba pada między 3. a 3,5 s.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Prompt A z wyłączonym przepisywaniem (prompt_enhancement: disabled). Kamera stoi dalej i prawie się nie rusza, najpierw słychać dzwonek przy drzwiach, a kwestia zaczyna się w okolicach 3,5 s. Ścieżka dźwiękowa jest dużo cichsza: jej średni poziom w pomiarze wyszedł około 20 dB niżej niż w pozostałych trzech klipach.
Co z tego wynika:
| Prompt | Kwestia poprawna | Co się zmieniło |
|---|---|---|
| A. Prosty | Tak | Punkt odniesienia |
| B. Oficjalna struktura | Tak | Bardzo blisko A |
| C. Prosty, cięcie w 3 s | Tak | Cięcie tam, gdzie trzeba |
| D. Prosty, bez przepisywania | Tak | Szersze statyczne ujęcie, kwestia później, dużo cichszy dźwięk |
Gdy usługa przepisuje twój prompt, wystarczy jasny prosty prompt. Strukturę pisz sam, gdy wyłączasz przepisywanie albo uruchamiasz otwarte wagi bez H3-Context-IR, bo wtedy nic nie zamienia twojego tekstu na formę, której oczekuje model.
Wskazówki do lepszych promptów MiniMax H3
- Dopasuj oś czasu do długości klipu; nie opisuj 10 sekund akcji dla 5-sekundowego klipu.[3]
- Używaj konkretnych szczegółów obrazu i dźwięku zamiast słów takich jak „cinematic” czy „beautiful”.[3]
- Opisz dźwięk: tło pomieszczenia, dźwięki akcji i ich odległość. Napisz
no music, jeśli nie chcesz muzyki w tle.[4] - Pisz krótkie dialogi, jedno zdanie na kilka sekund: w cudzysłowie w prostym prompcie, w tagach
<d>w formie ustrukturyzowanej. - Ustal seed i zmieniaj jedną rzecz naraz, gdy dopracowujesz ujęcie.[4]
- Przy klatkach kluczowych napisz, jak pierwsza lub ostatnia klatka łączy się z akcją.[3]
Na stronie SD Video jest playground do testowania promptów, a dokumentacja API wymienia wszystkie parametry, w tym prompt_enhancement.
Pytania o prompty
Czy prompty do MiniMax H3 muszą być po angielsku?
Oficjalne wytyczne piszą sekcje opisowe po angielsku, a dialogi, teksty piosenek i tekst w kadrze zostawiają w oryginalnym języku.[3] Dialog w innym języku trafia do tagu <d> razem z tagiem języka.
Czym jest H3-Context-IR?
To etap wstępnego przetwarzania MiniMax, który czyta wysłany tekst i media i przepisuje je na ustrukturyzowaną reprezentację, z której generuje H3. Nie wchodzi w skład wydania open source; MiniMax udostępnia go jako API i publikuje wytyczne do promptów, żeby deweloperzy mogli zbudować własny.[1][5]
Co robi prompt_enhancement w SD Video?
Steruje przepisywaniem twojego promptu przed generowaniem: turbo (domyślnie), quality albo disabled, by wysłać tekst bez zmian. Przepisywanie nie zmienia etykiet referencji takich jak <Picture 1>.[4]
Jak długi powinien być prompt do MiniMax H3?
Na tyle długi, by pokryć całą oś czasu. Przykłady przepisane przez samo MiniMax mają po kilkaset słów na jeden klip, a wytyczne SD Video zaznaczają, że szczegóły nie są karane.[1][4]
Źródła
- MiniMax. Karta modelu MiniMax-H3. Dostęp 4 października 2026 r., huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Dostęp 4 października 2026 r., github.com.
- MiniMax. Skill H3 Prompt Writing. Dostęp 4 października 2026 r., github.com.
- SeedRouter. SD Video API reference. Dostęp 4 października 2026 r., seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Dostęp 4 października 2026 r., platform.minimax.io.



