Claude Opus 5.5 jest już dostępny w SeedRouter

MiniMax H3 prompty: oficjalna struktura sprawdzona na prawdziwych klipach

Jak pisać prompty do MiniMax H3: oficjalna trzyczęściowa struktura, tagi dialogów, timing ujęć i etykiety referencji, sprawdzone na czterech klipach.

Czytaj jako Markdown

MiniMax H3 jest zaprojektowany do czytania promptów w ustrukturyzowanej formie z trzech części: obraz i dialogi na osi czasu, ogólne tło dźwiękowe i ewentualna muzyka w tle. Krok, który zamienia zwykłe polecenie w tę formę, MiniMax nazywa H3-Context-IR i określa jako „critical to the quality of the final output” (kluczowy dla jakości efektu).[1] SD Video, oparty na MiniMax H3, domyślnie przepisuje twój prompt przed generowaniem. W naszych czterech klipach testowych prosty prompt i prompt w oficjalnej strukturze dały równie użyteczne wyniki, a wyłączenie przepisywania zmieniło ujęcie i miks dźwięku.

Ten poradnik omawia oficjalną strukturę, sposób pisania dialogów, cięć i referencji oraz to, co pokazały testy.

Jak wygląda prompt do MiniMax H3?

W trybach tekstu, obrazu i klatek kluczowych oficjalny poradnik używa trzech pól w stałej kolejności:[2]

  • integrated_multimodal_description: główna część. Styl wizualny, kompozycja, postacie, akcje, kamera, zmiany ujęć, kto mówi i co, oraz dźwięki związane z akcjami w kadrze, w kolejności czasowej.
  • overall_soundscape: tło, dźwięki akcji i niewerbalne ludzkie odgłosy przez cały klip.
  • non_diegetic_music: muzyka w tle, którą słyszy tylko widz, albo N/A, jeśli jej nie ma.

Krótki przykład w tej strukturze z naszych testów:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

Oficjalne wytyczne każą pisać te sekcje po angielsku, a dialogi, teksty piosenek i widoczny tekst zostawiać w oryginalnym języku.[3]

Jak pisać dialogi w prompcie do MiniMax H3?

Nadaj każdej mówiącej postaci stały identyfikator, np. (S1) lub (S2), opisz głos poza tagiem, a w <d>…</d> umieść tylko tag języka i wypowiadane słowa:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

Słowa w tagu są zachowywane dosłownie, więc pisz je dokładnie tak, jak mają zabrzmieć. Postać zachowuje ten sam identyfikator we wszystkich ujęciach, a postacie, które nic nie mówią, nie dostają go wcale. Dla narratora poradnik używa sformułowania „says in an off-screen voiceover” (mówi głosem z offu), a potem zaznacza, że usta postaci w kadrze pozostają zamknięte.[2]

Jak ustawić czas ujęć i cięć?

Oznacz każde ujęcie jako [Shot 1], [Shot 2] i podaj moment cięcia: „[Shot 2] At 00:05.000, the camera cuts to a close-up of…”. Oś czasu musi sumować się do długości klipu, czyli od 4 do 15 sekund.[2][3] W naszym teście działa też zwykłe zdanie: „At 3 seconds, cut to a close-up of steam rising from the bread” dało cięcie mniej więcej w 3. sekundzie (klip C poniżej).

Dialog potrzebuje miejsca w swoim ujęciu. Wytyczne samego SD Video mówią o około 2,5 słowa dialogu na sekundę, więc w 5-sekundowym klipie mieści się jedno krótkie zdanie.[4]

Jak odwoływać się do obrazów, wideo i audio?

Do referencji odwołujesz się etykietami, numerowanymi osobno dla każdego typu w kolejności wysyłania: <Picture 1>, <Video 1>, <Audio 1>. Oficjalny poradnik prosi, by każda etykieta była taka sama we wszystkich sekcjach promptu.[3] W pełnym trybie referencji oficjalne przepisanie używa sześciu sekcji zamiast trzech: definicji postaci, podsumowania, analizy tego, co zachować z każdej referencji, szczegółowego opisu, tła dźwiękowego i muzyki.[3]

Często wystarcza prosty prompt z jedną etykietą. Ten klip wykorzystał 3-sekundowe wideo referencyjne z osobą grającą na wiolonczeli i prompt „The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.” (osoba grająca na wiolonczeli z <Video 1> ciągnie jedno długie pociągnięcie smyczkiem):

Referencje na wideo w SD Video, 480p, 5 sekund, jedno wideo referencyjne.

Jak wyglądają wyniki z kilkoma wideo referencyjnymi?

Jedno wideo referencyjne i krótki prompt. Referencja to 6-sekundowy klip z łyżwiarzami, a prompt brzmi „The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.” (łyżwiarze z <Video 1> suną o zmierzchu po odkrytym lodowisku):

Jedno wideo referencyjne, 480p, 5 sekund.

Ten sam prompt i ta sama referencja z duration ustawionym na 10:

Jedno wideo referencyjne, 480p, 10 sekund.

Dwa wideo referencyjne są numerowane w kolejności wysłania. Tutaj <Video 1> to klip z łyżwiarzami, a <Video 2> to 8,6-sekundowy klip taneczny, z promptem „The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.” (łyżwiarze z <Video 1> patrzą o zmierzchu, jak osoba tańcząca z <Video 2> występuje na lodzie):

Dwa wideo referencyjne, 480p, 5 sekund.

Tutaj <Video 1> to 3-sekundowy klip z wiolonczelą, a <Video 2> to klip taneczny, z promptem „The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.” (osoba grająca na wiolonczeli z <Video 1> gra, a osoba tańcząca z <Video 2> porusza się powoli obok):

Dwa wideo referencyjne, 480p, 5 sekund.

Gdy aspect_ratio zostaje na adaptive, klip przyjmuje format pierwszego wideo referencyjnego. Klip taneczny jest pionowy, więc te dwa ujęcia wyszły pionowe, w 480 × 832. Oba użyły tego samego promptu i tej samej referencji bez stałego seed, więc każde uruchomienie wybrało własny seed i ujęcia się różnią. Prompt brzmiał „The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.” (osoba tańcząca z <Video 1> powtarza te same ruchy w pustym studiu):

To samo żądanie uruchomione dwa razy, 480p, 5 sekund, pionowo.

Czy ustrukturyzowany format wygrywa z prostym promptem?

Wygenerowaliśmy tę samą scenę w piekarni na cztery sposoby w SD Video, opartym na MiniMax H3: tekst na wideo, 480p, 5 sekund, 16:9, seed 42. Każdy prompt uruchomiliśmy raz, więc traktuj wyniki jako pojedyncze obserwacje, a nie średnie.

A. Prosty prompt. Piekarz odkłada bochenek i wypowiada kwestię do kamery podczas powolnego najazdu.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. Oficjalna struktura. Prompt pokazany w pierwszej sekcji powyżej. Wynik jest zbliżony do A: ta sama akcja, kwestia wypowiedziana poprawnie, nieco szerszy kadr.

C. Prosty prompt z cięciem w czasie. Kwestia kończy się w okolicach 2,5 s, a cięcie na zbliżenie chleba pada między 3. a 3,5 s.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. Prompt A z wyłączonym przepisywaniem (prompt_enhancement: disabled). Kamera stoi dalej i prawie się nie rusza, najpierw słychać dzwonek przy drzwiach, a kwestia zaczyna się w okolicach 3,5 s. Ścieżka dźwiękowa jest dużo cichsza: jej średni poziom w pomiarze wyszedł około 20 dB niżej niż w pozostałych trzech klipach.

Co z tego wynika:

PromptKwestia poprawnaCo się zmieniło
A. ProstyTakPunkt odniesienia
B. Oficjalna strukturaTakBardzo blisko A
C. Prosty, cięcie w 3 sTakCięcie tam, gdzie trzeba
D. Prosty, bez przepisywaniaTakSzersze statyczne ujęcie, kwestia później, dużo cichszy dźwięk

Gdy usługa przepisuje twój prompt, wystarczy jasny prosty prompt. Strukturę pisz sam, gdy wyłączasz przepisywanie albo uruchamiasz otwarte wagi bez H3-Context-IR, bo wtedy nic nie zamienia twojego tekstu na formę, której oczekuje model.

Wskazówki do lepszych promptów MiniMax H3

  • Dopasuj oś czasu do długości klipu; nie opisuj 10 sekund akcji dla 5-sekundowego klipu.[3]
  • Używaj konkretnych szczegółów obrazu i dźwięku zamiast słów takich jak „cinematic” czy „beautiful”.[3]
  • Opisz dźwięk: tło pomieszczenia, dźwięki akcji i ich odległość. Napisz no music, jeśli nie chcesz muzyki w tle.[4]
  • Pisz krótkie dialogi, jedno zdanie na kilka sekund: w cudzysłowie w prostym prompcie, w tagach <d> w formie ustrukturyzowanej.
  • Ustal seed i zmieniaj jedną rzecz naraz, gdy dopracowujesz ujęcie.[4]
  • Przy klatkach kluczowych napisz, jak pierwsza lub ostatnia klatka łączy się z akcją.[3]

Na stronie SD Video jest playground do testowania promptów, a dokumentacja API wymienia wszystkie parametry, w tym prompt_enhancement.

Pytania o prompty

Czy prompty do MiniMax H3 muszą być po angielsku?

Oficjalne wytyczne piszą sekcje opisowe po angielsku, a dialogi, teksty piosenek i tekst w kadrze zostawiają w oryginalnym języku.[3] Dialog w innym języku trafia do tagu <d> razem z tagiem języka.

Czym jest H3-Context-IR?

To etap wstępnego przetwarzania MiniMax, który czyta wysłany tekst i media i przepisuje je na ustrukturyzowaną reprezentację, z której generuje H3. Nie wchodzi w skład wydania open source; MiniMax udostępnia go jako API i publikuje wytyczne do promptów, żeby deweloperzy mogli zbudować własny.[1][5]

Co robi prompt_enhancement w SD Video?

Steruje przepisywaniem twojego promptu przed generowaniem: turbo (domyślnie), quality albo disabled, by wysłać tekst bez zmian. Przepisywanie nie zmienia etykiet referencji takich jak <Picture 1>.[4]

Jak długi powinien być prompt do MiniMax H3?

Na tyle długi, by pokryć całą oś czasu. Przykłady przepisane przez samo MiniMax mają po kilkaset słów na jeden klip, a wytyczne SD Video zaznaczają, że szczegóły nie są karane.[1][4]

Źródła

  1. MiniMax. Karta modelu MiniMax-H3. Dostęp 4 października 2026 r., huggingface.co.
  2. MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Dostęp 4 października 2026 r., github.com.
  3. MiniMax. Skill H3 Prompt Writing. Dostęp 4 października 2026 r., github.com.
  4. SeedRouter. SD Video API reference. Dostęp 4 października 2026 r., seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. Dostęp 4 października 2026 r., platform.minimax.io.

Powiązane poradniki