Промпты для MiniMax H3: официальная структура, проверенная на реальных клипах
Как писать промпты для MiniMax H3: официальная структура из трёх частей, теги диалогов, тайминг планов и метки референсов, проверенные на четырёх клипах.
Читать в MarkdownMiniMax H3 рассчитана на промпты в структурированной форме из трёх частей: изображение и диалоги на временной шкале, общий звуковой фон и фоновая музыка, если она нужна. Шаг, который превращает обычный запрос в такую форму, MiniMax называет H3-Context-IR и пишет, что он «critical to the quality of the final output» (критически важен для качества результата).[1] SD Video, построенная на MiniMax H3, по умолчанию переписывает ваш промпт перед генерацией. В наших четырёх тестовых клипах простой промпт и промпт в официальной структуре дали одинаково пригодные результаты, а отключение переписывания изменило план и звуковой микс.
В этом руководстве — официальная структура, как писать диалоги, склейки и референсы, и что показали тесты.
Как выглядит промпт для MiniMax H3?
Для режимов текста, изображения и ключевых кадров официальное руководство использует три поля в фиксированном порядке:[2]
- integrated_multimodal_description: основная часть. Визуальный стиль, композиция, персонажи, действия, камера, смена планов, кто говорит и что именно, а также звуки, связанные с действиями в кадре, в хронологическом порядке.
- overall_soundscape: атмосфера, звуки действий и невербальные человеческие звуки на протяжении всего клипа.
- non_diegetic_music: фоновая музыка, которую слышит только зритель, или
N/A, если её нет.
Короткий пример в этой структуре из наших тестов:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/AОфициальные рекомендации требуют писать эти разделы на английском, а диалоги, тексты песен и видимый текст оставлять на языке оригинала.[3]
Как писать диалоги в промпте для MiniMax H3?
Дайте каждому говорящему постоянный ID вроде (S1) или (S2), описывайте голос вне тега, а внутрь <d>…</d> ставьте только тег языка и произносимые слова:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>Слова внутри тега сохраняются дословно, поэтому пишите их точно так, как они должны прозвучать. Персонаж сохраняет один и тот же ID во всех планах, а тем, кто не говорит, ID не нужен. Для закадрового рассказчика руководство использует формулировку «says in an off-screen voiceover» (говорит закадровым голосом) и затем указывает, что губы персонажа в кадре остаются сомкнутыми.[2]
Как задать тайминг планов и склеек?
Помечайте каждый план как [Shot 1], [Shot 2] и указывайте момент склейки: «[Shot 2] At 00:05.000, the camera cuts to a close-up of…». Временная шкала должна в сумме давать длину клипа — от 4 до 15 секунд.[2][3] В нашем тесте сработала и обычная фраза: «At 3 seconds, cut to a close-up of steam rising from the bread» дала склейку примерно на 3-й секунде (клип C ниже).
Диалогу нужно место внутри плана. Собственная рекомендация SD Video — около 2,5 слова диалога в секунду, так что в 5-секундный клип помещается одна короткая фраза.[4]
Как ссылаться на изображения, видео и аудио?
К референсам обращаются по меткам, пронумерованным по типу в порядке отправки: <Picture 1>, <Video 1>, <Audio 1>. Официальное руководство просит, чтобы каждая метка была одинаковой во всех разделах промпта.[3] Для полного режима референсов официальное переписывание использует шесть разделов вместо трёх: определения персонажей, краткое содержание, анализ того, что сохранить из каждого референса, подробное описание, звуковой фон и музыку.[3]
Часто хватает простого промпта с одной меткой. Для этого клипа использовалось 3-секундное референсное видео музыканта с виолончелью и промпт «The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.» (музыкант с виолончелью из <Video 1> продолжает долгое ведение смычка):
Референсы в видео в SD Video, 480p, 5 секунд, одно референсное видео.
Как выглядят результаты с несколькими референсными видео?
Одно референсное видео и короткий промпт. Референс — 6-секундный клип с людьми на коньках, промпт — «The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.» (люди на коньках из <Video 1> скользят по открытому катку в сумерках):
Одно референсное видео, 480p, 5 секунд.
Тот же промпт и тот же референс с duration, равным 10:
Одно референсное видео, 480p, 10 секунд.
Два референсных видео нумеруются в порядке отправки. Здесь <Video 1> — клип с людьми на коньках, а <Video 2> — танцевальный клип длиной 8,6 секунды, промпт — «The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.» (люди на коньках из <Video 1> смотрят, как танцор из <Video 2> выступает на льду в сумерках):
Два референсных видео, 480p, 5 секунд.
Здесь <Video 1> — 3-секундный клип с виолончелью, а <Video 2> — танцевальный клип, промпт — «The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.» (музыкант с виолончелью из <Video 1> играет, пока танцор из <Video 2> медленно двигается рядом):
Два референсных видео, 480p, 5 секунд.
Если оставить aspect_ratio равным adaptive, клип принимает формат первого референсного видео. Танцевальный клип вертикальный, поэтому эти два дубля получились вертикальными, 480 × 832. Оба использовали один и тот же промпт и один и тот же референс без фиксированного seed, поэтому каждый запуск выбрал свой seed, и дубли различаются. Промпт был таким: «The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.» (танцор из <Video 1> повторяет те же движения в пустой студии):
Один и тот же запрос, выполненный дважды, 480p, 5 секунд, вертикально.
Лучше ли структурированный формат, чем простой промпт?
Мы сгенерировали одну и ту же сцену в пекарне четырьмя способами в SD Video, построенной на MiniMax H3: текст в видео, 480p, 5 секунд, 16:9, seed 42. Каждый промпт запускался один раз, поэтому считайте это отдельными наблюдениями, а не средними значениями.
A. Простой промпт. Пекарь кладёт буханку и произносит фразу в камеру во время медленного наезда.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Официальная структура. Промпт из первого раздела выше. Результат близок к A: то же действие, фраза произнесена верно, кадр чуть шире.
C. Простой промпт со склейкой по времени. Фраза заканчивается примерно на 2,5-й секунде, а между 3-й и 3,5-й секундой идёт склейка на крупный план хлеба.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Промпт A с отключённым переписыванием (prompt_enhancement: disabled). Камера стоит дальше и почти не двигается, первым звучит дверной колокольчик, а фраза начинается примерно на 3,5-й секунде. Звук намного тише: его средний уровень по замеру оказался примерно на 20 dB ниже, чем у трёх других клипов.
Что из этого следует:
| Промпт | Фраза произнесена верно | Что изменилось |
|---|---|---|
| A. Простой | Да | Исходный вариант |
| B. Официальная структура | Да | Очень близко к A |
| C. Простой, склейка на 3 с | Да | Склейка там, где просили |
| D. Простой, без переписывания | Да | Более широкий статичный план, фраза позже, звук намного тише |
Когда сервис переписывает ваш промпт, достаточно ясного простого промпта. Пишите структуру сами, если отключаете переписывание или запускаете открытые веса без H3-Context-IR: тогда ваш текст ничто не переводит в форму, которую ожидает модель.
Советы для лучших промптов MiniMax H3
- Подгоняйте временную шкалу под длину клипа; не описывайте 10 секунд действия для 5-секундного клипа.[3]
- Используйте конкретные детали изображения и звука вместо слов вроде «cinematic» или «beautiful».[3]
- Описывайте звук: фон помещения, звуки действий и их удалённость. Напишите
no music, если фоновая музыка не нужна.[4] - Делайте диалоги короткими, одна фраза на несколько секунд: в кавычках в простом промпте, внутри тегов
<d>в структурированной форме. - Зафиксируйте seed и меняйте по одному параметру, когда дорабатываете план.[4]
- С ключевыми кадрами укажите, как первый или последний кадр связан с действием.[3]
На странице SD Video есть playground для проверки промптов, а справочник API перечисляет все параметры, включая prompt_enhancement.
Вопросы о промптах
Нужно ли писать промпты для MiniMax H3 на английском?
Официальные рекомендации пишут описательные разделы на английском, а диалоги, тексты песен и текст в кадре оставляют на языке оригинала.[3] Диалог на другом языке ставится в тег <d> вместе с тегом языка.
Что такое H3-Context-IR?
Это этап предобработки MiniMax, который читает отправленные текст и медиа и переписывает их в структурированное представление, из которого генерирует H3. В открытый релиз он не входит; MiniMax предлагает его как API и публикует рекомендации по промптам, чтобы разработчики могли сделать собственный.[1][5]
Что делает prompt_enhancement в SD Video?
Он управляет переписыванием промпта перед генерацией: turbo (по умолчанию), quality или disabled, чтобы отправить текст как есть. Метки референсов вроде <Picture 1> переписывание не меняет.[4]
Какой длины должен быть промпт для MiniMax H3?
Достаточной, чтобы покрыть всю временную шкалу. Примеры, переписанные самой MiniMax, занимают несколько сотен слов на один клип, а рекомендации SD Video отмечают, что за детали штрафа нет.[1][4]
Источники
- MiniMax. Карточка модели MiniMax-H3. Дата обращения: 4 октября 2026 года, huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Дата обращения: 4 октября 2026 года, github.com.
- MiniMax. Навык H3 Prompt Writing. Дата обращения: 4 октября 2026 года, github.com.
- SeedRouter. SD Video API reference. Дата обращения: 4 октября 2026 года, seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Дата обращения: 4 октября 2026 года, platform.minimax.io.



