Claude Opus 5.5 уже доступна в SeedRouter

Промпты для MiniMax H3: официальная структура, проверенная на реальных клипах

Как писать промпты для MiniMax H3: официальная структура из трёх частей, теги диалогов, тайминг планов и метки референсов, проверенные на четырёх клипах.

Читать в Markdown

MiniMax H3 рассчитана на промпты в структурированной форме из трёх частей: изображение и диалоги на временной шкале, общий звуковой фон и фоновая музыка, если она нужна. Шаг, который превращает обычный запрос в такую форму, MiniMax называет H3-Context-IR и пишет, что он «critical to the quality of the final output» (критически важен для качества результата).[1] SD Video, построенная на MiniMax H3, по умолчанию переписывает ваш промпт перед генерацией. В наших четырёх тестовых клипах простой промпт и промпт в официальной структуре дали одинаково пригодные результаты, а отключение переписывания изменило план и звуковой микс.

В этом руководстве — официальная структура, как писать диалоги, склейки и референсы, и что показали тесты.

Как выглядит промпт для MiniMax H3?

Для режимов текста, изображения и ключевых кадров официальное руководство использует три поля в фиксированном порядке:[2]

  • integrated_multimodal_description: основная часть. Визуальный стиль, композиция, персонажи, действия, камера, смена планов, кто говорит и что именно, а также звуки, связанные с действиями в кадре, в хронологическом порядке.
  • overall_soundscape: атмосфера, звуки действий и невербальные человеческие звуки на протяжении всего клипа.
  • non_diegetic_music: фоновая музыка, которую слышит только зритель, или N/A, если её нет.

Короткий пример в этой структуре из наших тестов:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

Официальные рекомендации требуют писать эти разделы на английском, а диалоги, тексты песен и видимый текст оставлять на языке оригинала.[3]

Как писать диалоги в промпте для MiniMax H3?

Дайте каждому говорящему постоянный ID вроде (S1) или (S2), описывайте голос вне тега, а внутрь <d>…</d> ставьте только тег языка и произносимые слова:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

Слова внутри тега сохраняются дословно, поэтому пишите их точно так, как они должны прозвучать. Персонаж сохраняет один и тот же ID во всех планах, а тем, кто не говорит, ID не нужен. Для закадрового рассказчика руководство использует формулировку «says in an off-screen voiceover» (говорит закадровым голосом) и затем указывает, что губы персонажа в кадре остаются сомкнутыми.[2]

Как задать тайминг планов и склеек?

Помечайте каждый план как [Shot 1], [Shot 2] и указывайте момент склейки: «[Shot 2] At 00:05.000, the camera cuts to a close-up of…». Временная шкала должна в сумме давать длину клипа — от 4 до 15 секунд.[2][3] В нашем тесте сработала и обычная фраза: «At 3 seconds, cut to a close-up of steam rising from the bread» дала склейку примерно на 3-й секунде (клип C ниже).

Диалогу нужно место внутри плана. Собственная рекомендация SD Video — около 2,5 слова диалога в секунду, так что в 5-секундный клип помещается одна короткая фраза.[4]

Как ссылаться на изображения, видео и аудио?

К референсам обращаются по меткам, пронумерованным по типу в порядке отправки: <Picture 1>, <Video 1>, <Audio 1>. Официальное руководство просит, чтобы каждая метка была одинаковой во всех разделах промпта.[3] Для полного режима референсов официальное переписывание использует шесть разделов вместо трёх: определения персонажей, краткое содержание, анализ того, что сохранить из каждого референса, подробное описание, звуковой фон и музыку.[3]

Часто хватает простого промпта с одной меткой. Для этого клипа использовалось 3-секундное референсное видео музыканта с виолончелью и промпт «The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed.» (музыкант с виолончелью из <Video 1> продолжает долгое ведение смычка):

Референсы в видео в SD Video, 480p, 5 секунд, одно референсное видео.

Как выглядят результаты с несколькими референсными видео?

Одно референсное видео и короткий промпт. Референс — 6-секундный клип с людьми на коньках, промпт — «The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music.» (люди на коньках из <Video 1> скользят по открытому катку в сумерках):

Одно референсное видео, 480p, 5 секунд.

Тот же промпт и тот же референс с duration, равным 10:

Одно референсное видео, 480p, 10 секунд.

Два референсных видео нумеруются в порядке отправки. Здесь <Video 1> — клип с людьми на коньках, а <Video 2> — танцевальный клип длиной 8,6 секунды, промпт — «The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music.» (люди на коньках из <Video 1> смотрят, как танцор из <Video 2> выступает на льду в сумерках):

Два референсных видео, 480p, 5 секунд.

Здесь <Video 1> — 3-секундный клип с виолончелью, а <Video 2> — танцевальный клип, промпт — «The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed.» (музыкант с виолончелью из <Video 1> играет, пока танцор из <Video 2> медленно двигается рядом):

Два референсных видео, 480p, 5 секунд.

Если оставить aspect_ratio равным adaptive, клип принимает формат первого референсного видео. Танцевальный клип вертикальный, поэтому эти два дубля получились вертикальными, 480 × 832. Оба использовали один и тот же промпт и один и тот же референс без фиксированного seed, поэтому каждый запуск выбрал свой seed, и дубли различаются. Промпт был таким: «The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music.» (танцор из <Video 1> повторяет те же движения в пустой студии):

Один и тот же запрос, выполненный дважды, 480p, 5 секунд, вертикально.

Лучше ли структурированный формат, чем простой промпт?

Мы сгенерировали одну и ту же сцену в пекарне четырьмя способами в SD Video, построенной на MiniMax H3: текст в видео, 480p, 5 секунд, 16:9, seed 42. Каждый промпт запускался один раз, поэтому считайте это отдельными наблюдениями, а не средними значениями.

A. Простой промпт. Пекарь кладёт буханку и произносит фразу в камеру во время медленного наезда.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. Официальная структура. Промпт из первого раздела выше. Результат близок к A: то же действие, фраза произнесена верно, кадр чуть шире.

C. Простой промпт со склейкой по времени. Фраза заканчивается примерно на 2,5-й секунде, а между 3-й и 3,5-й секундой идёт склейка на крупный план хлеба.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. Промпт A с отключённым переписыванием (prompt_enhancement: disabled). Камера стоит дальше и почти не двигается, первым звучит дверной колокольчик, а фраза начинается примерно на 3,5-й секунде. Звук намного тише: его средний уровень по замеру оказался примерно на 20 dB ниже, чем у трёх других клипов.

Что из этого следует:

ПромптФраза произнесена верноЧто изменилось
A. ПростойДаИсходный вариант
B. Официальная структураДаОчень близко к A
C. Простой, склейка на 3 сДаСклейка там, где просили
D. Простой, без переписыванияДаБолее широкий статичный план, фраза позже, звук намного тише

Когда сервис переписывает ваш промпт, достаточно ясного простого промпта. Пишите структуру сами, если отключаете переписывание или запускаете открытые веса без H3-Context-IR: тогда ваш текст ничто не переводит в форму, которую ожидает модель.

Советы для лучших промптов MiniMax H3

  • Подгоняйте временную шкалу под длину клипа; не описывайте 10 секунд действия для 5-секундного клипа.[3]
  • Используйте конкретные детали изображения и звука вместо слов вроде «cinematic» или «beautiful».[3]
  • Описывайте звук: фон помещения, звуки действий и их удалённость. Напишите no music, если фоновая музыка не нужна.[4]
  • Делайте диалоги короткими, одна фраза на несколько секунд: в кавычках в простом промпте, внутри тегов <d> в структурированной форме.
  • Зафиксируйте seed и меняйте по одному параметру, когда дорабатываете план.[4]
  • С ключевыми кадрами укажите, как первый или последний кадр связан с действием.[3]

На странице SD Video есть playground для проверки промптов, а справочник API перечисляет все параметры, включая prompt_enhancement.

Вопросы о промптах

Нужно ли писать промпты для MiniMax H3 на английском?

Официальные рекомендации пишут описательные разделы на английском, а диалоги, тексты песен и текст в кадре оставляют на языке оригинала.[3] Диалог на другом языке ставится в тег <d> вместе с тегом языка.

Что такое H3-Context-IR?

Это этап предобработки MiniMax, который читает отправленные текст и медиа и переписывает их в структурированное представление, из которого генерирует H3. В открытый релиз он не входит; MiniMax предлагает его как API и публикует рекомендации по промптам, чтобы разработчики могли сделать собственный.[1][5]

Что делает prompt_enhancement в SD Video?

Он управляет переписыванием промпта перед генерацией: turbo (по умолчанию), quality или disabled, чтобы отправить текст как есть. Метки референсов вроде <Picture 1> переписывание не меняет.[4]

Какой длины должен быть промпт для MiniMax H3?

Достаточной, чтобы покрыть всю временную шкалу. Примеры, переписанные самой MiniMax, занимают несколько сотен слов на один клип, а рекомендации SD Video отмечают, что за детали штрафа нет.[1][4]

Источники

  1. MiniMax. Карточка модели MiniMax-H3. Дата обращения: 4 октября 2026 года, huggingface.co.
  2. MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Дата обращения: 4 октября 2026 года, github.com.
  3. MiniMax. Навык H3 Prompt Writing. Дата обращения: 4 октября 2026 года, github.com.
  4. SeedRouter. SD Video API reference. Дата обращения: 4 октября 2026 года, seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. Дата обращения: 4 октября 2026 года, platform.minimax.io.

Похожие руководства