Claude Opus 5.5 já está disponível no SeedRouter

Guia de prompts do MiniMax H3: a estrutura oficial, testada em clipes reais

Como escrever prompts no MiniMax H3: a estrutura oficial em três partes, tags de diálogo, tempo dos planos e rótulos de referência, testados em quatro clipes.

Ler em Markdown

O MiniMax H3 foi feito para ler prompts em uma forma estruturada com três partes: a imagem e o diálogo ao longo de uma linha do tempo, a paisagem sonora geral e a música de fundo, se houver. A MiniMax chama de H3-Context-IR a etapa que converte um pedido simples nessa forma, e diz que ela é "critical to the quality of the final output" (decisiva para a qualidade do resultado).[1] O SD Video, baseado no MiniMax H3, reescreve o seu prompt por padrão antes de gerar. Nos nossos quatro clipes de teste, um prompt simples e um prompt escrito na estrutura oficial deram resultados igualmente aproveitáveis, enquanto desligar a reescrita mudou o plano e a mixagem de som.

Este guia mostra a estrutura oficial, como escrever diálogos, cortes e referências, e o que os testes mostraram.

Como é um prompt do MiniMax H3?

Para os modos de texto, imagem e keyframe, o guia oficial usa três campos em ordem fixa:[2]

  • integrated_multimodal_description: o corpo principal. Estilo visual, composição, personagens, ações, câmera, mudanças de plano, quem fala e o que diz, e os sons ligados às ações na tela, em ordem cronológica.
  • overall_soundscape: ambiente, sons de ação e sons humanos não verbais durante todo o clipe.
  • non_diegetic_music: música de fundo que só o público ouve, ou N/A se não houver.

Um exemplo curto nessa estrutura, dos nossos testes:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

As orientações oficiais pedem essas seções em inglês, enquanto diálogo, letras e texto visível ficam no idioma original.[3]

Como escrever diálogo em um prompt do MiniMax H3?

Dê a cada personagem que fala um ID fixo como (S1) ou (S2), descreva a voz fora da tag e coloque dentro de <d>…</d> só uma tag de idioma e as palavras faladas:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

As palavras dentro da tag são mantidas ao pé da letra, então escreva exatamente como devem ser faladas. Um personagem mantém o mesmo ID em todos os planos, e quem nunca fala não recebe ID. Para um narrador, o guia usa a expressão "says in an off-screen voiceover" (diz em narração off) e depois afirma que os lábios do personagem em cena ficam fechados.[2]

Como marcar o tempo de planos e cortes?

Marque cada plano como [Shot 1], [Shot 2] e informe o momento do corte: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". A linha do tempo precisa somar a duração do clipe, de 4 a 15 segundos.[2][3] No nosso teste, uma frase simples também funciona: "At 3 seconds, cut to a close-up of steam rising from the bread" gerou um corte por volta de 3 segundos (clipe C abaixo).

O diálogo precisa de espaço dentro do plano. A orientação do próprio SD Video é de cerca de 2,5 palavras de diálogo por segundo, então um clipe de 5 segundos comporta uma frase curta.[4]

Como referenciar imagens, vídeos e áudio?

As referências são indicadas por rótulos, numerados por tipo na ordem em que você as envia: <Picture 1>, <Video 1>, <Audio 1>. O guia oficial pede que cada rótulo seja o mesmo em todas as seções do prompt.[3] No modo de referências completo, a reescrita oficial usa seis seções em vez de três: definição dos personagens, um resumo, uma análise do que manter de cada referência, a descrição detalhada, a paisagem sonora e a música.[3]

Muitas vezes um prompt simples com um rótulo basta. Este clipe usou um vídeo de referência de 3 segundos de uma pessoa tocando violoncelo e o prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (quem toca o violoncelo em <Video 1> segue com uma longa arcada):

Referências para vídeo no SD Video, 480p, 5 segundos, um vídeo de referência.

Como ficam vários vídeos de referência?

Um vídeo de referência e um prompt curto. A referência é um clipe de 6 segundos de patinadores, e o prompt é "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (os patinadores de <Video 1> deslizam por uma pista ao ar livre ao entardecer):

Um vídeo de referência, 480p, 5 segundos.

O mesmo prompt e a mesma referência com duration em 10:

Um vídeo de referência, 480p, 10 segundos.

Dois vídeos de referência são numerados na ordem em que são enviados. Aqui <Video 1> é o clipe dos patinadores e <Video 2> é um clipe de dança de 8,6 segundos, com o prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (os patinadores de <Video 1> assistem a quem dança em <Video 2> se apresentar no gelo ao entardecer):

Dois vídeos de referência, 480p, 5 segundos.

Aqui <Video 1> é o clipe de violoncelo de 3 segundos e <Video 2> é o clipe de dança, com o prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (quem toca o violoncelo em <Video 1> toca enquanto quem dança em <Video 2> se move devagar ao lado):

Dois vídeos de referência, 480p, 5 segundos.

Com aspect_ratio deixado em adaptive, o clipe assume o formato do primeiro vídeo de referência. O clipe de dança é vertical, então estas duas tomadas saíram na vertical, em 480 × 832. As duas usaram o mesmo prompt e a mesma referência sem um seed fixo, então cada execução escolheu o próprio seed e as tomadas são diferentes. O prompt foi "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (quem dança em <Video 1> repete os mesmos movimentos em um estúdio vazio):

A mesma requisição executada duas vezes, 480p, 5 segundos, vertical.

O formato estruturado é melhor que um prompt simples?

Geramos a mesma cena de padaria de quatro formas no SD Video, baseado no MiniMax H3: texto para vídeo, 480p, 5 segundos, 16:9, seed 42. Cada prompt rodou uma única vez, então leia os resultados como observações isoladas, não como médias.

A. Prompt simples. O padeiro coloca o pão no balcão e diz a fala para a câmera durante uma aproximação lenta.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. Estrutura oficial. O prompt mostrado na primeira seção acima. O resultado é parecido com A: a mesma ação, a fala dita corretamente, um enquadramento um pouco mais aberto.

C. Prompt simples com corte marcado. A fala termina por volta de 2,5 segundos e o plano corta para o close do pão entre 3 e 3,5 segundos.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. Prompt A com a reescrita desligada (prompt_enhancement: disabled). A câmera fica mais distante e quase não se move, a campainha da porta vem primeiro e a fala começa por volta de 3,5 segundos. A trilha sonora é bem mais baixa: o nível médio medido ficou cerca de 20 dB abaixo dos outros três clipes.

O que isso sugere:

PromptFala dita corretamenteO que mudou
A. SimplesSimReferência
B. Estrutura oficialSimMuito parecido com A
C. Simples, corte em 3 sSimCorte caiu onde foi pedido
D. Simples, reescrita desligadaSimPlano fixo mais aberto, fala mais tarde, áudio bem mais baixo

Quando o serviço reescreve o seu prompt, um prompt simples e claro basta. Escreva a estrutura você mesmo quando desligar a reescrita, ou quando rodar os pesos abertos sem o H3-Context-IR, porque aí nada converte o seu texto para a forma que o modelo espera.

Dicas para prompts melhores no MiniMax H3

  • Ajuste a linha do tempo à duração do clipe; não descreva 10 segundos de ação para um clipe de 5 segundos.[3]
  • Use detalhes visuais e sonoros concretos em vez de palavras como "cinematic" ou "beautiful".[3]
  • Descreva o som: ambiente do lugar, sons de ação e a distância deles. Escreva no music se não quiser trilha de fundo.[4]
  • Mantenha o diálogo curto, uma frase a cada poucos segundos: entre aspas em um prompt simples, dentro das tags <d> na forma estruturada.
  • Fixe o seed e mude uma coisa de cada vez quando for ajustar um plano.[4]
  • Com keyframes, diga como o primeiro ou o último quadro se conecta à ação.[3]

A página do SD Video tem um playground para testar prompts, e a referência da API lista todos os parâmetros, incluindo prompt_enhancement.

Perguntas sobre prompts

Os prompts do MiniMax H3 precisam ser em inglês?

As orientações oficiais escrevem as seções descritivas em inglês e mantêm diálogo, letras e texto na tela no idioma original.[3] Diálogo em outro idioma vai dentro da tag <d> com a sua tag de idioma.

O que é o H3-Context-IR?

É a etapa de pré-processamento da MiniMax que lê o texto e as mídias enviadas e os reescreve na representação estruturada a partir da qual o H3 gera. Ela não faz parte da versão open source; a MiniMax a oferece como API e publica as orientações de prompt para que desenvolvedores criem a sua própria.[1][5]

O que o prompt_enhancement faz no SD Video?

Ele controla a reescrita do seu prompt antes da geração: turbo (padrão), quality, ou disabled para enviar o texto como está. A reescrita não altera rótulos de referência como <Picture 1>.[4]

Qual deve ser o tamanho de um prompt do MiniMax H3?

O suficiente para cobrir toda a linha do tempo. Os exemplos reescritos pela própria MiniMax chegam a várias centenas de palavras para um único clipe, e as orientações do SD Video observam que detalhe não é penalizado.[1][4]

Referências

  1. MiniMax. Ficha do modelo MiniMax-H3. Acessado em 4 de outubro de 2026 em huggingface.co.
  2. MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Acessado em 4 de outubro de 2026 em github.com.
  3. MiniMax. Skill H3 Prompt Writing. Acessado em 4 de outubro de 2026 em github.com.
  4. SeedRouter. SD Video API reference. Acessado em 4 de outubro de 2026 em seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. Acessado em 4 de outubro de 2026 em platform.minimax.io.

Guias relacionados