Guia de prompts do MiniMax H3: a estrutura oficial, testada em clipes reais
Como escrever prompts no MiniMax H3: a estrutura oficial em três partes, tags de diálogo, tempo dos planos e rótulos de referência, testados em quatro clipes.
Ler em MarkdownO MiniMax H3 foi feito para ler prompts em uma forma estruturada com três partes: a imagem e o diálogo ao longo de uma linha do tempo, a paisagem sonora geral e a música de fundo, se houver. A MiniMax chama de H3-Context-IR a etapa que converte um pedido simples nessa forma, e diz que ela é "critical to the quality of the final output" (decisiva para a qualidade do resultado).[1] O SD Video, baseado no MiniMax H3, reescreve o seu prompt por padrão antes de gerar. Nos nossos quatro clipes de teste, um prompt simples e um prompt escrito na estrutura oficial deram resultados igualmente aproveitáveis, enquanto desligar a reescrita mudou o plano e a mixagem de som.
Este guia mostra a estrutura oficial, como escrever diálogos, cortes e referências, e o que os testes mostraram.
Como é um prompt do MiniMax H3?
Para os modos de texto, imagem e keyframe, o guia oficial usa três campos em ordem fixa:[2]
- integrated_multimodal_description: o corpo principal. Estilo visual, composição, personagens, ações, câmera, mudanças de plano, quem fala e o que diz, e os sons ligados às ações na tela, em ordem cronológica.
- overall_soundscape: ambiente, sons de ação e sons humanos não verbais durante todo o clipe.
- non_diegetic_music: música de fundo que só o público ouve, ou
N/Ase não houver.
Um exemplo curto nessa estrutura, dos nossos testes:
integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>
overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.
non_diegetic_music: N/AAs orientações oficiais pedem essas seções em inglês, enquanto diálogo, letras e texto visível ficam no idioma original.[3]
Como escrever diálogo em um prompt do MiniMax H3?
Dê a cada personagem que fala um ID fixo como (S1) ou (S2), descreva a voz fora da tag e coloque dentro de <d>…</d> só uma tag de idioma e as palavras faladas:[2]
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>As palavras dentro da tag são mantidas ao pé da letra, então escreva exatamente como devem ser faladas. Um personagem mantém o mesmo ID em todos os planos, e quem nunca fala não recebe ID. Para um narrador, o guia usa a expressão "says in an off-screen voiceover" (diz em narração off) e depois afirma que os lábios do personagem em cena ficam fechados.[2]
Como marcar o tempo de planos e cortes?
Marque cada plano como [Shot 1], [Shot 2] e informe o momento do corte: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". A linha do tempo precisa somar a duração do clipe, de 4 a 15 segundos.[2][3] No nosso teste, uma frase simples também funciona: "At 3 seconds, cut to a close-up of steam rising from the bread" gerou um corte por volta de 3 segundos (clipe C abaixo).
O diálogo precisa de espaço dentro do plano. A orientação do próprio SD Video é de cerca de 2,5 palavras de diálogo por segundo, então um clipe de 5 segundos comporta uma frase curta.[4]
Como referenciar imagens, vídeos e áudio?
As referências são indicadas por rótulos, numerados por tipo na ordem em que você as envia: <Picture 1>, <Video 1>, <Audio 1>. O guia oficial pede que cada rótulo seja o mesmo em todas as seções do prompt.[3] No modo de referências completo, a reescrita oficial usa seis seções em vez de três: definição dos personagens, um resumo, uma análise do que manter de cada referência, a descrição detalhada, a paisagem sonora e a música.[3]
Muitas vezes um prompt simples com um rótulo basta. Este clipe usou um vídeo de referência de 3 segundos de uma pessoa tocando violoncelo e o prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (quem toca o violoncelo em <Video 1> segue com uma longa arcada):
Referências para vídeo no SD Video, 480p, 5 segundos, um vídeo de referência.
Como ficam vários vídeos de referência?
Um vídeo de referência e um prompt curto. A referência é um clipe de 6 segundos de patinadores, e o prompt é "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (os patinadores de <Video 1> deslizam por uma pista ao ar livre ao entardecer):
Um vídeo de referência, 480p, 5 segundos.
O mesmo prompt e a mesma referência com duration em 10:
Um vídeo de referência, 480p, 10 segundos.
Dois vídeos de referência são numerados na ordem em que são enviados. Aqui <Video 1> é o clipe dos patinadores e <Video 2> é um clipe de dança de 8,6 segundos, com o prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (os patinadores de <Video 1> assistem a quem dança em <Video 2> se apresentar no gelo ao entardecer):
Dois vídeos de referência, 480p, 5 segundos.
Aqui <Video 1> é o clipe de violoncelo de 3 segundos e <Video 2> é o clipe de dança, com o prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (quem toca o violoncelo em <Video 1> toca enquanto quem dança em <Video 2> se move devagar ao lado):
Dois vídeos de referência, 480p, 5 segundos.
Com aspect_ratio deixado em adaptive, o clipe assume o formato do primeiro vídeo de referência. O clipe de dança é vertical, então estas duas tomadas saíram na vertical, em 480 × 832. As duas usaram o mesmo prompt e a mesma referência sem um seed fixo, então cada execução escolheu o próprio seed e as tomadas são diferentes. O prompt foi "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (quem dança em <Video 1> repete os mesmos movimentos em um estúdio vazio):
A mesma requisição executada duas vezes, 480p, 5 segundos, vertical.
O formato estruturado é melhor que um prompt simples?
Geramos a mesma cena de padaria de quatro formas no SD Video, baseado no MiniMax H3: texto para vídeo, 480p, 5 segundos, 16:9, seed 42. Cada prompt rodou uma única vez, então leia os resultados como observações isoladas, não como médias.
A. Prompt simples. O padeiro coloca o pão no balcão e diz a fala para a câmera durante uma aproximação lenta.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.B. Estrutura oficial. O prompt mostrado na primeira seção acima. O resultado é parecido com A: a mesma ação, a fala dita corretamente, um enquadramento um pouco mais aberto.
C. Prompt simples com corte marcado. A fala termina por volta de 2,5 segundos e o plano corta para o close do pão entre 3 e 3,5 segundos.
A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.D. Prompt A com a reescrita desligada (prompt_enhancement: disabled). A câmera fica mais distante e quase não se move, a campainha da porta vem primeiro e a fala começa por volta de 3,5 segundos. A trilha sonora é bem mais baixa: o nível médio medido ficou cerca de 20 dB abaixo dos outros três clipes.
O que isso sugere:
| Prompt | Fala dita corretamente | O que mudou |
|---|---|---|
| A. Simples | Sim | Referência |
| B. Estrutura oficial | Sim | Muito parecido com A |
| C. Simples, corte em 3 s | Sim | Corte caiu onde foi pedido |
| D. Simples, reescrita desligada | Sim | Plano fixo mais aberto, fala mais tarde, áudio bem mais baixo |
Quando o serviço reescreve o seu prompt, um prompt simples e claro basta. Escreva a estrutura você mesmo quando desligar a reescrita, ou quando rodar os pesos abertos sem o H3-Context-IR, porque aí nada converte o seu texto para a forma que o modelo espera.
Dicas para prompts melhores no MiniMax H3
- Ajuste a linha do tempo à duração do clipe; não descreva 10 segundos de ação para um clipe de 5 segundos.[3]
- Use detalhes visuais e sonoros concretos em vez de palavras como "cinematic" ou "beautiful".[3]
- Descreva o som: ambiente do lugar, sons de ação e a distância deles. Escreva
no musicse não quiser trilha de fundo.[4] - Mantenha o diálogo curto, uma frase a cada poucos segundos: entre aspas em um prompt simples, dentro das tags
<d>na forma estruturada. - Fixe o seed e mude uma coisa de cada vez quando for ajustar um plano.[4]
- Com keyframes, diga como o primeiro ou o último quadro se conecta à ação.[3]
A página do SD Video tem um playground para testar prompts, e a referência da API lista todos os parâmetros, incluindo prompt_enhancement.
Perguntas sobre prompts
Os prompts do MiniMax H3 precisam ser em inglês?
As orientações oficiais escrevem as seções descritivas em inglês e mantêm diálogo, letras e texto na tela no idioma original.[3] Diálogo em outro idioma vai dentro da tag <d> com a sua tag de idioma.
O que é o H3-Context-IR?
É a etapa de pré-processamento da MiniMax que lê o texto e as mídias enviadas e os reescreve na representação estruturada a partir da qual o H3 gera. Ela não faz parte da versão open source; a MiniMax a oferece como API e publica as orientações de prompt para que desenvolvedores criem a sua própria.[1][5]
O que o prompt_enhancement faz no SD Video?
Ele controla a reescrita do seu prompt antes da geração: turbo (padrão), quality, ou disabled para enviar o texto como está. A reescrita não altera rótulos de referência como <Picture 1>.[4]
Qual deve ser o tamanho de um prompt do MiniMax H3?
O suficiente para cobrir toda a linha do tempo. Os exemplos reescritos pela própria MiniMax chegam a várias centenas de palavras para um único clipe, e as orientações do SD Video observam que detalhe não é penalizado.[1][4]
Referências
- MiniMax. Ficha do modelo MiniMax-H3. Acessado em 4 de outubro de 2026 em huggingface.co.
- MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Acessado em 4 de outubro de 2026 em github.com.
- MiniMax. Skill H3 Prompt Writing. Acessado em 4 de outubro de 2026 em github.com.
- SeedRouter. SD Video API reference. Acessado em 4 de outubro de 2026 em seedrouter.ai.
- MiniMax. Create H3-Context-IR Task. Acessado em 4 de outubro de 2026 em platform.minimax.io.



