Claude Opus 5.5 ya está disponible en SeedRouter

Guía de prompts de MiniMax H3: la estructura oficial, probada con clips reales

Cómo escribir prompts para MiniMax H3: estructura oficial en tres partes, etiquetas de diálogo, tiempos de plano y referencias, probados en cuatro clips.

Leer en Markdown

MiniMax H3 está diseñado para leer prompts en una forma estructurada de tres partes: la imagen y el diálogo a lo largo de una línea de tiempo, el paisaje sonoro general y la música de fondo, si la hay. MiniMax llama H3-Context-IR al paso que convierte una petición simple en esta forma, y dice que es "critical to the quality of the final output" (clave para la calidad del resultado).[1] SD Video, basado en MiniMax H3, reescribe tu prompt por defecto antes de generar. En nuestros cuatro clips de prueba, un prompt simple y uno escrito con la estructura oficial dieron resultados igual de aprovechables, mientras que desactivar la reescritura cambió el plano y la mezcla de sonido.

Esta guía explica la estructura oficial, cómo escribir diálogos, cortes y referencias, y qué mostraron las pruebas.

¿Cómo es un prompt de MiniMax H3?

Para los modos de texto, imagen y keyframe, la guía oficial usa tres campos en un orden fijo:[2]

  • integrated_multimodal_description: el cuerpo principal. Estilo visual, composición, sujetos, acciones, cámara, cambios de plano, quién habla y qué dice, y los sonidos ligados a las acciones en pantalla, en orden cronológico.
  • overall_soundscape: ambiente, sonidos de acción y sonidos humanos no verbales durante todo el clip.
  • non_diegetic_music: música de fondo que solo oye el público, o N/A si no hay.

Un ejemplo breve con esa estructura, de nuestras pruebas:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium shot frames a middle-aged baker in a flour-dusted apron behind the wooden counter of a small street bakery before sunrise, warm light from the ovens behind him. The camera pushes in with small amplitude at slow speed as the baker with a calm, slightly raspy voice (S1) places a fresh loaf on the counter, looks up at the camera and says: <d>[English] First batch of the morning.</d>

overall_soundscape: Trays clink softly inside the bakery and the doorbell rings once over a quiet street.

non_diegetic_music: N/A

Las indicaciones oficiales piden estas secciones en inglés, mientras que el diálogo, las letras y el texto visible se mantienen en su idioma original.[3]

¿Cómo se escribe el diálogo en un prompt de MiniMax H3?

Da a cada personaje que habla un ID estable como (S1) o (S2), describe la voz fuera de la etiqueta y pon dentro de <d>…</d> solo una etiqueta de idioma y las palabras habladas:[2]

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>
The two children (S1,S2) shout together, <d>[English] Wait for us!</d>

Las palabras dentro de la etiqueta se mantienen literalmente, así que escríbelas exactamente como deben pronunciarse. Un personaje conserva el mismo ID en todos los planos, y los personajes que nunca hablan no llevan ID. Para un narrador, la guía usa la expresión "says in an off-screen voiceover" (dice en voz en off) y después indica que los labios del personaje en pantalla siguen cerrados.[2]

¿Cómo se marcan los tiempos de planos y cortes?

Marca cada plano como [Shot 1], [Shot 2] e indica el momento del corte: "[Shot 2] At 00:05.000, the camera cuts to a close-up of…". La línea de tiempo debe sumar la duración del clip, de 4 a 15 segundos.[2][3] En nuestra prueba también funciona una frase simple: "At 3 seconds, cut to a close-up of steam rising from the bread" produjo un corte hacia los 3 segundos (clip C, más abajo).

El diálogo necesita espacio dentro de su plano. Las indicaciones de SD Video hablan de unas 2,5 palabras de diálogo por segundo, así que en un clip de 5 segundos cabe una frase corta.[4]

¿Cómo se referencian imágenes, vídeos y audio?

Las referencias se nombran con etiquetas, numeradas por tipo en el orden en que las envías: <Picture 1>, <Video 1>, <Audio 1>. La guía oficial pide mantener cada etiqueta igual en todas las secciones del prompt.[3] Para el modo de referencias completo, la reescritura oficial usa seis secciones en lugar de tres: definición de sujetos, un resumen, un análisis de qué conservar de cada referencia, la descripción detallada, el paisaje sonoro y la música.[3]

Un prompt simple con una etiqueta suele bastar. Este clip usó un vídeo de referencia de 3 segundos de una persona tocando el violonchelo y el prompt "The cellist in <Video 1> keeps playing one long bow stroke, static camera, warm room tone, the cello note, no music bed." (la persona que toca el violonchelo en <Video 1> sigue con un largo golpe de arco):

Referencias a vídeo en SD Video, 480p, 5 segundos, un vídeo de referencia.

¿Cómo se ven varios vídeos de referencia?

Un vídeo de referencia y un prompt corto. La referencia es un clip de 6 segundos de patinadores, y el prompt es "The skaters in <Video 1> glide across an outdoor rink at dusk, the camera holds still, skates scraping the ice, distant chatter, no music." (los patinadores de <Video 1> se deslizan por una pista al aire libre al atardecer):

Un vídeo de referencia, 480p, 5 segundos.

El mismo prompt y la misma referencia con duration en 10:

Un vídeo de referencia, 480p, 10 segundos.

Dos vídeos de referencia se numeran en el orden en que se envían. Aquí <Video 1> es el clip de los patinadores y <Video 2> un clip de baile de 8,6 segundos, con el prompt "The skaters in <Video 1> watch the dancer in <Video 2> perform on the ice at dusk, static camera, skates scraping, no music." (los patinadores de <Video 1> miran a la persona que baila en <Video 2> actuar sobre el hielo al atardecer):

Dos vídeos de referencia, 480p, 5 segundos.

Aquí <Video 1> es el clip de violonchelo de 3 segundos y <Video 2> el clip de baile, con el prompt "The cellist in <Video 1> plays while the dancer in <Video 2> moves slowly beside her, static camera, cello note, footsteps, no music bed." (la persona que toca el violonchelo en <Video 1> toca mientras la persona que baila en <Video 2> se mueve despacio a su lado):

Dos vídeos de referencia, 480p, 5 segundos.

Con aspect_ratio en adaptive, el clip toma la forma del primer vídeo de referencia. El clip de baile es vertical, así que estas dos tomas salieron en vertical, a 480 × 832. Las dos usaron el mismo prompt y la misma referencia sin un seed fijo, así que cada ejecución eligió su propio seed y las tomas son distintas. El prompt fue "The dancer in <Video 1> repeats the same moves in an empty studio, static camera, footsteps on wood, no music." (la persona que baila en <Video 1> repite los mismos movimientos en un estudio vacío):

La misma solicitud ejecutada dos veces, 480p, 5 segundos, vertical.

¿El formato estructurado supera a un prompt simple?

Generamos la misma escena de panadería de cuatro formas en SD Video, basado en MiniMax H3: texto a vídeo, 480p, 5 segundos, 16:9, seed 42. Cada prompt se ejecutó una sola vez, así que tómalo como observaciones aisladas, no como promedios.

A. Prompt simple. El panadero deja la hogaza y dice la frase a cámara durante un lento acercamiento.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, slow push-in, warm light from the ovens behind him. Trays clink softly, the doorbell rings once, no music.

B. Estructura oficial. El prompt de la primera sección de arriba. El resultado se parece a A: la misma acción, la frase bien dicha y un encuadre algo más abierto.

C. Prompt simple con corte cronometrado. La frase termina hacia los 2,5 segundos y el plano corta al primer plano del pan entre los 3 y los 3,5 segundos.

A middle-aged baker in a flour-dusted apron stands behind the wooden counter of a small street bakery before sunrise. He places a fresh loaf on the counter, looks up at the camera and says in a calm, slightly raspy voice, "First batch of the morning." Medium shot, warm light from the ovens. At 3 seconds, cut to a close-up of steam rising from the bread as he slices it. Trays clink softly, the knife crunches through the crust, no music.

D. Prompt A con la reescritura desactivada (prompt_enhancement: disabled). La cámara queda más lejos y apenas se mueve, la campanilla de la puerta suena primero y la frase empieza hacia los 3,5 segundos. La banda sonora es mucho más baja: su nivel medio medido quedó unos 20 dB por debajo de los otros tres clips.

Lo que esto sugiere:

PromptFrase bien dichaQué cambió
A. SimpleSíReferencia
B. Estructura oficialSíMuy parecido a A
C. Simple, corte a los 3 sSíEl corte cayó donde se pidió
D. Simple, sin reescrituraSíPlano fijo más abierto, frase más tarde, audio mucho más bajo

Cuando el servicio reescribe tu prompt, basta con un prompt simple y claro. Escribe tú la estructura cuando desactives la reescritura o cuando ejecutes los pesos abiertos sin H3-Context-IR, porque entonces nada convierte tu texto a la forma que espera el modelo.

Consejos para mejores prompts de MiniMax H3

  • Ajusta la línea de tiempo a la duración del clip; no describas 10 segundos de acción para un clip de 5 segundos.[3]
  • Usa detalles visuales y sonoros concretos en lugar de palabras como "cinematic" o "beautiful".[3]
  • Describe el sonido: ambiente de la sala, sonidos de acción y a qué distancia están. Escribe no music si no quieres música de fondo.[4]
  • Mantén el diálogo corto, una frase cada pocos segundos: entre comillas en un prompt simple, dentro de etiquetas <d> en la forma estructurada.
  • Fija el seed y cambia una sola cosa cada vez que retoques un plano.[4]
  • Con keyframes, indica cómo se conecta el primer o el último fotograma con la acción.[3]

La página de SD Video tiene un playground para probar prompts, y la referencia de la API enumera todos los parámetros, incluido prompt_enhancement.

Preguntas sobre prompts

¿Los prompts de MiniMax H3 deben estar en inglés?

Las indicaciones oficiales escriben las secciones descriptivas en inglés y mantienen el diálogo, las letras y el texto en pantalla en su idioma original.[3] El diálogo en otro idioma va dentro de la etiqueta <d> con su etiqueta de idioma.

¿Qué es H3-Context-IR?

Es el paso de preprocesado de MiniMax que lee el texto y los medios que envías y los reescribe en la representación estructurada a partir de la cual genera H3. No forma parte de la versión de código abierto; MiniMax lo ofrece como API y publica las indicaciones de prompt para que los desarrolladores puedan crear el suyo.[1][5]

¿Qué hace prompt_enhancement en SD Video?

Controla la reescritura de tu prompt antes de generar: turbo (por defecto), quality o disabled para enviar tu texto tal cual. La reescritura no cambia las etiquetas de referencia como <Picture 1>.[4]

¿Qué longitud debe tener un prompt de MiniMax H3?

La suficiente para cubrir toda la línea de tiempo. Los ejemplos reescritos por la propia MiniMax llegan a varios cientos de palabras para un solo clip, y las indicaciones de SD Video señalan que el detalle no penaliza.[1][4]

Referencias

  1. MiniMax. Ficha del modelo MiniMax-H3. Consultado el 4 de octubre de 2026 en huggingface.co.
  2. MiniMax. h3-prompt-writing: base mode reference (references/base-en.txt). Consultado el 4 de octubre de 2026 en github.com.
  3. MiniMax. Skill H3 Prompt Writing. Consultado el 4 de octubre de 2026 en github.com.
  4. SeedRouter. SD Video API reference. Consultado el 4 de octubre de 2026 en seedrouter.ai.
  5. MiniMax. Create H3-Context-IR Task. Consultado el 4 de octubre de 2026 en platform.minimax.io.

Guías relacionadas