Claude Opus 5.5 ya está disponible en SeedRouter
SeedRouter Docs

MiniMax H3

Genera con MiniMax H3 clips de 4 a 15 segundos con sonido en 768P o 2K: texto a vídeo, primer y último fotograma, y referencias a vídeo, en el formato de solicitud oficial de MiniMax, entregados como tarea.

View Markdown

MiniMax H3 (Hailuo 03) es el modelo de vídeo multimodal de MiniMax. Una sola solicitud crea la imagen y el sonido a la vez: un clip de 4 a 15 segundos en 768P o 2K con su propio diálogo, ambiente y efectos. El cuerpo de la solicitud es el formato oficial de MiniMax con el ID de modelo minimax-h3. Envíalo, guarda el identificador de tarea devuelto y lee el vídeo terminado desde la tarea. Los fotogramas y las referencias se envían como URL.

ID de modelo

ID de modeloEntradasResolucionesDuración
minimax-h3texto, primer y último fotograma, imágenes, vídeos y audio de referencia768P, 2KDe 4 a 15 segundos

Consulta la página del modelo para ver los precios actuales.

Ejemplo rápido

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-h3",
    "content": [
      {"type": "text", "text": "A small sailboat glides across a calm turquoise bay at sunrise, seagulls in the distance, the sound of water and wind. No text, no logos."}
    ],
    "resolution": "768P",
    "duration": 5,
    "ratio": "16:9"
  }'

Endpoint

POST https://api.seedrouter.ai/v1/videos/generations
EncabezadoValor
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

La respuesta es una tarea ({"id": "task_...", "status": "processing"}), no el vídeo terminado. Consulta GET /v1/tasks/{task_id} para obtener el resultado. Guarda las claves de API en código del lado del servidor.

Parámetros

CampoTipoPor defectoNotas
modelstringobligatoriominimax-h3
contentarrayobligatorioEl prompt y los archivos multimedia, como elementos descritos abajo. Exactamente un elemento text no vacío.
resolutionenumobligatorio768P o 2K.
durationintegerobligatorioCualquier entero de 4 a 15 segundos.
ratioenumsegún la entradaadaptive, 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Obligatorio solo con texto, donde no se acepta adaptive.
content_filterbooleantrueEl filtro de contenido de SeedRouter, descrito abajo. No se envía al modelo.

El esquema es estricto: los campos desconocidos se rechazan en lugar de ignorarse. callback_url no está disponible; consulta la tarea en su lugar. extra pertenece a MiniMax-H3-Max y no se acepta para este modelo.

Elementos de content

typeElementorole
text{"type": "text", "text": "..."}, hasta 7000 caracteresninguno
image_url{"type": "image_url", "image_url": {"url": "https://..."}, "role": "..."}first_frame, last_frame o reference_image
video_url{"type": "video_url", "video_url": {"url": "https://..."}, "role": "reference_video"}reference_video
audio_url{"type": "audio_url", "audio_url": {"url": "https://..."}, "role": "reference_audio"}reference_audio

Una sola imagen sin role es el primer fotograma. Con más de una imagen, cada imagen necesita un role.

Modos

Los elementos de content deciden el modo; no hay un campo de modo.

Modocontent contieneratio
Texto a vídeoun elemento textobligatorio, no adaptive
Imagen a vídeotext más una imagen first_frame y/o last_framecualquier valor se trata como adaptive: la imagen define la forma
Referencias a vídeotext más cualquier combinación de hasta 9 elementos reference_image, 3 reference_video y 3 reference_audioopcional, adaptive por defecto

Los fotogramas y las referencias no se pueden combinar en una misma solicitud.

{
  "model": "minimax-h3",
  "content": [
    {"type": "text", "text": "The person in the photo speaks to camera: Follow the wind. Voice follows the reference audio."},
    {"type": "image_url", "image_url": {"url": "https://example.com/person.jpg"}, "role": "reference_image"},
    {"type": "audio_url", "audio_url": {"url": "https://example.com/voice.mp3"}, "role": "reference_audio"}
  ],
  "resolution": "2K",
  "duration": 6
}

Entradas multimedia

Cada elemento de imagen, vídeo y audio es una URL HTTP(S) pública. No se aceptan data URI en base64 ni identificadores mm_file://: sube el archivo a tu propio almacenamiento y pasa su URL.

EntradaFormatoLímites
ImagenJPG, JPEG, PNG, WebP, HEIC, HEIF30 MB o menos; cada lado de 256 a 5760 px; ancho / alto de 0,4 a 2,5
VídeoMP4, MOV (H.264 o H.265)50 MB o menos; de 2 a 15 segundos cada uno, 15 segundos en total; cada lado de 256 a 5760 px; ancho / alto de 0,4 a 2,5; de 23,976 a 60 fps
AudioWAV, MP315 MB o menos; de 2 a 15 segundos cada uno, 15 segundos en total

Los vídeos de referencia se miden cuando se acepta la solicitud; uno cuya duración no se puede leer se rechaza sin cobrar nada. Los demás límites se comprueban antes de generar, y una solicitud que incumple alguno falla sin coste.

Filtro de contenido

content_filter es true salvo que lo cambies. Con el filtro activado, el texto, cada imagen y tres fotogramas de cada vídeo de referencia (el primero, el central y el último) se revisan antes de que se ejecute el modelo. Una solicitud marcada falla con el código 60001 y no se cobra; lo mismo ocurre con una solicitud que no se puede revisar. El audio de referencia no se revisa. Establece content_filter en false para omitir la revisión; el Playground del sitio web siempre lo mantiene activado.

Factores de coste

Consulta la sección de precios del modelo para ver las tarifas actuales. MiniMax H3 se factura por segundo de vídeo, con una tarifa que fija la resolución de salida, más las imágenes de entrada a partir de la sexta:

billed seconds = duration + ceil(Σ each reference video's seconds)
extra images   = max(0, number of images − 5)
cost = billed seconds × rate per second + extra images × rate per image

Los primeros fotogramas, los últimos fotogramas y las imágenes de referencia cuentan como imágenes. El audio de referencia no se factura. Ambas cantidades se conocen cuando se acepta la solicitud, así que el importe reservado es el importe cobrado. Consulta los cargos definitivos en el historial de uso de tu cuenta. Las tareas fallidas no se cobran.

Esquema de salida

El envío devuelve la tarea:

{"id": "task_...", "model": "minimax-h3", "status": "processing", "created_at": 1789689600}

Consultar la tarea

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Sondea cada 10–20 segundos hasta que status sea completed o failed. Que se agote el tiempo de red durante el sondeo no significa que la generación haya fallado: conserva el identificador de tarea y reanuda la comprobación. No crees otra tarea para consultar el progreso.

Tarea completada

{
  "id": "task_...",
  "model": "minimax-h3",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689740,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "resolution": "768P",
    "ratio": "16:9",
    "duration": 5
  }
}

ratio es la relación de aspecto con la que se creó el clip, incluida la elegida para adaptive. En nuestra prueba, un clip de 4 segundos en 768P a 16:9 llegó como MP4 (H.264) a 1344 × 768 y 24 fps, con una pista AAC estéreo a 32 kHz.

Errores

Las solicitudes rechazadas antes de crear una tarea devuelven un error HTTP con un objeto error y no se cobran. Una tarea que falla después de aceptarse devuelve HTTP 200 al consultarla, con status: "failed" y un objeto error.

Consulta el catálogo de errores común para ver códigos, estados HTTP y pautas de reintento.

{
  "id": "task_...",
  "model": "minimax-h3",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "the request was blocked by content moderation"
  }
}

Si el propio envío agota el tiempo de espera, revisa tus tareas antes de volver a enviar: puede que la primera solicitud se haya aceptado.

Consejos

  • Describe el plano y su sonido juntos: sujeto, lugar, cámara, luz, diálogo y efectos.
  • Escribe el diálogo en el prompt y adjunta un clip de audio de referencia cuando la voz deba seguirlo.
  • Haz el borrador en 768P y luego renderiza el plano final en 2K con la misma solicitud.
  • Usa un primer y un último fotograma para controlar dónde empieza y termina un plano; usa referencias para mantener un producto, una persona o un movimiento.
  • Añade no text, no logos para evitar marcas inventadas.

Relacionado