MiniMax H3
Genera con MiniMax H3 clips de 4 a 15 segundos con sonido en 768P o 2K: texto a vídeo, primer y último fotograma, y referencias a vídeo, en el formato de solicitud oficial de MiniMax, entregados como tarea.
MiniMax H3 (Hailuo 03) es el modelo de vídeo multimodal de MiniMax. Una sola solicitud crea la imagen y el sonido a la vez: un clip de 4 a 15 segundos en 768P o 2K con su propio diálogo, ambiente y efectos. El cuerpo de la solicitud es el formato oficial de MiniMax con el ID de modelo minimax-h3. Envíalo, guarda el identificador de tarea devuelto y lee el vídeo terminado desde la tarea. Los fotogramas y las referencias se envían como URL.
ID de modelo
| ID de modelo | Entradas | Resoluciones | Duración |
|---|---|---|---|
minimax-h3 | texto, primer y último fotograma, imágenes, vídeos y audio de referencia | 768P, 2K | De 4 a 15 segundos |
Consulta la página del modelo para ver los precios actuales.
Ejemplo rápido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "A small sailboat glides across a calm turquoise bay at sunrise, seagulls in the distance, the sound of water and wind. No text, no logos."}
],
"resolution": "768P",
"duration": 5,
"ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Encabezado | Valor |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
La respuesta es una tarea ({"id": "task_...", "status": "processing"}), no el vídeo terminado. Consulta GET /v1/tasks/{task_id} para obtener el resultado. Guarda las claves de API en código del lado del servidor.
Parámetros
| Campo | Tipo | Por defecto | Notas |
|---|---|---|---|
model | string | obligatorio | minimax-h3 |
content | array | obligatorio | El prompt y los archivos multimedia, como elementos descritos abajo. Exactamente un elemento text no vacío. |
resolution | enum | obligatorio | 768P o 2K. |
duration | integer | obligatorio | Cualquier entero de 4 a 15 segundos. |
ratio | enum | según la entrada | adaptive, 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Obligatorio solo con texto, donde no se acepta adaptive. |
content_filter | boolean | true | El filtro de contenido de SeedRouter, descrito abajo. No se envía al modelo. |
El esquema es estricto: los campos desconocidos se rechazan en lugar de ignorarse. callback_url no está disponible; consulta la tarea en su lugar. extra pertenece a MiniMax-H3-Max y no se acepta para este modelo.
Elementos de content
type | Elemento | role |
|---|---|---|
text | {"type": "text", "text": "..."}, hasta 7000 caracteres | ninguno |
image_url | {"type": "image_url", "image_url": {"url": "https://..."}, "role": "..."} | first_frame, last_frame o reference_image |
video_url | {"type": "video_url", "video_url": {"url": "https://..."}, "role": "reference_video"} | reference_video |
audio_url | {"type": "audio_url", "audio_url": {"url": "https://..."}, "role": "reference_audio"} | reference_audio |
Una sola imagen sin role es el primer fotograma. Con más de una imagen, cada imagen necesita un role.
Modos
Los elementos de content deciden el modo; no hay un campo de modo.
| Modo | content contiene | ratio |
|---|---|---|
| Texto a vídeo | un elemento text | obligatorio, no adaptive |
| Imagen a vídeo | text más una imagen first_frame y/o last_frame | cualquier valor se trata como adaptive: la imagen define la forma |
| Referencias a vídeo | text más cualquier combinación de hasta 9 elementos reference_image, 3 reference_video y 3 reference_audio | opcional, adaptive por defecto |
Los fotogramas y las referencias no se pueden combinar en una misma solicitud.
{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "The person in the photo speaks to camera: Follow the wind. Voice follows the reference audio."},
{"type": "image_url", "image_url": {"url": "https://example.com/person.jpg"}, "role": "reference_image"},
{"type": "audio_url", "audio_url": {"url": "https://example.com/voice.mp3"}, "role": "reference_audio"}
],
"resolution": "2K",
"duration": 6
}Entradas multimedia
Cada elemento de imagen, vídeo y audio es una URL HTTP(S) pública. No se aceptan data URI en base64 ni identificadores mm_file://: sube el archivo a tu propio almacenamiento y pasa su URL.
| Entrada | Formato | Límites |
|---|---|---|
| Imagen | JPG, JPEG, PNG, WebP, HEIC, HEIF | 30 MB o menos; cada lado de 256 a 5760 px; ancho / alto de 0,4 a 2,5 |
| Vídeo | MP4, MOV (H.264 o H.265) | 50 MB o menos; de 2 a 15 segundos cada uno, 15 segundos en total; cada lado de 256 a 5760 px; ancho / alto de 0,4 a 2,5; de 23,976 a 60 fps |
| Audio | WAV, MP3 | 15 MB o menos; de 2 a 15 segundos cada uno, 15 segundos en total |
Los vídeos de referencia se miden cuando se acepta la solicitud; uno cuya duración no se puede leer se rechaza sin cobrar nada. Los demás límites se comprueban antes de generar, y una solicitud que incumple alguno falla sin coste.
Filtro de contenido
content_filter es true salvo que lo cambies. Con el filtro activado, el texto, cada imagen y tres fotogramas de cada vídeo de referencia (el primero, el central y el último) se revisan antes de que se ejecute el modelo. Una solicitud marcada falla con el código 60001 y no se cobra; lo mismo ocurre con una solicitud que no se puede revisar. El audio de referencia no se revisa. Establece content_filter en false para omitir la revisión; el Playground del sitio web siempre lo mantiene activado.
Factores de coste
Consulta la sección de precios del modelo para ver las tarifas actuales. MiniMax H3 se factura por segundo de vídeo, con una tarifa que fija la resolución de salida, más las imágenes de entrada a partir de la sexta:
billed seconds = duration + ceil(Σ each reference video's seconds)
extra images = max(0, number of images − 5)
cost = billed seconds × rate per second + extra images × rate per imageLos primeros fotogramas, los últimos fotogramas y las imágenes de referencia cuentan como imágenes. El audio de referencia no se factura. Ambas cantidades se conocen cuando se acepta la solicitud, así que el importe reservado es el importe cobrado. Consulta los cargos definitivos en el historial de uso de tu cuenta. Las tareas fallidas no se cobran.
Esquema de salida
El envío devuelve la tarea:
{"id": "task_...", "model": "minimax-h3", "status": "processing", "created_at": 1789689600}Consultar la tarea
GET https://api.seedrouter.ai/v1/tasks/{task_id}Sondea cada 10–20 segundos hasta que status sea completed o failed. Que se agote el tiempo de red durante el sondeo no significa que la generación haya fallado: conserva el identificador de tarea y reanuda la comprobación. No crees otra tarea para consultar el progreso.
Tarea completada
{
"id": "task_...",
"model": "minimax-h3",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689740,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"resolution": "768P",
"ratio": "16:9",
"duration": 5
}
}ratio es la relación de aspecto con la que se creó el clip, incluida la elegida para adaptive. En nuestra prueba, un clip de 4 segundos en 768P a 16:9 llegó como MP4 (H.264) a 1344 × 768 y 24 fps, con una pista AAC estéreo a 32 kHz.
Errores
Las solicitudes rechazadas antes de crear una tarea devuelven un error HTTP con un objeto error y no se cobran. Una tarea que falla después de aceptarse devuelve HTTP 200 al consultarla, con status: "failed" y un objeto error.
Consulta el catálogo de errores común para ver códigos, estados HTTP y pautas de reintento.
{
"id": "task_...",
"model": "minimax-h3",
"status": "failed",
"error": {
"code": 60001,
"message": "the request was blocked by content moderation"
}
}Si el propio envío agota el tiempo de espera, revisa tus tareas antes de volver a enviar: puede que la primera solicitud se haya aceptado.
Consejos
- Describe el plano y su sonido juntos: sujeto, lugar, cámara, luz, diálogo y efectos.
- Escribe el diálogo en el prompt y adjunta un clip de audio de referencia cuando la voz deba seguirlo.
- Haz el borrador en
768Py luego renderiza el plano final en2Kcon la misma solicitud. - Usa un primer y un último fotograma para controlar dónde empieza y termina un plano; usa referencias para mantener un producto, una persona o un movimiento.
- Añade
no text, no logospara evitar marcas inventadas.
