SD Video
Genera con SD Video clips de 5 a 15 segundos con diálogo y sonido a juego: texto a vídeo, imagen a vídeo y referencias a vídeo en 480p o 768p, entregados como tarea.
SD Video es el modelo de generación de vídeo de SeedRouter, basado en MiniMax H3. Una sola solicitud crea toda la escena, imagen y sonido a la vez: un clip de 5 a 15 segundos con su propio diálogo, ambiente y efectos. Envía la solicitud, guarda el identificador de tarea devuelto y lee el vídeo terminado desde la tarea. Los primeros fotogramas y las referencias se envían como URL.
ID de modelo
| ID de modelo | Modos | Resoluciones | Duración |
|---|---|---|---|
sd-video | text_to_video, image_to_video, reference_to_video | 480p, 768p | De 5 a 15 segundos |
Consulta la página del modelo para ver los precios actuales.
Ejemplo rápido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sd-video",
"mode": "text_to_video",
"prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
"duration": 5,
"resolution": "768p",
"aspect_ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Encabezado | Valor |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
La respuesta es una tarea ({"id": "task_...", "status": "processing"}), no el vídeo terminado. Consulta GET /v1/tasks/{task_id} para obtener el resultado. Guarda las claves de API en código del lado del servidor.
Parámetros
| Campo | Tipo | Por defecto | Notas |
|---|---|---|---|
model | string | obligatorio | sd-video |
mode | enum | reference_to_video | text_to_video, image_to_video, reference_to_video. Se aceptan las formas cortas t2v, i2v y ref2va. |
prompt | string | obligatorio | De 1 a 32.000 caracteres. Describe la imagen y el sonido. |
duration | integer | 5 | Cualquier entero de 5 a 15 segundos. |
resolution | enum | 768p | 480p o 768p. |
aspect_ratio | enum | según el modo | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, más adaptive en reference_to_video. image_to_video sigue al primer fotograma. |
prompt_enhancement | enum | turbo | turbo, quality o disabled. |
seed | integer | aleatorio | Entero sin signo de 32 bits. Fíjalo para repetir un plano. |
image | referencia | Solo en image_to_video, donde es obligatorio. El primer fotograma. | |
reference_images | array | [] | Solo en reference_to_video. Hasta 9. |
reference_videos | array | [] | Solo en reference_to_video. Hasta 3. |
reference_audio | array | [] | Solo en reference_to_video. Hasta 3. |
El esquema es estricto: los campos desconocidos se rechazan en lugar de ignorarse. callback_url y callback_id no están disponibles; consulta la tarea en su lugar.
Modos
mode define cómo se condiciona el modelo. Cada modo tiene sus propios campos; un campo de otro modo devuelve 400 cuando lleva un valor (una lista vacía o null se admiten).
| Modo | Requiere | Admite |
|---|---|---|
text_to_video | prompt | los campos comunes |
image_to_video | prompt e image | image como primer fotograma |
reference_to_video (por defecto) | prompt y al menos una imagen o un vídeo de referencia | reference_images, reference_videos, reference_audio |
image_to_video trata la imagen como el primer fotograma literal, así que el clip empieza exactamente como esa imagen fija. Para colocar un producto o una persona en una escena propia, usa reference_to_video y describe la escena a su alrededor.
Referencias y etiquetas en el prompt
En reference_to_video, el orden de la lista se convierte en la etiqueta que usas en el prompt. La primera entrada de reference_images es <Picture 1>, la segunda es <Picture 2>; la primera entrada de reference_videos es <Video 1>, y así sucesivamente. Las imágenes, los vídeos y el audio se numeran por separado. La mejora del prompt puede reformular el resto del prompt, pero no estas etiquetas; establece prompt_enhancement en disabled para conservar tu texto tal como lo escribiste.
{
"model": "sd-video",
"mode": "reference_to_video",
"prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
"reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
"duration": 10
}Entradas multimedia
Cada referencia, y el primer fotograma de image_to_video, es un objeto con una URL HTTP(S) pública:
{ "type": "url", "url": "https://example.com/photo.jpg" }| Entrada | Tamaño máximo |
|---|---|
| Imagen | 16 MB |
| Vídeo o audio | 32 MB |
Como máximo 9 imágenes, 3 vídeos y 3 audios, 12 referencias en total. No se aceptan datos en base64 ni identificadores de recursos: sube el archivo a tu propio almacenamiento y pasa su URL. La URL debe ser accesible sin redirecciones.
Factores de coste
Consulta la sección de precios del modelo para ver las tarifas actuales. SD Video se factura por segundo de vídeo, con una tarifa que fijan el modo y la resolución de salida:
billed seconds = duration (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5)) (reference_to_video)
cost = billed seconds × rate per secondCada vídeo de referencia suma su duración hasta 5 segundos; un clip más largo suma igualmente 5. Las imágenes y el audio de referencia no se facturan. Los vídeos de referencia se miden cuando se acepta la solicitud, así que el importe reservado es el importe cobrado. Consulta los cargos definitivos en el historial de uso de tu cuenta. Las tareas fallidas no se cobran.
Esquema de salida
El envío devuelve la tarea:
{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}Consultar la tarea
GET https://api.seedrouter.ai/v1/tasks/{task_id}Sondea cada 10–20 segundos hasta que status sea completed o failed. Que se agote el tiempo de red durante el sondeo no significa que la generación haya fallado: conserva el identificador de tarea y reanuda la comprobación. No crees otra tarea para consultar el progreso.
Tarea completada
{
"id": "task_...",
"model": "sd-video",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689720,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"duration": 5,
"width": 1344,
"height": 768,
"aspect_ratio": "16:9",
"seed": 42
}
}El vídeo es MP4 (H.264) a 24 fps con audio AAC estéreo a 32 kHz. Con un aspect_ratio explícito, el tamaño es fijo:
aspect_ratio | 768p | 480p |
|---|---|---|
21:9 | 1536 × 672 | 960 × 416 |
16:9 | 1344 × 768 | 832 × 480 |
4:3 | 1024 × 768 | 640 × 480 |
1:1 | 768 × 768 | 480 × 480 |
3:4 | 768 × 1024 | 480 × 640 |
9:16 | 768 × 1344 | 480 × 832 |
text_to_video usa 16:9 por defecto. reference_to_video usa adaptive por defecto: la forma de la primera imagen de referencia, o del primer vídeo de referencia si no hay imágenes. image_to_video siempre sigue al primer fotograma, incluida su orientación EXIF; recorta la imagen para cambiar la forma. Un clip adaptativo conserva la forma de la fuente, escalada al lado corto de la resolución con cada lado redondeado a un múltiplo de 32, e informa aspect_ratio como la proporción de píxeles reducida, por ejemplo 23:15.
La tarea completada informa la seed que usó. El mismo prompt con la misma semilla devuelve el mismo clip; si omites seed, cada solicitud elige una nueva.
Errores
Las solicitudes rechazadas antes de crear una tarea devuelven un error HTTP con un objeto error y no se cobran. Una tarea que falla después de aceptarse devuelve HTTP 200 al consultarla, con status: "failed" y un objeto error.
Consulta el catálogo de errores común para ver códigos, estados HTTP y pautas de reintento.
{
"id": "task_...",
"model": "sd-video",
"status": "failed",
"error": {
"code": 60001,
"message": "The request was rejected by the content policy. Please revise the prompt or input images."
}
}Si el propio envío agota el tiempo de espera, revisa tus tareas antes de volver a enviar: puede que la primera solicitud se haya aceptado.
Consejos
- Escribe prompts largos. Unos cientos de caracteres o más dan mejores resultados; el detalle no penaliza.
- Nombra la cámara, no el ambiente: un cuerpo, un objetivo y una apertura cambian la imagen; «cinematic» casi no hace nada.
- Describe el sonido: ambiente de la sala, efectos y su distancia. Escribe
no musicsi no quieres una base musical. El diálogo cabe a unas 2,5 palabras por segundo. - Añade
no logos, brand names, printed words or badges anywhere in framepara evitar marcas inventadas. - Mantén las letras cortas y escritas tal cual, e indica que son las únicas letras del encuadre.
- Prioriza la quietud: un sujeto, un lugar, una cámara fija. El trabajo de manos en primer plano y el movimiento suave como el pelo o el papel son los puntos más débiles.
- Fija
seedy cambia una sola cláusula cada vez para iterar sobre un plano.
