Claude Opus 5.5 ya está disponible en SeedRouter
SeedRouter Docs

SD Video

Genera con SD Video clips de 5 a 15 segundos con diálogo y sonido a juego: texto a vídeo, imagen a vídeo y referencias a vídeo en 480p o 768p, entregados como tarea.

View Markdown

SD Video es el modelo de generación de vídeo de SeedRouter, basado en MiniMax H3. Una sola solicitud crea toda la escena, imagen y sonido a la vez: un clip de 5 a 15 segundos con su propio diálogo, ambiente y efectos. Envía la solicitud, guarda el identificador de tarea devuelto y lee el vídeo terminado desde la tarea. Los primeros fotogramas y las referencias se envían como URL.

ID de modelo

ID de modeloModosResolucionesDuración
sd-videotext_to_video, image_to_video, reference_to_video480p, 768pDe 5 a 15 segundos

Consulta la página del modelo para ver los precios actuales.

Ejemplo rápido

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "sd-video",
    "mode": "text_to_video",
    "prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
    "duration": 5,
    "resolution": "768p",
    "aspect_ratio": "16:9"
  }'

Endpoint

POST https://api.seedrouter.ai/v1/videos/generations
EncabezadoValor
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

La respuesta es una tarea ({"id": "task_...", "status": "processing"}), no el vídeo terminado. Consulta GET /v1/tasks/{task_id} para obtener el resultado. Guarda las claves de API en código del lado del servidor.

Parámetros

CampoTipoPor defectoNotas
modelstringobligatoriosd-video
modeenumreference_to_videotext_to_video, image_to_video, reference_to_video. Se aceptan las formas cortas t2v, i2v y ref2va.
promptstringobligatorioDe 1 a 32.000 caracteres. Describe la imagen y el sonido.
durationinteger5Cualquier entero de 5 a 15 segundos.
resolutionenum768p480p o 768p.
aspect_ratioenumsegún el modo21:9, 16:9, 4:3, 1:1, 3:4, 9:16, más adaptive en reference_to_video. image_to_video sigue al primer fotograma.
prompt_enhancementenumturboturbo, quality o disabled.
seedintegeraleatorioEntero sin signo de 32 bits. Fíjalo para repetir un plano.
imagereferenciaSolo en image_to_video, donde es obligatorio. El primer fotograma.
reference_imagesarray[]Solo en reference_to_video. Hasta 9.
reference_videosarray[]Solo en reference_to_video. Hasta 3.
reference_audioarray[]Solo en reference_to_video. Hasta 3.

El esquema es estricto: los campos desconocidos se rechazan en lugar de ignorarse. callback_url y callback_id no están disponibles; consulta la tarea en su lugar.

Modos

mode define cómo se condiciona el modelo. Cada modo tiene sus propios campos; un campo de otro modo devuelve 400 cuando lleva un valor (una lista vacía o null se admiten).

ModoRequiereAdmite
text_to_videopromptlos campos comunes
image_to_videoprompt e imageimage como primer fotograma
reference_to_video (por defecto)prompt y al menos una imagen o un vídeo de referenciareference_images, reference_videos, reference_audio

image_to_video trata la imagen como el primer fotograma literal, así que el clip empieza exactamente como esa imagen fija. Para colocar un producto o una persona en una escena propia, usa reference_to_video y describe la escena a su alrededor.

Referencias y etiquetas en el prompt

En reference_to_video, el orden de la lista se convierte en la etiqueta que usas en el prompt. La primera entrada de reference_images es <Picture 1>, la segunda es <Picture 2>; la primera entrada de reference_videos es <Video 1>, y así sucesivamente. Las imágenes, los vídeos y el audio se numeran por separado. La mejora del prompt puede reformular el resto del prompt, pero no estas etiquetas; establece prompt_enhancement en disabled para conservar tu texto tal como lo escribiste.

{
  "model": "sd-video",
  "mode": "reference_to_video",
  "prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
  "reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
  "duration": 10
}

Entradas multimedia

Cada referencia, y el primer fotograma de image_to_video, es un objeto con una URL HTTP(S) pública:

{ "type": "url", "url": "https://example.com/photo.jpg" }
EntradaTamaño máximo
Imagen16 MB
Vídeo o audio32 MB

Como máximo 9 imágenes, 3 vídeos y 3 audios, 12 referencias en total. No se aceptan datos en base64 ni identificadores de recursos: sube el archivo a tu propio almacenamiento y pasa su URL. La URL debe ser accesible sin redirecciones.

Factores de coste

Consulta la sección de precios del modelo para ver las tarifas actuales. SD Video se factura por segundo de vídeo, con una tarifa que fijan el modo y la resolución de salida:

billed seconds = duration                                                   (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5))  (reference_to_video)
cost = billed seconds × rate per second

Cada vídeo de referencia suma su duración hasta 5 segundos; un clip más largo suma igualmente 5. Las imágenes y el audio de referencia no se facturan. Los vídeos de referencia se miden cuando se acepta la solicitud, así que el importe reservado es el importe cobrado. Consulta los cargos definitivos en el historial de uso de tu cuenta. Las tareas fallidas no se cobran.

Esquema de salida

El envío devuelve la tarea:

{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}

Consultar la tarea

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Sondea cada 10–20 segundos hasta que status sea completed o failed. Que se agote el tiempo de red durante el sondeo no significa que la generación haya fallado: conserva el identificador de tarea y reanuda la comprobación. No crees otra tarea para consultar el progreso.

Tarea completada

{
  "id": "task_...",
  "model": "sd-video",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689720,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "duration": 5,
    "width": 1344,
    "height": 768,
    "aspect_ratio": "16:9",
    "seed": 42
  }
}

El vídeo es MP4 (H.264) a 24 fps con audio AAC estéreo a 32 kHz. Con un aspect_ratio explícito, el tamaño es fijo:

aspect_ratio768p480p
21:91536 × 672960 × 416
16:91344 × 768832 × 480
4:31024 × 768640 × 480
1:1768 × 768480 × 480
3:4768 × 1024480 × 640
9:16768 × 1344480 × 832

text_to_video usa 16:9 por defecto. reference_to_video usa adaptive por defecto: la forma de la primera imagen de referencia, o del primer vídeo de referencia si no hay imágenes. image_to_video siempre sigue al primer fotograma, incluida su orientación EXIF; recorta la imagen para cambiar la forma. Un clip adaptativo conserva la forma de la fuente, escalada al lado corto de la resolución con cada lado redondeado a un múltiplo de 32, e informa aspect_ratio como la proporción de píxeles reducida, por ejemplo 23:15.

La tarea completada informa la seed que usó. El mismo prompt con la misma semilla devuelve el mismo clip; si omites seed, cada solicitud elige una nueva.

Errores

Las solicitudes rechazadas antes de crear una tarea devuelven un error HTTP con un objeto error y no se cobran. Una tarea que falla después de aceptarse devuelve HTTP 200 al consultarla, con status: "failed" y un objeto error.

Consulta el catálogo de errores común para ver códigos, estados HTTP y pautas de reintento.

{
  "id": "task_...",
  "model": "sd-video",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "The request was rejected by the content policy. Please revise the prompt or input images."
  }
}

Si el propio envío agota el tiempo de espera, revisa tus tareas antes de volver a enviar: puede que la primera solicitud se haya aceptado.

Consejos

  • Escribe prompts largos. Unos cientos de caracteres o más dan mejores resultados; el detalle no penaliza.
  • Nombra la cámara, no el ambiente: un cuerpo, un objetivo y una apertura cambian la imagen; «cinematic» casi no hace nada.
  • Describe el sonido: ambiente de la sala, efectos y su distancia. Escribe no music si no quieres una base musical. El diálogo cabe a unas 2,5 palabras por segundo.
  • Añade no logos, brand names, printed words or badges anywhere in frame para evitar marcas inventadas.
  • Mantén las letras cortas y escritas tal cual, e indica que son las únicas letras del encuadre.
  • Prioriza la quietud: un sujeto, un lugar, una cámara fija. El trabajo de manos en primer plano y el movimiento suave como el pelo o el papel son los puntos más débiles.
  • Fija seed y cambia una sola cláusula cada vez para iterar sobre un plano.

Relacionado