Claude Opus 5.5 è disponibile su SeedRouter
SeedRouter Docs

SD Video

Genera con SD Video clip di 5–15 secondi con dialoghi e audio coerenti: da testo a video, da immagine a video e da riferimenti a video a 480p o 768p, consegnati come attività.

View Markdown

SD Video è il modello di generazione video di SeedRouter, basato su MiniMax H3. Una sola richiesta crea l'intera scena, immagine e audio insieme: una clip di 5–15 secondi con dialoghi, ambiente ed effetti propri. Invia la richiesta, conserva l'ID attività restituito e leggi il video finito dall'attività. Primi fotogrammi e riferimenti vengono passati come URL.

ID modello

ID modelloModalitàRisoluzioniDurata
sd-videotext_to_video, image_to_video, reference_to_video480p, 768p5–15 secondi

Consulta la pagina del modello per i prezzi attuali.

Esempio rapido

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "sd-video",
    "mode": "text_to_video",
    "prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
    "duration": 5,
    "resolution": "768p",
    "aspect_ratio": "16:9"
  }'

Endpoint

POST https://api.seedrouter.ai/v1/videos/generations
IntestazioneValore
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

La risposta è un'attività ({"id": "task_...", "status": "processing"}), non il video finito. Interroga GET /v1/tasks/{task_id} per ottenere il risultato. Conserva le chiavi API nel codice lato server.

Parametri

CampoTipoPredefinitoNote
modelstringobbligatoriosd-video
modeenumreference_to_videotext_to_video, image_to_video, reference_to_video. Sono accettate le forme brevi t2v, i2v e ref2va.
promptstringobbligatorioDa 1 a 32.000 caratteri. Descrive immagine e audio.
durationinteger5Qualsiasi intero da 5 a 15 secondi.
resolutionenum768p480p o 768p.
aspect_ratioenumdipende dalla modalità21:9, 16:9, 4:3, 1:1, 3:4, 9:16, più adaptive in reference_to_video. image_to_video segue il primo fotogramma.
prompt_enhancementenumturboturbo, quality o disabled.
seedintegercasualeIntero senza segno a 32 bit. Impostalo per ripetere un'inquadratura.
imageriferimentoSolo in image_to_video, dove è obbligatorio. Il primo fotogramma.
reference_imagesarray[]Solo in reference_to_video. Fino a 9.
reference_videosarray[]Solo in reference_to_video. Fino a 3.
reference_audioarray[]Solo in reference_to_video. Fino a 3.

Lo schema è rigoroso: i campi sconosciuti vengono rifiutati invece che ignorati. callback_url e callback_id non sono disponibili; interroga invece l'attività.

Modalità

mode stabilisce come viene condizionato il modello. Ogni modalità ha i propri campi; un campo di un'altra modalità restituisce 400 quando contiene un valore (una lista vuota o null è accettata).

ModalitàRichiedeAccetta
text_to_videoprompti campi comuni
image_to_videoprompt e imageimage come primo fotogramma
reference_to_video (predefinita)prompt e almeno un'immagine o un video di riferimentoreference_images, reference_videos, reference_audio

image_to_video tratta l'immagine come primo fotogramma letterale, quindi la clip si apre esattamente come appare quell'immagine fissa. Per inserire un prodotto o una persona in una scena tua, usa reference_to_video e descrivi la scena intorno.

Riferimenti ed etichette nel prompt

In reference_to_video, l'ordine della lista diventa l'etichetta da usare nel prompt. La prima voce di reference_images è <Picture 1>, la seconda è <Picture 2>; la prima voce di reference_videos è <Video 1> e così via. Immagini, video e audio sono numerati separatamente. Il miglioramento del prompt può riformulare il resto del prompt, ma non queste etichette; imposta prompt_enhancement su disabled per mantenere il testo così come l'hai scritto.

{
  "model": "sd-video",
  "mode": "reference_to_video",
  "prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
  "reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
  "duration": 10
}

Input multimediali

Ogni riferimento, e il primo fotogramma di image_to_video, è un oggetto con un URL HTTP(S) pubblico:

{ "type": "url", "url": "https://example.com/photo.jpg" }
InputDimensione massima
Immagine16 MB
Video o audio32 MB

Al massimo 9 immagini, 3 video e 3 clip audio, 12 riferimenti in totale. Dati in base64 e ID di asset non sono accettati: carica il file nel tuo storage e passa il suo URL. L'URL deve essere raggiungibile senza reindirizzamenti.

Fattori di costo

Consulta la sezione prezzi del modello per le tariffe attuali. SD Video si paga per secondo di video, con una tariffa che dipende dalla modalità e dalla risoluzione di output:

billed seconds = duration                                                   (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5))  (reference_to_video)
cost = billed seconds × rate per second

Ogni video di riferimento aggiunge la propria durata fino a 5 secondi; una clip più lunga aggiunge comunque 5. Immagini e audio di riferimento non vengono addebitati. I video di riferimento vengono misurati quando la richiesta è accettata, quindi l'importo riservato è l'importo addebitato. Consulta gli addebiti definitivi nella cronologia di utilizzo del tuo account. Le attività fallite non vengono addebitate.

Schema di output

L'invio restituisce l'attività:

{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}

Recuperare l'attività

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Interroga ogni 10–20 secondi finché status non diventa completed o failed. Un timeout di rete durante il polling non significa che la generazione sia fallita: conserva l'ID attività e riprendi il controllo. Non creare un'altra attività per verificare l'avanzamento.

Attività completata

{
  "id": "task_...",
  "model": "sd-video",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689720,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "duration": 5,
    "width": 1344,
    "height": 768,
    "aspect_ratio": "16:9",
    "seed": 42
  }
}

Il video è MP4 (H.264) a 24 fps con audio AAC stereo a 32 kHz. Con un aspect_ratio esplicito, la dimensione è fissa:

aspect_ratio768p480p
21:91536 × 672960 × 416
16:91344 × 768832 × 480
4:31024 × 768640 × 480
1:1768 × 768480 × 480
3:4768 × 1024480 × 640
9:16768 × 1344480 × 832

text_to_video usa 16:9 come predefinito. reference_to_video usa adaptive come predefinito: la forma della prima immagine di riferimento, o del primo video di riferimento se non ci sono immagini. image_to_video segue sempre il primo fotogramma, compreso l'orientamento EXIF; ritaglia l'immagine per cambiare forma. Una clip adattiva mantiene la forma della sorgente, scalata sul lato corto della risoluzione con ogni lato arrotondato a un multiplo di 32, e riporta aspect_ratio come rapporto di pixel ridotto, per esempio 23:15.

L'attività completata riporta il seed utilizzato. Lo stesso prompt con lo stesso seed restituisce la stessa clip; se ometti seed, ogni richiesta ne sceglie uno nuovo.

Errori

Le richieste rifiutate prima della creazione di un'attività restituiscono un errore HTTP con un oggetto error e non vengono addebitate. Un'attività che fallisce dopo l'accettazione restituisce HTTP 200 quando viene interrogata, con status: "failed" e un oggetto error.

Vedi il catalogo errori comune per codici, stati HTTP e indicazioni sui tentativi.

{
  "id": "task_...",
  "model": "sd-video",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "The request was rejected by the content policy. Please revise the prompt or input images."
  }
}

Se l'invio stesso va in timeout, controlla le tue attività prima di inviare di nuovo: la prima richiesta potrebbe essere stata accettata.

Suggerimenti

  • Scrivi prompt lunghi. Qualche centinaio di caratteri o più dà risultati migliori; i dettagli non penalizzano.
  • Indica la camera, non l'atmosfera: un corpo macchina, un obiettivo e un'apertura cambiano l'immagine, «cinematic» non fa quasi nulla.
  • Descrivi l'audio: suono d'ambiente, effetti e la loro distanza. Scrivi no music se non vuoi un sottofondo musicale. I dialoghi stanno in circa 2,5 parole al secondo.
  • Aggiungi no logos, brand names, printed words or badges anywhere in frame per evitare marchi inventati.
  • Mantieni le scritte brevi e riportate esattamente, e indicale come le uniche scritte nell'inquadratura.
  • Preferisci l'immobilità: un soggetto, un luogo, una camera fissa. I lavori di mani ravvicinati e i movimenti morbidi come capelli o carta sono i punti più deboli.
  • Fissa seed e cambia una sola frase alla volta per perfezionare un'inquadratura.

Correlati