SD Video
Genera con SD Video clip di 5–15 secondi con dialoghi e audio coerenti: da testo a video, da immagine a video e da riferimenti a video a 480p o 768p, consegnati come attività.
SD Video è il modello di generazione video di SeedRouter, basato su MiniMax H3. Una sola richiesta crea l'intera scena, immagine e audio insieme: una clip di 5–15 secondi con dialoghi, ambiente ed effetti propri. Invia la richiesta, conserva l'ID attività restituito e leggi il video finito dall'attività. Primi fotogrammi e riferimenti vengono passati come URL.
ID modello
| ID modello | Modalità | Risoluzioni | Durata |
|---|---|---|---|
sd-video | text_to_video, image_to_video, reference_to_video | 480p, 768p | 5–15 secondi |
Consulta la pagina del modello per i prezzi attuali.
Esempio rapido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sd-video",
"mode": "text_to_video",
"prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
"duration": 5,
"resolution": "768p",
"aspect_ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Intestazione | Valore |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
La risposta è un'attività ({"id": "task_...", "status": "processing"}), non il video finito. Interroga GET /v1/tasks/{task_id} per ottenere il risultato. Conserva le chiavi API nel codice lato server.
Parametri
| Campo | Tipo | Predefinito | Note |
|---|---|---|---|
model | string | obbligatorio | sd-video |
mode | enum | reference_to_video | text_to_video, image_to_video, reference_to_video. Sono accettate le forme brevi t2v, i2v e ref2va. |
prompt | string | obbligatorio | Da 1 a 32.000 caratteri. Descrive immagine e audio. |
duration | integer | 5 | Qualsiasi intero da 5 a 15 secondi. |
resolution | enum | 768p | 480p o 768p. |
aspect_ratio | enum | dipende dalla modalità | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, più adaptive in reference_to_video. image_to_video segue il primo fotogramma. |
prompt_enhancement | enum | turbo | turbo, quality o disabled. |
seed | integer | casuale | Intero senza segno a 32 bit. Impostalo per ripetere un'inquadratura. |
image | riferimento | Solo in image_to_video, dove è obbligatorio. Il primo fotogramma. | |
reference_images | array | [] | Solo in reference_to_video. Fino a 9. |
reference_videos | array | [] | Solo in reference_to_video. Fino a 3. |
reference_audio | array | [] | Solo in reference_to_video. Fino a 3. |
Lo schema è rigoroso: i campi sconosciuti vengono rifiutati invece che ignorati. callback_url e callback_id non sono disponibili; interroga invece l'attività.
Modalità
mode stabilisce come viene condizionato il modello. Ogni modalità ha i propri campi; un campo di un'altra modalità restituisce 400 quando contiene un valore (una lista vuota o null è accettata).
| Modalità | Richiede | Accetta |
|---|---|---|
text_to_video | prompt | i campi comuni |
image_to_video | prompt e image | image come primo fotogramma |
reference_to_video (predefinita) | prompt e almeno un'immagine o un video di riferimento | reference_images, reference_videos, reference_audio |
image_to_video tratta l'immagine come primo fotogramma letterale, quindi la clip si apre esattamente come appare quell'immagine fissa. Per inserire un prodotto o una persona in una scena tua, usa reference_to_video e descrivi la scena intorno.
Riferimenti ed etichette nel prompt
In reference_to_video, l'ordine della lista diventa l'etichetta da usare nel prompt. La prima voce di reference_images è <Picture 1>, la seconda è <Picture 2>; la prima voce di reference_videos è <Video 1> e così via. Immagini, video e audio sono numerati separatamente. Il miglioramento del prompt può riformulare il resto del prompt, ma non queste etichette; imposta prompt_enhancement su disabled per mantenere il testo così come l'hai scritto.
{
"model": "sd-video",
"mode": "reference_to_video",
"prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
"reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
"duration": 10
}Input multimediali
Ogni riferimento, e il primo fotogramma di image_to_video, è un oggetto con un URL HTTP(S) pubblico:
{ "type": "url", "url": "https://example.com/photo.jpg" }| Input | Dimensione massima |
|---|---|
| Immagine | 16 MB |
| Video o audio | 32 MB |
Al massimo 9 immagini, 3 video e 3 clip audio, 12 riferimenti in totale. Dati in base64 e ID di asset non sono accettati: carica il file nel tuo storage e passa il suo URL. L'URL deve essere raggiungibile senza reindirizzamenti.
Fattori di costo
Consulta la sezione prezzi del modello per le tariffe attuali. SD Video si paga per secondo di video, con una tariffa che dipende dalla modalità e dalla risoluzione di output:
billed seconds = duration (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5)) (reference_to_video)
cost = billed seconds × rate per secondOgni video di riferimento aggiunge la propria durata fino a 5 secondi; una clip più lunga aggiunge comunque 5. Immagini e audio di riferimento non vengono addebitati. I video di riferimento vengono misurati quando la richiesta è accettata, quindi l'importo riservato è l'importo addebitato. Consulta gli addebiti definitivi nella cronologia di utilizzo del tuo account. Le attività fallite non vengono addebitate.
Schema di output
L'invio restituisce l'attività:
{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}Recuperare l'attività
GET https://api.seedrouter.ai/v1/tasks/{task_id}Interroga ogni 10–20 secondi finché status non diventa completed o failed. Un timeout di rete durante il polling non significa che la generazione sia fallita: conserva l'ID attività e riprendi il controllo. Non creare un'altra attività per verificare l'avanzamento.
Attività completata
{
"id": "task_...",
"model": "sd-video",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689720,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"duration": 5,
"width": 1344,
"height": 768,
"aspect_ratio": "16:9",
"seed": 42
}
}Il video è MP4 (H.264) a 24 fps con audio AAC stereo a 32 kHz. Con un aspect_ratio esplicito, la dimensione è fissa:
aspect_ratio | 768p | 480p |
|---|---|---|
21:9 | 1536 × 672 | 960 × 416 |
16:9 | 1344 × 768 | 832 × 480 |
4:3 | 1024 × 768 | 640 × 480 |
1:1 | 768 × 768 | 480 × 480 |
3:4 | 768 × 1024 | 480 × 640 |
9:16 | 768 × 1344 | 480 × 832 |
text_to_video usa 16:9 come predefinito. reference_to_video usa adaptive come predefinito: la forma della prima immagine di riferimento, o del primo video di riferimento se non ci sono immagini. image_to_video segue sempre il primo fotogramma, compreso l'orientamento EXIF; ritaglia l'immagine per cambiare forma. Una clip adattiva mantiene la forma della sorgente, scalata sul lato corto della risoluzione con ogni lato arrotondato a un multiplo di 32, e riporta aspect_ratio come rapporto di pixel ridotto, per esempio 23:15.
L'attività completata riporta il seed utilizzato. Lo stesso prompt con lo stesso seed restituisce la stessa clip; se ometti seed, ogni richiesta ne sceglie uno nuovo.
Errori
Le richieste rifiutate prima della creazione di un'attività restituiscono un errore HTTP con un oggetto error e non vengono addebitate. Un'attività che fallisce dopo l'accettazione restituisce HTTP 200 quando viene interrogata, con status: "failed" e un oggetto error.
Vedi il catalogo errori comune per codici, stati HTTP e indicazioni sui tentativi.
{
"id": "task_...",
"model": "sd-video",
"status": "failed",
"error": {
"code": 60001,
"message": "The request was rejected by the content policy. Please revise the prompt or input images."
}
}Se l'invio stesso va in timeout, controlla le tue attività prima di inviare di nuovo: la prima richiesta potrebbe essere stata accettata.
Suggerimenti
- Scrivi prompt lunghi. Qualche centinaio di caratteri o più dà risultati migliori; i dettagli non penalizzano.
- Indica la camera, non l'atmosfera: un corpo macchina, un obiettivo e un'apertura cambiano l'immagine, «cinematic» non fa quasi nulla.
- Descrivi l'audio: suono d'ambiente, effetti e la loro distanza. Scrivi
no musicse non vuoi un sottofondo musicale. I dialoghi stanno in circa 2,5 parole al secondo. - Aggiungi
no logos, brand names, printed words or badges anywhere in frameper evitare marchi inventati. - Mantieni le scritte brevi e riportate esattamente, e indicale come le uniche scritte nell'inquadratura.
- Preferisci l'immobilità: un soggetto, un luogo, una camera fissa. I lavori di mani ravvicinati e i movimenti morbidi come capelli o carta sono i punti più deboli.
- Fissa
seede cambia una sola frase alla volta per perfezionare un'inquadratura.
