Claude Opus 5.5 ist auf SeedRouter verfügbar
SeedRouter Docs

SD Video

Mit SD Video 5–15 Sekunden lange Clips mit passendem Dialog und Ton erzeugen: Text zu Video, Bild zu Video und Referenz zu Video in 480p oder 768p, geliefert als Aufgabe.

View Markdown

SD Video ist das Videogenerierungsmodell von SeedRouter, basierend auf MiniMax H3. Eine Anfrage erzeugt die ganze Szene, Bild und Ton zusammen: einen 5–15 Sekunden langen Clip mit eigenem Dialog, Ambiente und Effekten. Sende die Anfrage, behalte die zurückgegebene Aufgaben-ID und lies das fertige Video aus der Aufgabe. Erste Frames und Referenzen werden als URLs übergeben.

Modell-IDs

Modell-IDModiAuflösungenLänge
sd-videotext_to_video, image_to_video, reference_to_video480p, 768p5–15 Sekunden

Aktuelle Preise findest du auf der Modellseite.

Kurzbeispiel

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "sd-video",
    "mode": "text_to_video",
    "prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
    "duration": 5,
    "resolution": "768p",
    "aspect_ratio": "16:9"
  }'

Endpunkt

POST https://api.seedrouter.ai/v1/videos/generations
HeaderWert
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

Die Antwort ist eine Aufgabe ({"id": "task_...", "status": "processing"}), nicht das fertige Video. Frag GET /v1/tasks/{task_id} ab, um das Ergebnis zu erhalten. Bewahre API-Schlüssel in serverseitigem Code auf.

Parameter

FeldTypStandardwertHinweise
modelstringPflichtsd-video
modeenumreference_to_videotext_to_video, image_to_video, reference_to_video. Die Kurzformen t2v, i2v und ref2va werden akzeptiert.
promptstringPflicht1 bis 32.000 Zeichen. Beschreibt Bild und Ton.
durationinteger5Jede ganze Zahl von 5 bis 15 Sekunden.
resolutionenum768p480p oder 768p.
aspect_ratioenumje nach Modus21:9, 16:9, 4:3, 1:1, 3:4, 9:16, dazu adaptive bei reference_to_video. image_to_video folgt dem ersten Frame.
prompt_enhancementenumturboturbo, quality oder disabled.
seedintegerzufälligVorzeichenlos, 32 Bit. Setze ihn, um eine Einstellung zu wiederholen.
imageReferenzNur bei image_to_video, dort Pflicht. Der erste Frame.
reference_imagesarray[]Nur bei reference_to_video. Bis zu 9.
reference_videosarray[]Nur bei reference_to_video. Bis zu 3.
reference_audioarray[]Nur bei reference_to_video. Bis zu 3.

Das Schema ist strikt: Unbekannte Felder werden abgelehnt statt ignoriert. callback_url und callback_id sind nicht verfügbar; frag stattdessen die Aufgabe ab.

Modi

mode legt fest, wie das Modell gesteuert wird. Jeder Modus hat eigene Felder; ein Feld aus einem anderen Modus führt zu 400, sobald es einen Wert enthält (eine leere Liste oder null ist erlaubt).

ModusErfordertNimmt
text_to_videopromptdie gemeinsamen Felder
image_to_videoprompt und imageimage als ersten Frame
reference_to_video (Standard)prompt und mindestens ein Referenzbild oder -videoreference_images, reference_videos, reference_audio

image_to_video behandelt das Bild als wörtlichen ersten Frame, sodass der Clip genau so beginnt, wie das Standbild aussieht. Um ein Produkt oder eine Person in eine eigene Szene zu setzen, verwende reference_to_video und beschreibe die Szene darum herum.

Referenzen und Prompt-Labels

Bei reference_to_video wird die Reihenfolge der Liste zum Label, das du im Prompt verwendest. Der erste Eintrag von reference_images ist <Picture 1>, der zweite <Picture 2>; der erste Eintrag von reference_videos ist <Video 1> und so weiter. Bilder, Videos und Audio werden unabhängig voneinander nummeriert. Die Prompt-Verbesserung kann den restlichen Prompt umformulieren, aber nicht diese Labels; setze prompt_enhancement auf disabled, um deinen Text unverändert zu lassen.

{
  "model": "sd-video",
  "mode": "reference_to_video",
  "prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
  "reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
  "duration": 10
}

Medieneingaben

Jede Referenz und der erste Frame bei image_to_video ist ein Objekt mit einer öffentlichen HTTP(S)-URL:

{ "type": "url", "url": "https://example.com/photo.jpg" }
EingabeMaximale Größe
Bild16 MB
Video oder Audio32 MB

Höchstens 9 Bilder, 3 Videos und 3 Audios, insgesamt 12 Referenzen. Base64-Daten und Asset-IDs werden nicht akzeptiert: Lade die Datei in deinen eigenen Speicher hoch und übergib ihre URL. Die URL muss ohne Weiterleitungen erreichbar sein.

Kostenfaktoren

Die aktuellen Preise findest du im Preisabschnitt des Modells. SD Video wird pro Sekunde Video abgerechnet, zu einem Tarif, der von Modus und Ausgabeauflösung abhängt:

billed seconds = duration                                                   (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5))  (reference_to_video)
cost = billed seconds × rate per second

Jedes Referenzvideo fügt seine Länge bis zu 5 Sekunden hinzu; ein längerer Clip fügt trotzdem 5 hinzu. Referenzbilder und Referenz-Audio werden nicht berechnet. Die Referenzvideos werden bei der Annahme der Anfrage gemessen, sodass der reservierte Betrag dem berechneten entspricht. Die endgültigen Kosten siehst du im Nutzungsverlauf deines Kontos. Fehlgeschlagene Aufgaben werden nicht berechnet.

Ausgabeschema

Beim Senden wird die Aufgabe zurückgegeben:

{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}

Aufgabe abrufen

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Frag alle 10–20 Sekunden ab, bis status den Wert completed oder failed hat. Eine Zeitüberschreitung des Netzwerks während der Abfrage bedeutet nicht, dass die Erzeugung fehlgeschlagen ist: Behalte die Aufgaben-ID und setze die Prüfung fort. Erstelle keine weitere Aufgabe, um den Fortschritt zu prüfen.

Abgeschlossene Aufgabe

{
  "id": "task_...",
  "model": "sd-video",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689720,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "duration": 5,
    "width": 1344,
    "height": 768,
    "aspect_ratio": "16:9",
    "seed": 42
  }
}

Das Video ist MP4 (H.264) mit 24 fps und Stereo-AAC-Audio mit 32 kHz. Mit einem expliziten aspect_ratio ist die Größe fest:

aspect_ratio768p480p
21:91536 × 672960 × 416
16:91344 × 768832 × 480
4:31024 × 768640 × 480
1:1768 × 768480 × 480
3:4768 × 1024480 × 640
9:16768 × 1344480 × 832

text_to_video verwendet standardmäßig 16:9. reference_to_video verwendet standardmäßig adaptive: das Format des ersten Referenzbilds oder, wenn es keine Bilder gibt, des ersten Referenzvideos. image_to_video folgt immer dem ersten Frame, einschließlich seiner EXIF-Ausrichtung; schneide das Bild zu, um das Format zu ändern. Ein adaptiver Clip behält das Format der Quelle, skaliert auf die kurze Kante der Auflösung, wobei jede Seite auf ein Vielfaches von 32 gerundet wird, und gibt aspect_ratio als gekürztes Pixelverhältnis an, zum Beispiel 23:15.

Die abgeschlossene Aufgabe gibt den verwendeten seed an. Derselbe Prompt und derselbe Seed liefern denselben Clip; lässt du seed weg, wählt jede Anfrage einen neuen.

Fehler

Anfragen, die vor der Erstellung einer Aufgabe abgelehnt werden, geben einen HTTP-Fehler mit einem error-Objekt zurück und werden nicht berechnet. Eine Aufgabe, die nach der Annahme fehlschlägt, gibt bei der Abfrage HTTP 200 zurück, zusammen mit status: "failed" und einem error-Objekt.

Codes, HTTP-Status und Hinweise zu Wiederholungen findest du im gemeinsamen Fehlerkatalog.

{
  "id": "task_...",
  "model": "sd-video",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "The request was rejected by the content policy. Please revise the prompt or input images."
  }
}

Kommt es beim Senden selbst zu einer Zeitüberschreitung, prüfe deine Aufgaben, bevor du erneut sendest: Die erste Anfrage wurde möglicherweise bereits angenommen.

Tipps

  • Schreib lange Prompts. Ein paar hundert Zeichen oder mehr liefern bessere Ergebnisse; Details werden nicht bestraft.
  • Nenne die Kamera, nicht die Stimmung: Gehäuse, Objektiv und Blende verändern das Bild, „cinematic“ bewirkt fast nichts.
  • Beschreibe den Ton: Raumklang, Effekte und ihre Entfernung. Schreib no music, wenn du keinen Musikteppich willst. Dialog passt mit etwa 2,5 Wörtern pro Sekunde.
  • Füge no logos, brand names, printed words or badges anywhere in frame hinzu, um erfundene Zeichen fernzuhalten.
  • Halte Schriftzüge kurz und exakt ausgeschrieben, und benenne sie als einzigen Schriftzug im Bild.
  • Bevorzuge Ruhe: ein Motiv, ein Ort, eine statische Kamera. Feine Handarbeit und weiche Bewegungen wie Haare oder Papier sind die schwächsten Bereiche.
  • Leg seed fest und ändere jeweils nur einen Satzteil, um eine Einstellung schrittweise zu verbessern.

Weiterführend