SD Video
Générez avec SD Video des clips de 5 à 15 secondes avec dialogues et son assortis : texte vers vidéo, image vers vidéo et références vers vidéo en 480p ou 768p, livrés sous forme de tâche.
SD Video est le modèle de génération vidéo de SeedRouter, basé sur MiniMax H3. Une seule requête crée toute la scène, image et son ensemble : un clip de 5 à 15 secondes avec ses propres dialogues, son d'ambiance et effets. Envoyez la requête, conservez l'identifiant de tâche renvoyé et récupérez la vidéo terminée dans la tâche. Les premières images et les références sont transmises sous forme d'URL.
ID de modèle
| ID de modèle | Modes | Résolutions | Durée |
|---|---|---|---|
sd-video | text_to_video, image_to_video, reference_to_video | 480p, 768p | 5 à 15 secondes |
Consultez la page du modèle pour les prix actuels.
Exemple rapide
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sd-video",
"mode": "text_to_video",
"prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
"duration": 5,
"resolution": "768p",
"aspect_ratio": "16:9"
}'Point de terminaison
POST https://api.seedrouter.ai/v1/videos/generations| En-tête | Valeur |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
La réponse est une tâche ({"id": "task_...", "status": "processing"}), pas la vidéo terminée. Interrogez GET /v1/tasks/{task_id} pour obtenir le résultat. Conservez les clés API dans du code côté serveur.
Paramètres
| Champ | Type | Par défaut | Remarques |
|---|---|---|---|
model | string | requis | sd-video |
mode | enum | reference_to_video | text_to_video, image_to_video, reference_to_video. Les formes courtes t2v, i2v et ref2va sont acceptées. |
prompt | string | requis | De 1 à 32 000 caractères. Décrit l'image et le son. |
duration | integer | 5 | Tout entier de 5 à 15 secondes. |
resolution | enum | 768p | 480p ou 768p. |
aspect_ratio | enum | selon le mode | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, plus adaptive en reference_to_video. image_to_video suit la première image. |
prompt_enhancement | enum | turbo | turbo, quality ou disabled. |
seed | integer | aléatoire | Entier non signé de 32 bits. Définissez-le pour refaire un plan. |
image | référence | image_to_video uniquement, obligatoire dans ce mode. La première image. | |
reference_images | array | [] | reference_to_video uniquement. Jusqu'à 9. |
reference_videos | array | [] | reference_to_video uniquement. Jusqu'à 3. |
reference_audio | array | [] | reference_to_video uniquement. Jusqu'à 3. |
Le schéma est strict : les champs inconnus sont rejetés au lieu d'être ignorés. callback_url et callback_id ne sont pas disponibles ; interrogez plutôt la tâche.
Modes
mode détermine la façon dont le modèle est conditionné. Chaque mode a ses propres champs ; un champ d'un autre mode renvoie 400 s'il contient une valeur (une liste vide ou null est acceptée).
| Mode | Requiert | Accepte |
|---|---|---|
text_to_video | prompt | les champs communs |
image_to_video | prompt et image | image comme première image |
reference_to_video (par défaut) | prompt et au moins une image ou vidéo de référence | reference_images, reference_videos, reference_audio |
image_to_video traite l'image comme la première image littérale : le clip s'ouvre exactement comme cette image fixe. Pour placer un produit ou une personne dans une scène de votre choix, utilisez reference_to_video et décrivez la scène autour.
Références et libellés dans le prompt
En reference_to_video, l'ordre de la liste devient le libellé à utiliser dans le prompt. La première entrée de reference_images est <Picture 1>, la deuxième <Picture 2> ; la première entrée de reference_videos est <Video 1>, et ainsi de suite. Les images, vidéos et audios sont numérotés séparément. L'amélioration du prompt peut reformuler le reste du prompt, mais pas ces libellés ; réglez prompt_enhancement sur disabled pour garder votre texte tel quel.
{
"model": "sd-video",
"mode": "reference_to_video",
"prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
"reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
"duration": 10
}Entrées média
Chaque référence, ainsi que la première image de image_to_video, est un objet avec une URL HTTP(S) publique :
{ "type": "url", "url": "https://example.com/photo.jpg" }| Entrée | Taille maximale |
|---|---|
| Image | 16 Mo |
| Vidéo ou audio | 32 Mo |
Au maximum 9 images, 3 vidéos et 3 extraits audio, 12 références au total. Les données en base64 et les identifiants d'asset ne sont pas acceptés : téléversez le fichier sur votre propre stockage et transmettez son URL. L'URL doit être accessible sans redirection.
Facteurs de coût
Consultez la section des prix du modèle pour les tarifs actuels. SD Video est facturé à la seconde de vidéo, à un tarif fixé par le mode et la résolution de sortie :
billed seconds = duration (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5)) (reference_to_video)
cost = billed seconds × rate per secondChaque vidéo de référence ajoute sa durée dans la limite de 5 secondes ; un clip plus long ajoute quand même 5. Les images et l'audio de référence ne sont pas facturés. Les vidéos de référence sont mesurées à l'acceptation de la requête, si bien que le montant réservé est le montant facturé. Consultez les frais définitifs dans l'historique d'utilisation de votre compte. Les tâches échouées ne sont pas facturées.
Schéma de sortie
L'envoi renvoie la tâche :
{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}Récupérer la tâche
GET https://api.seedrouter.ai/v1/tasks/{task_id}Interrogez toutes les 10 à 20 secondes jusqu'à ce que status vaille completed ou failed. Un dépassement de délai réseau pendant l'interrogation ne signifie pas que la génération a échoué : conservez l'identifiant de tâche et reprenez la vérification. Ne créez pas une autre tâche pour vérifier l'avancement.
Tâche terminée
{
"id": "task_...",
"model": "sd-video",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689720,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"duration": 5,
"width": 1344,
"height": 768,
"aspect_ratio": "16:9",
"seed": 42
}
}La vidéo est au format MP4 (H.264) à 24 fps avec un audio AAC stéréo à 32 kHz. Avec un aspect_ratio explicite, la taille est fixe :
aspect_ratio | 768p | 480p |
|---|---|---|
21:9 | 1536 × 672 | 960 × 416 |
16:9 | 1344 × 768 | 832 × 480 |
4:3 | 1024 × 768 | 640 × 480 |
1:1 | 768 × 768 | 480 × 480 |
3:4 | 768 × 1024 | 480 × 640 |
9:16 | 768 × 1344 | 480 × 832 |
text_to_video utilise 16:9 par défaut. reference_to_video utilise adaptive par défaut : le format de la première image de référence, ou de la première vidéo de référence s'il n'y a pas d'images. image_to_video suit toujours la première image, y compris son orientation EXIF ; recadrez l'image pour changer le format. Un clip adaptatif conserve le format de la source, mis à l'échelle sur le petit côté de la résolution, chaque côté étant arrondi à un multiple de 32, et indique aspect_ratio sous forme de rapport de pixels réduit, par exemple 23:15.
La tâche terminée indique le seed utilisé. Le même prompt avec le même seed renvoie le même clip ; si vous omettez seed, chaque requête en choisit un nouveau.
Erreurs
Les requêtes rejetées avant la création d'une tâche renvoient une erreur HTTP avec un objet error et ne sont pas facturées. Une tâche qui échoue après acceptation renvoie HTTP 200 lorsqu'on l'interroge, avec status: "failed" et un objet error.
Voir le catalogue d'erreurs commun pour les codes, les statuts HTTP et les conseils de reprise.
{
"id": "task_...",
"model": "sd-video",
"status": "failed",
"error": {
"code": 60001,
"message": "The request was rejected by the content policy. Please revise the prompt or input images."
}
}Si l'envoi lui-même dépasse le délai, vérifiez vos tâches avant de renvoyer : la première requête a peut-être été acceptée.
Conseils
- Écrivez des prompts longs. Quelques centaines de caractères ou plus donnent un meilleur résultat ; le détail n'est jamais pénalisé.
- Nommez la caméra, pas l'ambiance : un boîtier, un objectif et une ouverture changent l'image, « cinematic » ne fait presque rien.
- Décrivez le son : son d'ambiance, effets et leur distance. Écrivez
no musicsi vous ne voulez pas de fond musical. Les dialogues tiennent à environ 2,5 mots par seconde. - Ajoutez
no logos, brand names, printed words or badges anywhere in framepour éviter les marques inventées. - Gardez le texte à l'écran court et écrit en toutes lettres, et indiquez qu'il est le seul texte du cadre.
- Privilégiez l'immobilité : un sujet, un lieu, une caméra fixe. Les gestes de mains en gros plan et les mouvements souples comme les cheveux ou le papier sont les points les plus faibles.
- Fixez
seedet modifiez une seule proposition à la fois pour faire évoluer un plan.
