SD Video
Gere com o SD Video clipes de 5 a 15 segundos com diálogo e som combinando: texto para vídeo, imagem para vídeo e referências para vídeo em 480p ou 768p, entregues como tarefa.
O SD Video é o modelo de geração de vídeo do SeedRouter, baseado no MiniMax H3. Uma única requisição cria a cena inteira, imagem e som juntos: um clipe de 5 a 15 segundos com diálogo, ambiência e efeitos próprios. Envie a requisição, guarde o ID da tarefa retornado e leia o vídeo pronto a partir da tarefa. Primeiros quadros e referências são enviados como URLs.
IDs de modelo
| ID de modelo | Modos | Resoluções | Duração |
|---|---|---|---|
sd-video | text_to_video, image_to_video, reference_to_video | 480p, 768p | De 5 a 15 segundos |
Veja a página do modelo para os preços atuais.
Exemplo rápido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "sd-video",
"mode": "text_to_video",
"prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
"duration": 5,
"resolution": "768p",
"aspect_ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Cabeçalho | Valor |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
A resposta é uma tarefa ({"id": "task_...", "status": "processing"}), não o vídeo pronto. Consulte GET /v1/tasks/{task_id} para obter o resultado. Mantenha as chaves de API no código do lado do servidor.
Parâmetros
| Campo | Tipo | Padrão | Observações |
|---|---|---|---|
model | string | obrigatório | sd-video |
mode | enum | reference_to_video | text_to_video, image_to_video, reference_to_video. As formas curtas t2v, i2v e ref2va são aceitas. |
prompt | string | obrigatório | De 1 a 32.000 caracteres. Descreve a imagem e o som. |
duration | integer | 5 | Qualquer inteiro de 5 a 15 segundos. |
resolution | enum | 768p | 480p ou 768p. |
aspect_ratio | enum | conforme o modo | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, mais adaptive em reference_to_video. image_to_video segue o primeiro quadro. |
prompt_enhancement | enum | turbo | turbo, quality ou disabled. |
seed | integer | aleatório | Inteiro sem sinal de 32 bits. Defina-o para repetir uma cena. |
image | referência | Apenas em image_to_video, onde é obrigatório. O primeiro quadro. | |
reference_images | array | [] | Apenas em reference_to_video. Até 9. |
reference_videos | array | [] | Apenas em reference_to_video. Até 3. |
reference_audio | array | [] | Apenas em reference_to_video. Até 3. |
O esquema é estrito: campos desconhecidos são rejeitados em vez de ignorados. callback_url e callback_id não estão disponíveis; consulte a tarefa.
Modos
mode define como o modelo é condicionado. Cada modo tem seus próprios campos; um campo de outro modo retorna 400 quando tem um valor (uma lista vazia ou null é aceita).
| Modo | Exige | Aceita |
|---|---|---|
text_to_video | prompt | os campos comuns |
image_to_video | prompt e image | image como primeiro quadro |
reference_to_video (padrão) | prompt e pelo menos uma imagem ou um vídeo de referência | reference_images, reference_videos, reference_audio |
image_to_video trata a imagem como o primeiro quadro literal, então o clipe começa exatamente como essa imagem estática. Para colocar um produto ou uma pessoa em uma cena sua, use reference_to_video e descreva a cena ao redor.
Referências e rótulos no prompt
Em reference_to_video, a ordem da lista vira o rótulo que você usa no prompt. A primeira entrada de reference_images é <Picture 1>, a segunda é <Picture 2>; a primeira entrada de reference_videos é <Video 1>, e assim por diante. Imagens, vídeos e áudio são numerados separadamente. O aprimoramento do prompt pode reescrever o resto do prompt, mas não esses rótulos; defina prompt_enhancement como disabled para manter seu texto como escrito.
{
"model": "sd-video",
"mode": "reference_to_video",
"prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
"reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
"duration": 10
}Entradas de mídia
Cada referência, e o primeiro quadro de image_to_video, é um objeto com uma URL HTTP(S) pública:
{ "type": "url", "url": "https://example.com/photo.jpg" }| Entrada | Tamanho máximo |
|---|---|
| Imagem | 16 MB |
| Vídeo ou áudio | 32 MB |
No máximo 9 imagens, 3 vídeos e 3 áudios, 12 referências no total. Dados em base64 e IDs de asset não são aceitos: envie o arquivo para o seu próprio armazenamento e passe a URL dele. A URL precisa ser acessível sem redirecionamentos.
Fatores de custo
Veja a seção de preços do modelo para as tarifas atuais. O SD Video é cobrado por segundo de vídeo, com uma tarifa definida pelo modo e pela resolução de saída:
billed seconds = duration (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5)) (reference_to_video)
cost = billed seconds × rate per secondCada vídeo de referência soma sua duração até 5 segundos; um clipe mais longo ainda soma 5. Imagens e áudio de referência não são cobrados. Os vídeos de referência são medidos quando a requisição é aceita, então o valor reservado é o valor cobrado. Veja as cobranças finais no histórico de uso da sua conta. Tarefas que falham não são cobradas.
Esquema de saída
O envio retorna a tarefa:
{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}Consultar a tarefa
GET https://api.seedrouter.ai/v1/tasks/{task_id}Consulte a cada 10–20 segundos até que status seja completed ou failed. Um tempo limite de rede durante a consulta não significa que a geração falhou: guarde o identificador da tarefa e retome a verificação. Não crie outra tarefa para acompanhar o progresso.
Tarefa concluída
{
"id": "task_...",
"model": "sd-video",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689720,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"duration": 5,
"width": 1344,
"height": 768,
"aspect_ratio": "16:9",
"seed": 42
}
}O vídeo é MP4 (H.264) a 24 fps com áudio AAC estéreo de 32 kHz. Com um aspect_ratio explícito, o tamanho é fixo:
aspect_ratio | 768p | 480p |
|---|---|---|
21:9 | 1536 × 672 | 960 × 416 |
16:9 | 1344 × 768 | 832 × 480 |
4:3 | 1024 × 768 | 640 × 480 |
1:1 | 768 × 768 | 480 × 480 |
3:4 | 768 × 1024 | 480 × 640 |
9:16 | 768 × 1344 | 480 × 832 |
text_to_video usa 16:9 por padrão. reference_to_video usa adaptive por padrão: o formato da primeira imagem de referência, ou do primeiro vídeo de referência quando não há imagens. image_to_video sempre segue o primeiro quadro, incluindo a orientação EXIF; recorte a imagem para mudar o formato. Um clipe adaptativo mantém o formato da origem, redimensionado para o lado menor da resolução com cada lado arredondado para um múltiplo de 32, e informa aspect_ratio como a proporção de pixels reduzida, por exemplo 23:15.
A tarefa concluída informa o seed usado. O mesmo prompt com o mesmo seed retorna o mesmo clipe; se você omitir seed, cada requisição escolhe um novo.
Erros
Requisições rejeitadas antes de uma tarefa ser criada retornam um erro HTTP com um objeto error e não são cobradas. Uma tarefa que falha depois de aceita retorna HTTP 200 quando consultada, com status: "failed" e um objeto error.
Veja o catálogo de erros comum para códigos, status HTTP e orientações de nova tentativa.
{
"id": "task_...",
"model": "sd-video",
"status": "failed",
"error": {
"code": 60001,
"message": "The request was rejected by the content policy. Please revise the prompt or input images."
}
}Se o próprio envio atingir o tempo limite, confira suas tarefas antes de enviar de novo: a primeira requisição pode ter sido aceita.
Dicas
- Escreva prompts longos. Algumas centenas de caracteres ou mais dão resultados melhores; detalhe não é penalizado.
- Cite a câmera, não o clima: um corpo, uma lente e uma abertura mudam a imagem, "cinematic" quase não faz nada.
- Descreva o som: som ambiente, efeitos e a distância deles. Escreva
no musicse não quiser uma trilha de fundo. O diálogo cabe em cerca de 2,5 palavras por segundo. - Adicione
no logos, brand names, printed words or badges anywhere in framepara evitar marcas inventadas. - Mantenha o texto na cena curto e escrito exatamente, e indique que ele é o único texto do quadro.
- Prefira a imobilidade: um assunto, um lugar, uma câmera estática. Trabalho manual de perto e movimentos suaves como cabelo ou papel são os pontos mais fracos.
- Fixe
seede mude uma oração de cada vez para refinar uma cena.
