Claude Opus 5.5 já está disponível no SeedRouter
SeedRouter Docs

SD Video

Gere com o SD Video clipes de 5 a 15 segundos com diálogo e som combinando: texto para vídeo, imagem para vídeo e referências para vídeo em 480p ou 768p, entregues como tarefa.

View Markdown

O SD Video é o modelo de geração de vídeo do SeedRouter, baseado no MiniMax H3. Uma única requisição cria a cena inteira, imagem e som juntos: um clipe de 5 a 15 segundos com diálogo, ambiência e efeitos próprios. Envie a requisição, guarde o ID da tarefa retornado e leia o vídeo pronto a partir da tarefa. Primeiros quadros e referências são enviados como URLs.

IDs de modelo

ID de modeloModosResoluçõesDuração
sd-videotext_to_video, image_to_video, reference_to_video480p, 768pDe 5 a 15 segundos

Veja a página do modelo para os preços atuais.

Exemplo rápido

curl https://api.seedrouter.ai/v1/videos/generations \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "sd-video",
    "mode": "text_to_video",
    "prompt": "A lighthouse keeper in a wool coat stands on a wet stone pier at dawn and says, \"The fog lifts at seven.\" Locked-off shot, waves slapping the stones, no music.",
    "duration": 5,
    "resolution": "768p",
    "aspect_ratio": "16:9"
  }'

Endpoint

POST https://api.seedrouter.ai/v1/videos/generations
CabeçalhoValor
AuthorizationBearer YOUR_API_KEY
Content-Typeapplication/json

A resposta é uma tarefa ({"id": "task_...", "status": "processing"}), não o vídeo pronto. Consulte GET /v1/tasks/{task_id} para obter o resultado. Mantenha as chaves de API no código do lado do servidor.

Parâmetros

CampoTipoPadrãoObservações
modelstringobrigatóriosd-video
modeenumreference_to_videotext_to_video, image_to_video, reference_to_video. As formas curtas t2v, i2v e ref2va são aceitas.
promptstringobrigatórioDe 1 a 32.000 caracteres. Descreve a imagem e o som.
durationinteger5Qualquer inteiro de 5 a 15 segundos.
resolutionenum768p480p ou 768p.
aspect_ratioenumconforme o modo21:9, 16:9, 4:3, 1:1, 3:4, 9:16, mais adaptive em reference_to_video. image_to_video segue o primeiro quadro.
prompt_enhancementenumturboturbo, quality ou disabled.
seedintegeraleatórioInteiro sem sinal de 32 bits. Defina-o para repetir uma cena.
imagereferênciaApenas em image_to_video, onde é obrigatório. O primeiro quadro.
reference_imagesarray[]Apenas em reference_to_video. Até 9.
reference_videosarray[]Apenas em reference_to_video. Até 3.
reference_audioarray[]Apenas em reference_to_video. Até 3.

O esquema é estrito: campos desconhecidos são rejeitados em vez de ignorados. callback_url e callback_id não estão disponíveis; consulte a tarefa.

Modos

mode define como o modelo é condicionado. Cada modo tem seus próprios campos; um campo de outro modo retorna 400 quando tem um valor (uma lista vazia ou null é aceita).

ModoExigeAceita
text_to_videopromptos campos comuns
image_to_videoprompt e imageimage como primeiro quadro
reference_to_video (padrão)prompt e pelo menos uma imagem ou um vídeo de referênciareference_images, reference_videos, reference_audio

image_to_video trata a imagem como o primeiro quadro literal, então o clipe começa exatamente como essa imagem estática. Para colocar um produto ou uma pessoa em uma cena sua, use reference_to_video e descreva a cena ao redor.

Referências e rótulos no prompt

Em reference_to_video, a ordem da lista vira o rótulo que você usa no prompt. A primeira entrada de reference_images é <Picture 1>, a segunda é <Picture 2>; a primeira entrada de reference_videos é <Video 1>, e assim por diante. Imagens, vídeos e áudio são numerados separadamente. O aprimoramento do prompt pode reescrever o resto do prompt, mas não esses rótulos; defina prompt_enhancement como disabled para manter seu texto como escrito.

{
  "model": "sd-video",
  "mode": "reference_to_video",
  "prompt": "A supervisor wearing the harness in <Picture 1> stands still and speaks to camera.",
  "reference_images": [{ "type": "url", "url": "https://example.com/harness.jpg" }],
  "duration": 10
}

Entradas de mídia

Cada referência, e o primeiro quadro de image_to_video, é um objeto com uma URL HTTP(S) pública:

{ "type": "url", "url": "https://example.com/photo.jpg" }
EntradaTamanho máximo
Imagem16 MB
Vídeo ou áudio32 MB

No máximo 9 imagens, 3 vídeos e 3 áudios, 12 referências no total. Dados em base64 e IDs de asset não são aceitos: envie o arquivo para o seu próprio armazenamento e passe a URL dele. A URL precisa ser acessível sem redirecionamentos.

Fatores de custo

Veja a seção de preços do modelo para as tarifas atuais. O SD Video é cobrado por segundo de vídeo, com uma tarifa definida pelo modo e pela resolução de saída:

billed seconds = duration                                                   (text_to_video, image_to_video)
billed seconds = duration + ceil(Σ min(each reference video's seconds, 5))  (reference_to_video)
cost = billed seconds × rate per second

Cada vídeo de referência soma sua duração até 5 segundos; um clipe mais longo ainda soma 5. Imagens e áudio de referência não são cobrados. Os vídeos de referência são medidos quando a requisição é aceita, então o valor reservado é o valor cobrado. Veja as cobranças finais no histórico de uso da sua conta. Tarefas que falham não são cobradas.

Esquema de saída

O envio retorna a tarefa:

{"id": "task_...", "model": "sd-video", "status": "processing", "created_at": 1789689600}

Consultar a tarefa

GET https://api.seedrouter.ai/v1/tasks/{task_id}

Consulte a cada 10–20 segundos até que status seja completed ou failed. Um tempo limite de rede durante a consulta não significa que a geração falhou: guarde o identificador da tarefa e retome a verificação. Não crie outra tarefa para acompanhar o progresso.

Tarefa concluída

{
  "id": "task_...",
  "model": "sd-video",
  "status": "completed",
  "created_at": 1789689600,
  "finished_at": 1789689720,
  "output": {
    "video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
    "duration": 5,
    "width": 1344,
    "height": 768,
    "aspect_ratio": "16:9",
    "seed": 42
  }
}

O vídeo é MP4 (H.264) a 24 fps com áudio AAC estéreo de 32 kHz. Com um aspect_ratio explícito, o tamanho é fixo:

aspect_ratio768p480p
21:91536 × 672960 × 416
16:91344 × 768832 × 480
4:31024 × 768640 × 480
1:1768 × 768480 × 480
3:4768 × 1024480 × 640
9:16768 × 1344480 × 832

text_to_video usa 16:9 por padrão. reference_to_video usa adaptive por padrão: o formato da primeira imagem de referência, ou do primeiro vídeo de referência quando não há imagens. image_to_video sempre segue o primeiro quadro, incluindo a orientação EXIF; recorte a imagem para mudar o formato. Um clipe adaptativo mantém o formato da origem, redimensionado para o lado menor da resolução com cada lado arredondado para um múltiplo de 32, e informa aspect_ratio como a proporção de pixels reduzida, por exemplo 23:15.

A tarefa concluída informa o seed usado. O mesmo prompt com o mesmo seed retorna o mesmo clipe; se você omitir seed, cada requisição escolhe um novo.

Erros

Requisições rejeitadas antes de uma tarefa ser criada retornam um erro HTTP com um objeto error e não são cobradas. Uma tarefa que falha depois de aceita retorna HTTP 200 quando consultada, com status: "failed" e um objeto error.

Veja o catálogo de erros comum para códigos, status HTTP e orientações de nova tentativa.

{
  "id": "task_...",
  "model": "sd-video",
  "status": "failed",
  "error": {
    "code": 60001,
    "message": "The request was rejected by the content policy. Please revise the prompt or input images."
  }
}

Se o próprio envio atingir o tempo limite, confira suas tarefas antes de enviar de novo: a primeira requisição pode ter sido aceita.

Dicas

  • Escreva prompts longos. Algumas centenas de caracteres ou mais dão resultados melhores; detalhe não é penalizado.
  • Cite a câmera, não o clima: um corpo, uma lente e uma abertura mudam a imagem, "cinematic" quase não faz nada.
  • Descreva o som: som ambiente, efeitos e a distância deles. Escreva no music se não quiser uma trilha de fundo. O diálogo cabe em cerca de 2,5 palavras por segundo.
  • Adicione no logos, brand names, printed words or badges anywhere in frame para evitar marcas inventadas.
  • Mantenha o texto na cena curto e escrito exatamente, e indique que ele é o único texto do quadro.
  • Prefira a imobilidade: um assunto, um lugar, uma câmera estática. Trabalho manual de perto e movimentos suaves como cabelo ou papel são os pontos mais fracos.
  • Fixe seed e mude uma oração de cada vez para refinar uma cena.

Relacionados