MiniMax H3
Gere com o MiniMax H3 clipes de 4 a 15 segundos com som em 768P ou 2K: texto para vídeo, primeiro e último quadro e referências para vídeo, no formato de requisição oficial da MiniMax, entregues como tarefa.
O MiniMax H3 (Hailuo 03) é o modelo de vídeo multimodal da MiniMax. Uma única requisição cria a imagem e o som juntos: um clipe de 4 a 15 segundos em 768P ou 2K com diálogo, ambiência e efeitos próprios. O corpo da requisição segue o formato oficial da MiniMax com o ID de modelo minimax-h3. Envie a requisição, guarde o ID da tarefa retornado e leia o vídeo pronto a partir da tarefa. Quadros e referências são enviados como URLs.
IDs de modelo
| ID de modelo | Entradas | Resoluções | Duração |
|---|---|---|---|
minimax-h3 | texto, primeiro e último quadro, imagens, vídeos e áudios de referência | 768P, 2K | De 4 a 15 segundos |
Veja a página do modelo para os preços atuais.
Exemplo rápido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "A small sailboat glides across a calm turquoise bay at sunrise, seagulls in the distance, the sound of water and wind. No text, no logos."}
],
"resolution": "768P",
"duration": 5,
"ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Cabeçalho | Valor |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
A resposta é uma tarefa ({"id": "task_...", "status": "processing"}), não o vídeo pronto. Consulte GET /v1/tasks/{task_id} para obter o resultado. Mantenha as chaves de API no código do lado do servidor.
Parâmetros
| Campo | Tipo | Padrão | Observações |
|---|---|---|---|
model | string | obrigatório | minimax-h3 |
content | array | obrigatório | O prompt e qualquer mídia, como os itens descritos abaixo. Exatamente um item text não vazio. |
resolution | enum | obrigatório | 768P ou 2K. |
duration | integer | obrigatório | Qualquer inteiro de 4 a 15 segundos. |
ratio | enum | conforme a entrada | adaptive, 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Obrigatório só com texto, caso em que adaptive não é aceito. |
content_filter | boolean | true | O filtro de conteúdo do SeedRouter, descrito abaixo. Não é enviado ao modelo. |
O esquema é estrito: campos desconhecidos são rejeitados em vez de ignorados. callback_url não está disponível; consulte a tarefa. extra pertence ao MiniMax-H3-Max e não é aceito por este modelo.
Itens de content
type | Item | role |
|---|---|---|
text | {"type": "text", "text": "..."}, até 7.000 caracteres | nenhum |
image_url | {"type": "image_url", "image_url": {"url": "https://..."}, "role": "..."} | first_frame, last_frame ou reference_image |
video_url | {"type": "video_url", "video_url": {"url": "https://..."}, "role": "reference_video"} | reference_video |
audio_url | {"type": "audio_url", "audio_url": {"url": "https://..."}, "role": "reference_audio"} | reference_audio |
Uma única imagem sem role é o primeiro quadro. Com mais de uma imagem, toda imagem precisa de um role.
Modos
Os itens em content definem o modo; não existe um campo de modo.
| Modo | content contém | ratio |
|---|---|---|
| Texto para vídeo | um item text | obrigatório, não adaptive |
| Imagem para vídeo | text mais uma imagem first_frame e/ou last_frame | qualquer valor é tratado como adaptive: a imagem define o formato |
| Referências para vídeo | text mais qualquer combinação de até 9 itens reference_image, 3 reference_video e 3 reference_audio | opcional, padrão adaptive |
Quadros e referências não podem ser combinados em uma mesma requisição.
{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "The person in the photo speaks to camera: Follow the wind. Voice follows the reference audio."},
{"type": "image_url", "image_url": {"url": "https://example.com/person.jpg"}, "role": "reference_image"},
{"type": "audio_url", "audio_url": {"url": "https://example.com/voice.mp3"}, "role": "reference_audio"}
],
"resolution": "2K",
"duration": 6
}Entradas de mídia
Cada item de imagem, vídeo e áudio é uma URL HTTP(S) pública. URIs de dados em base64 e IDs mm_file:// não são aceitos: envie o arquivo para o seu próprio armazenamento e passe a URL dele.
| Entrada | Formato | Limites |
|---|---|---|
| Imagem | JPG, JPEG, PNG, WebP, HEIC, HEIF | Até 30 MB; cada lado com 256–5760 px; largura / altura de 0,4 a 2,5 |
| Vídeo | MP4, MOV (H.264 ou H.265) | Até 50 MB; de 2 a 15 segundos cada, 15 segundos no total; cada lado com 256–5760 px; largura / altura de 0,4 a 2,5; 23,976–60 fps |
| Áudio | WAV, MP3 | Até 15 MB; de 2 a 15 segundos cada, 15 segundos no total |
Os vídeos de referência são medidos quando a requisição é aceita; um vídeo cuja duração não pode ser lida é recusado sem cobrança. Os outros limites são verificados antes da geração, e uma requisição que viola algum deles falha sem cobrança.
Filtro de conteúdo
content_filter é true, a menos que você o defina. Com o filtro ativado, o texto, todas as imagens e três quadros de cada vídeo de referência (o primeiro, o do meio e o último) são verificados antes de o modelo rodar. Uma requisição sinalizada falha com o código 60001 e não é cobrada; o mesmo vale para uma requisição que não pode ser verificada. O áudio de referência não é verificado. Defina content_filter como false para pular a verificação; o Playground do site sempre mantém o filtro ativado.
Fatores de custo
Veja a seção de preços do modelo para as tarifas atuais. O MiniMax H3 é cobrado por segundo de vídeo, com uma tarifa definida pela resolução de saída, mais as imagens de entrada além das cinco primeiras:
billed seconds = duration + ceil(Σ each reference video's seconds)
extra images = max(0, number of images − 5)
cost = billed seconds × rate per second + extra images × rate per imagePrimeiros quadros, últimos quadros e imagens de referência contam como imagens. O áudio de referência não é cobrado. As duas quantidades são conhecidas quando a requisição é aceita, então o valor reservado é o valor cobrado. Veja as cobranças finais no histórico de uso da sua conta. Tarefas que falham não são cobradas.
Esquema de saída
O envio retorna a tarefa:
{"id": "task_...", "model": "minimax-h3", "status": "processing", "created_at": 1789689600}Consultar a tarefa
GET https://api.seedrouter.ai/v1/tasks/{task_id}Consulte a cada 10–20 segundos até que status seja completed ou failed. Um tempo limite de rede durante a consulta não significa que a geração falhou: guarde o ID da tarefa e retome a verificação. Não crie outra tarefa para acompanhar o progresso.
Tarefa concluída
{
"id": "task_...",
"model": "minimax-h3",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689740,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"resolution": "768P",
"ratio": "16:9",
"duration": 5
}
}ratio é a proporção em que o clipe foi feito, incluindo a escolhida para adaptive. No nosso teste, um clipe de 4 segundos em 768P com 16:9 voltou como MP4 (H.264) em 1344 × 768 e 24 fps, com uma faixa AAC estéreo de 32 kHz.
Erros
Requisições rejeitadas antes de uma tarefa ser criada retornam um erro HTTP com um objeto error e não são cobradas. Uma tarefa que falha depois de aceita retorna HTTP 200 quando consultada, com status: "failed" e um objeto error.
Veja o catálogo de erros comum para códigos, status HTTP e orientações de nova tentativa.
{
"id": "task_...",
"model": "minimax-h3",
"status": "failed",
"error": {
"code": 60001,
"message": "the request was blocked by content moderation"
}
}Se o próprio envio atingir o tempo limite, confira suas tarefas antes de enviar de novo: a primeira requisição pode ter sido aceita.
Dicas
- Descreva a cena e o som dela juntos: assunto, lugar, câmera, luz, diálogo e efeitos.
- Escreva o diálogo no prompt e anexe um áudio de referência quando a voz precisar segui-lo.
- Faça o rascunho em
768Pe depois renderize a cena final em2Kcom a mesma requisição. - Use um primeiro e um último quadro para controlar onde a cena começa e termina; use referências para manter um produto, uma pessoa ou um movimento.
- Adicione
no text, no logospara evitar marcas inventadas.
