MiniMax H3
Genera con MiniMax H3 clip di 4–15 secondi con audio a 768P o 2K: da testo a video, primo e ultimo fotogramma e da riferimenti a video, nel formato di richiesta ufficiale di MiniMax, consegnate come attività.
MiniMax H3 (Hailuo 03) è il modello video multimodale di MiniMax. Una sola richiesta crea immagine e audio insieme: una clip di 4–15 secondi a 768P o 2K con dialoghi, ambiente ed effetti propri. Il corpo della richiesta è il formato ufficiale di MiniMax con l'ID modello minimax-h3. Invialo, conserva l'ID attività restituito e leggi il video finito dall'attività. Fotogrammi e riferimenti vengono passati come URL.
ID modello
| ID modello | Input | Risoluzioni | Durata |
|---|---|---|---|
minimax-h3 | testo, primo e ultimo fotogramma, immagini, video e audio di riferimento | 768P, 2K | 4–15 secondi |
Consulta la pagina del modello per i prezzi attuali.
Esempio rapido
curl https://api.seedrouter.ai/v1/videos/generations \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "A small sailboat glides across a calm turquoise bay at sunrise, seagulls in the distance, the sound of water and wind. No text, no logos."}
],
"resolution": "768P",
"duration": 5,
"ratio": "16:9"
}'Endpoint
POST https://api.seedrouter.ai/v1/videos/generations| Intestazione | Valore |
|---|---|
| Authorization | Bearer YOUR_API_KEY |
| Content-Type | application/json |
La risposta è un'attività ({"id": "task_...", "status": "processing"}), non il video finito. Interroga GET /v1/tasks/{task_id} per ottenere il risultato. Conserva le chiavi API nel codice lato server.
Parametri
| Campo | Tipo | Predefinito | Note |
|---|---|---|---|
model | string | obbligatorio | minimax-h3 |
content | array | obbligatorio | Il prompt ed eventuali media, come voci descritte sotto. Esattamente una voce text non vuota. |
resolution | enum | obbligatorio | 768P o 2K. |
duration | integer | obbligatorio | Qualsiasi intero da 4 a 15 secondi. |
ratio | enum | dipende dall'input | adaptive, 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Obbligatorio con il solo testo, dove adaptive non è accettato. |
content_filter | boolean | true | Il filtro dei contenuti di SeedRouter, descritto sotto. Non viene inviato al modello. |
Lo schema è rigoroso: i campi sconosciuti vengono rifiutati invece che ignorati. callback_url non è disponibile; interroga invece l'attività. extra appartiene a MiniMax-H3-Max e non è accettato per questo modello.
Voci di content
type | Voce | role |
|---|---|---|
text | {"type": "text", "text": "..."}, fino a 7.000 caratteri | nessuno |
image_url | {"type": "image_url", "image_url": {"url": "https://..."}, "role": "..."} | first_frame, last_frame o reference_image |
video_url | {"type": "video_url", "video_url": {"url": "https://..."}, "role": "reference_video"} | reference_video |
audio_url | {"type": "audio_url", "audio_url": {"url": "https://..."}, "role": "reference_audio"} | reference_audio |
Una singola immagine senza role è il primo fotogramma. Con più di un'immagine, ogni immagine richiede un role.
Modalità
Sono le voci in content a determinare la modalità; non esiste un campo per la modalità.
| Modalità | content contiene | ratio |
|---|---|---|
| Da testo a video | una voce text | obbligatorio, non adaptive |
| Da immagine a video | text più un'immagine first_frame e/o last_frame | qualsiasi valore è trattato come adaptive: l'immagine determina la forma |
| Da riferimenti a video | text più qualsiasi combinazione fino a 9 voci reference_image, 3 reference_video e 3 reference_audio | facoltativo, predefinito adaptive |
Fotogrammi e riferimenti non si possono combinare nella stessa richiesta.
{
"model": "minimax-h3",
"content": [
{"type": "text", "text": "The person in the photo speaks to camera: Follow the wind. Voice follows the reference audio."},
{"type": "image_url", "image_url": {"url": "https://example.com/person.jpg"}, "role": "reference_image"},
{"type": "audio_url", "audio_url": {"url": "https://example.com/voice.mp3"}, "role": "reference_audio"}
],
"resolution": "2K",
"duration": 6
}Input multimediali
Ogni voce di immagine, video e audio è un URL HTTP(S) pubblico. Data URI in base64 e ID mm_file:// non sono accettati: carica il file nel tuo storage e passa il suo URL.
| Input | Formato | Limiti |
|---|---|---|
| Immagine | JPG, JPEG, PNG, WebP, HEIC, HEIF | 30 MB o meno; ogni lato 256–5760 px; larghezza / altezza 0,4–2,5 |
| Video | MP4, MOV (H.264 o H.265) | 50 MB o meno; 2–15 secondi ciascuno, 15 secondi in totale; ogni lato 256–5760 px; larghezza / altezza 0,4–2,5; 23,976–60 fps |
| Audio | WAV, MP3 | 15 MB o meno; 2–15 secondi ciascuno, 15 secondi in totale |
I video di riferimento vengono misurati quando la richiesta è accettata; un video di cui non si riesce a leggere la durata viene rifiutato senza alcun addebito. Gli altri limiti vengono controllati prima della generazione, e una richiesta che ne viola uno fallisce senza addebito.
Filtro dei contenuti
content_filter è true a meno che tu non lo imposti diversamente. Con il filtro attivo, il testo, ogni immagine e tre fotogrammi di ogni video di riferimento (primo, centrale e ultimo) vengono controllati prima che il modello venga eseguito. Una richiesta segnalata fallisce con il codice 60001 e non viene addebitata; lo stesso vale per una richiesta che non può essere controllata. L'audio di riferimento non viene controllato. Imposta content_filter su false per saltare il controllo; il Playground del sito lo mantiene sempre attivo.
Fattori di costo
Consulta la sezione prezzi del modello per le tariffe attuali. MiniMax H3 si paga per secondo di video, con una tariffa che dipende dalla risoluzione di output, più le immagini in input oltre le prime cinque:
billed seconds = duration + ceil(Σ each reference video's seconds)
extra images = max(0, number of images − 5)
cost = billed seconds × rate per second + extra images × rate per imagePrimi fotogrammi, ultimi fotogrammi e immagini di riferimento contano tutti come immagini. L'audio di riferimento non viene addebitato. Entrambe le quantità sono note quando la richiesta è accettata, quindi l'importo riservato è l'importo addebitato. Consulta gli addebiti definitivi nella cronologia di utilizzo del tuo account. Le attività fallite non vengono addebitate.
Schema di output
L'invio restituisce l'attività:
{"id": "task_...", "model": "minimax-h3", "status": "processing", "created_at": 1789689600}Recuperare l'attività
GET https://api.seedrouter.ai/v1/tasks/{task_id}Interroga ogni 10–20 secondi finché status non diventa completed o failed. Un timeout di rete durante il polling non significa che la generazione sia fallita: conserva l'ID attività e riprendi il controllo. Non creare un'altra attività per verificare l'avanzamento.
Attività completata
{
"id": "task_...",
"model": "minimax-h3",
"status": "completed",
"created_at": 1789689600,
"finished_at": 1789689740,
"output": {
"video_url": "https://static.seedrouter.ai/media/tasks/task_example/0.mp4",
"resolution": "768P",
"ratio": "16:9",
"duration": 5
}
}ratio è il rapporto d'aspetto con cui è stata creata la clip, compreso quello scelto per adaptive. Nel nostro test, una clip di 4 secondi a 768P in 16:9 è tornata come MP4 (H.264) a 1344 × 768 e 24 fps, con una traccia AAC stereo a 32 kHz.
Errori
Le richieste rifiutate prima della creazione di un'attività restituiscono un errore HTTP con un oggetto error e non vengono addebitate. Un'attività che fallisce dopo l'accettazione restituisce HTTP 200 quando viene interrogata, con status: "failed" e un oggetto error.
Vedi il catalogo errori comune per codici, stati HTTP e indicazioni sui tentativi.
{
"id": "task_...",
"model": "minimax-h3",
"status": "failed",
"error": {
"code": 60001,
"message": "the request was blocked by content moderation"
}
}Se l'invio stesso va in timeout, controlla le tue attività prima di inviare di nuovo: la prima richiesta potrebbe essere stata accettata.
Suggerimenti
- Descrivi insieme l'inquadratura e il suo audio: soggetto, luogo, camera, luce, dialoghi ed effetti.
- Scrivi i dialoghi nel prompt e allega una clip audio di riferimento quando la voce deve seguirla.
- Fai la bozza a
768P, poi genera l'inquadratura finale a2Kcon la stessa richiesta. - Usa un primo e un ultimo fotogramma per controllare dove inizia e finisce un'inquadratura; usa i riferimenti per mantenere un prodotto, una persona o un movimento.
- Aggiungi
no text, no logosper evitare marchi inventati.
