Specifiche di DeepSeek V4.1 Flash: finestra di contesto, output massimo, dimensioni e predefiniti
Specifiche di DeepSeek V4.1 Flash: MoE da 552B parametri, contesto 1M, output massimo di 384K, immagini, thinking e i predefiniti che tagliano le risposte.
Leggi in MarkdownDeepSeek V4.1 Flash è un modello mixture-of-experts da 552 miliardi di parametri con una finestra di contesto di 1M token e un output massimo di 393.216 token (384K) per richiesta. Legge testo e immagini, scrive testo e pensa prima di rispondere, a meno che tu non disattivi il thinking. DeepSeek l'ha rilasciato il 10 settembre 2026. La specifica su cui inciampano quasi tutti è il limite di output predefinito, molto più basso del massimo.
Le specifiche di DeepSeek V4.1 Flash in sintesi
| Specifica | Valore |
|---|---|
| Sviluppatore | DeepSeek |
| Rilascio | 10 settembre 2026 |
| Architettura | Mixture of experts, Causal Encoder–Decoder |
| Parametri totali | 552B |
| Parametri attivi | 8B per l'input, 16B per l'output |
| Finestra di contesto | 1M token |
| Output massimo | 393.216 token (384K), ragionamento incluso |
| Limite di output predefinito | 8K senza thinking, 64K con thinking, 128K con sforzo max |
| Input | Testo e immagini |
| Output | Testo |
| Thinking | Attivo di default con sforzo high; none, low, high o max |
| ID modello su SeedRouter | deepseek-v4.1-flash |
| ID modello sull'API di DeepSeek | deepseek-flash |
Quanto è grande DeepSeek V4.1 Flash?
552 miliardi di parametri in totale. La nota di rilascio di DeepSeek descrive una "nuova architettura Causal Encoder–Decoder: solo 8B parametri attivi per l'input, 16B per l'output." Per ogni token lavora solo una piccola parte del modello, ed è per questo che è veloce ed economico da servire nonostante le dimensioni.
DeepSeek dice anche che la sua KV cache richiede "1/4 della HBM" e "1/8 dello storage SSD" rispetto alla generazione precedente. Questo conta nelle sessioni lunghe degli agenti, dove l'input in cache pesa molto sul costo.
Qual è la finestra di contesto di DeepSeek V4.1 Flash?
1M token. Prompt, immagini, cronologia della conversazione e risposta la condividono. Il riferimento API di DeepSeek lo dice così: "La lunghezza totale dei token di input e dei token generati è limitata dalla lunghezza del contesto del modello."
Per capire come interagiscono i limiti di contesto e di output tra i modelli, vedi finestra di contesto e token di output massimi.
Qual è l'output massimo di DeepSeek V4.1 Flash?
393.216 token per richiesta, che DeepSeek indica come "MAXIMUM: 384K". Il ragionamento conta al suo interno.
Il problema è il predefinito. Se non imposti max_tokens, il riferimento di DeepSeek dice che il limite è "8K in modalità senza thinking, 64K in modalità thinking (128K con reasoning_effort impostato su max)". Una risposta lunga o una lunga traccia di ragionamento raggiunge quel predefinito molto prima del vero tetto, e la risposta termina con finish_reason: "length".
Per ottenere risposte più lunghe, imposta tu max_tokens, con qualsiasi valore da 1 a 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}Paghi solo i token che il modello scrive, quindi un limite alto di per sé non costa di più.
DeepSeek V4.1 Flash legge le immagini?
Sì. DeepSeek lo definisce un modello "con comprensione visiva nativa". Su SeedRouter, le immagini vanno in un messaggio utente come parti image_url, con un URL pubblico o una data URI in base64. Un URL può essere lungo fino a 8.192 caratteri e puntare a un'immagine fino a 32 MiB. L'output è sempre testo.
Come funzionano le modalità di thinking?
Il thinking è attivo di default con sforzo high. Puoi:
- disattivarlo con
"thinking": {"type": "disabled"}o"reasoning_effort": "none", per risposte veloci con meno token di output; - impostare
reasoning_effortsulow,highomax.
Il ragionamento torna in reasoning_content, accanto alla risposta, e viene fatturato come token di output. Con il thinking attivo, temperature non ha effetto e i valori di top_p sotto 0.95 vengono eseguiti come 0.95.
Quali API possono chiamarlo?
Su SeedRouter, DeepSeek V4.1 Flash accetta tre formati di richiesta con la stessa chiave:
| Formato | Endpoint |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
Le chiamate agli strumenti funzionano in tutti e tre. Il formato Anthropic è quello usato da Claude Code, e il formato Responses quello usato da Codex; il setup di Claude Code e Codex contiene configurazioni testate. Ogni parametro è elencato nel riferimento API di DeepSeek V4.1 Flash.
Come viene prezzato?
A token, con tariffe separate per l'input che trova la cache, l'input che non la trova e l'output. Le tariffe si dimezzano nella fascia fuori punta: la fascia di punta va dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC, dal lunedì al venerdì, e ogni altra ora è fuori punta. La pagina di DeepSeek V4.1 Flash mostra le tariffe aggiornate, e la guida ai prezzi sviluppa degli esempi.
Domande frequenti
DeepSeek V4.1 Flash è open source?
DeepSeek pubblica i pesi su Hugging Face; DeepSeek V4.1 Flash è gratis? spiega cosa significa in termini di costo.
deepseek-v4-flash è lo stesso modello?
Sull'API di DeepSeek, il nome precedente ora viene instradato a V4.1 Flash. La pagina dei prezzi di DeepSeek dice che "i modelli corrispondenti sono stati ritirati, le loro richieste sono servite dal modello DeepSeek-V4.1-Flash". V4.1 Flash vs V4 Flash elenca cosa è cambiato.
Perché DeepSeek V4.1 Flash si ferma a 8K token?
È il limite di output predefinito con il thinking disattivato. Imposta max_tokens fino a 393216 per consentire risposte più lunghe.
La finestra di contesto include l'output?
Sì. Input e output condividono la finestra da 1M token.
Come si confronta con DeepSeek V4 Pro?
DeepSeek riporta V4.1 Flash davanti a V4 Pro nei suoi benchmark, e costa meno. Vedi DeepSeek V4.1 Flash vs V4 Pro.



