Claude Opus 5.5 est disponible sur SeedRouter

DeepSeek V4.1 Flash : specs, fenêtre de contexte, sortie max, taille et valeurs par défaut

Specs de DeepSeek V4.1 Flash : MoE de 552 Md de paramètres, contexte de 1M tokens, sortie max de 384K, entrée image, réflexion et valeurs par défaut piégeuses.

Lire en Markdown

DeepSeek V4.1 Flash est un modèle mixture-of-experts de 552 milliards de paramètres, avec une fenêtre de contexte de 1M tokens et une sortie maximale de 393 216 tokens (384K) par requête. Il lit du texte et des images, écrit du texte et réfléchit avant de répondre, sauf si vous désactivez la réflexion. DeepSeek l'a publié le 10 septembre 2026. La caractéristique sur laquelle la plupart des gens trébuchent est la limite de sortie par défaut, bien plus basse que le maximum.

DeepSeek V4.1 Flash en un coup d'œil

CaractéristiqueValeur
DéveloppeurDeepSeek
Sortie10 septembre 2026
ArchitectureMixture of experts, Causal Encoder–Decoder
Paramètres au total552B
Paramètres actifs8B en entrée, 16B en sortie
Fenêtre de contexte1M tokens
Sortie maximale393 216 tokens (384K), raisonnement inclus
Limite de sortie par défaut8K sans réflexion, 64K avec réflexion, 128K avec l'effort max
EntréeTexte et images
SortieTexte
RéflexionActivée par défaut avec l'effort high ; none, low, high ou max
ID du modèle sur SeedRouterdeepseek-v4.1-flash
ID du modèle sur l'API DeepSeekdeepseek-flash

Quelle est la taille de DeepSeek V4.1 Flash ?

552 milliards de paramètres au total. La note de version de DeepSeek décrit une « nouvelle architecture Causal Encoder–Decoder : seulement 8B de paramètres actifs en entrée, 16B en sortie ». Seule une petite partie du modèle s'exécute pour chaque token, ce qui explique qu'il soit rapide et peu coûteux à servir malgré sa taille.

DeepSeek indique aussi que son cache KV nécessite « 1/4 de la HBM » et « 1/8 du stockage SSD » de la génération précédente. Cela compte pour les longues sessions d'agent, où l'entrée en cache représente une grande part du coût.

Quelle est la fenêtre de contexte de DeepSeek V4.1 Flash ?

1M tokens. Le prompt, les images, l'historique de la conversation et la réponse la partagent. La référence de l'API DeepSeek le formule ainsi : « La longueur totale des tokens d'entrée et des tokens générés est limitée par la longueur de contexte du modèle. »

Pour comprendre comment les limites de contexte et de sortie interagissent selon les modèles, voir fenêtre de contexte vs tokens de sortie max.

Quelle est la sortie maximale de DeepSeek V4.1 Flash ?

393 216 tokens par requête, que DeepSeek indique comme « MAXIMUM: 384K ». Le raisonnement compte dedans.

Le piège, c'est la valeur par défaut. Si vous ne définissez pas max_tokens, la référence de DeepSeek indique que la limite est de « 8K en mode sans réflexion, 64K en mode réflexion (128K avec reasoning_effort réglé sur max) ». Une longue réponse ou une longue trace de raisonnement atteint cette valeur par défaut bien avant le vrai plafond, et la réponse se termine par finish_reason: "length".

Pour obtenir des réponses plus longues, définissez max_tokens vous-même, entre 1 et 393216 :

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

Vous ne payez que les tokens que le modèle écrit, donc une limite élevée ne coûte pas plus en soi.

DeepSeek V4.1 Flash lit-il les images ?

Oui. DeepSeek le décrit comme un modèle « doté d'une compréhension visuelle native ». Sur SeedRouter, les images sont placées dans un message utilisateur sous forme de parties image_url, soit une URL publique, soit une data URI en base64. Une URL peut compter jusqu'à 8 192 caractères et pointer vers une image de 32 MiB au maximum. La sortie est toujours du texte.

Comment fonctionnent les modes de réflexion ?

La réflexion est activée par défaut avec l'effort high. Vous pouvez :

  • la désactiver avec "thinking": {"type": "disabled"} ou "reasoning_effort": "none", pour des réponses rapides avec moins de tokens de sortie ;
  • régler reasoning_effort sur low, high ou max.

Le raisonnement revient dans reasoning_content, à côté de la réponse, et il est facturé comme tokens de sortie. Avec la réflexion activée, temperature n'a aucun effet et les valeurs de top_p inférieures à 0,95 s'appliquent comme 0,95.

Quelles API peuvent l'appeler ?

Sur SeedRouter, DeepSeek V4.1 Flash accepte trois formats de requête avec la même clé :

FormatPoint de terminaison
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

Les appels d'outils fonctionnent dans les trois. Claude Code utilise le format Anthropic et Codex le format Responses ; la configuration pour Claude Code et Codex propose des configurations testées. Chaque paramètre figure dans la référence API de DeepSeek V4.1 Flash.

Comment est-il facturé ?

Au token, avec des tarifs distincts pour l'entrée qui touche le cache, l'entrée qui le manque et la sortie. Les tarifs sont divisés par deux en heures creuses : les heures pleines vont de 01:00 à 04:00 et de 06:00 à 10:00 UTC, du lundi au vendredi, et toutes les autres heures sont des heures creuses. La page DeepSeek V4.1 Flash affiche les tarifs actuels, et le guide des tarifs détaille des exemples.

Questions fréquentes

DeepSeek V4.1 Flash est-il open source ?

DeepSeek publie les poids sur Hugging Face ; DeepSeek V4.1 Flash est-il gratuit ? explique ce que cela implique pour le coût.

deepseek-v4-flash est-il le même modèle ?

Sur l'API de DeepSeek elle-même, l'ancien nom renvoie désormais vers V4.1 Flash. La page de tarifs de DeepSeek indique que « les modèles correspondants ont été retirés, leurs requêtes sont servies par le modèle DeepSeek-V4.1-Flash ». V4.1 Flash vs V4 Flash liste ce qui a changé.

Pourquoi DeepSeek V4.1 Flash s'arrête-t-il à 8K tokens ?

C'est la limite de sortie par défaut sans réflexion. Définissez max_tokens jusqu'à 393216 pour autoriser des réponses plus longues.

La fenêtre de contexte inclut-elle la sortie ?

Oui. L'entrée et la sortie partagent la fenêtre de 1M tokens.

Comment se compare-t-il à DeepSeek V4 Pro ?

DeepSeek place V4.1 Flash devant V4 Pro dans ses benchmarks, et il coûte moins cher. Voir DeepSeek V4.1 Flash vs V4 Pro.

Guides associés