API DeepSeek V4.1 Flash : obtenir une clé et faire votre premier appel
Utiliser l’API DeepSeek V4.1 Flash : obtenir une clé, l’appeler avec le SDK OpenAI, activer ou couper la réflexion, streamer, images, erreurs courantes.
Lire en MarkdownPour appeler DeepSeek V4.1 Flash, il vous faut une clé API d'une plateforme qui le propose et une requête avec son ID de modèle. Sur l'API de DeepSeek elle-même, le modèle s'appelle deepseek-flash, et les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp sont redirigés vers lui. Sur SeedRouter, l'ID de modèle est deepseek-v4.1-flash, et une seule clé l'appelle à l'usage dans le format de requête officiel : pointez le SDK OpenAI vers https://api.seedrouter.ai/v1 et gardez votre code.
Ce guide utilise SeedRouter ; les corps de requête sont les mêmes que sur l'API de DeepSeek.
Comment obtenir une clé API DeepSeek V4.1 Flash ?
- Connectez-vous à SeedRouter et ouvrez API keys.
- Créez une clé et copiez-la ; elle n'est affichée qu'une fois.
- Ajoutez du crédit quand vous en avez besoin. Les nouveaux comptes démarrent avec un petit solde gratuit, et il n'y a pas d'abonnement.
Stockez la clé dans une variable d'environnement comme SEEDROUTER_API_KEY, et ne l'utilisez que depuis du code côté serveur.
Comment appeler DeepSeek V4.1 Flash en Python ?
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["SEEDROUTER_API_KEY"],
base_url="https://api.seedrouter.ai/v1",
)
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Give me three names for a coffee shop."}],
)
print(completion.choices[0].message.content)Le mode réflexion est activé par défaut : le message contient donc aussi le raisonnement du modèle dans reasoning_content, à côté de la réponse dans content.
Comment l'appeler en Node.js ou avec cURL ?
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.SEEDROUTER_API_KEY,
baseURL: "https://api.seedrouter.ai/v1",
});
const completion = await client.chat.completions.create({
model: "deepseek-v4.1-flash",
messages: [{ role: "user", content: "Give me three names for a coffee shop." }],
});
console.log(completion.choices[0].message.content);curl https://api.seedrouter.ai/v1/chat/completions \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "deepseek-v4.1-flash", "messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]}'La même clé répond aussi à l'API Responses (/v1/responses) et au format Anthropic Messages (/v1/messages) pour deepseek-v4.1-flash.
Comment couper la réflexion ou régler son effort ?
La réflexion est activée par défaut avec l'effort high. Coupez-la avec thinking, ou choisissez un effort avec reasoning_effort. Le SDK OpenAI transmet thinking via extra_body. La première requête coupe la réflexion pour la réponse la plus rapide et la moins chère ; la seconde utilise l'effort le plus élevé :
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Classify: 'my card was charged twice'"}],
extra_body={"thinking": {"type": "disabled"}},
)
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "How many primes are there below 150?"}],
reasoning_effort="max",
)reasoning_effort | Effet |
|---|---|
none | Réflexion coupée |
low | Raisonnement court |
high (par défaut) | La plupart des tâches |
max | Les problèmes les plus difficiles |
DeepSeek accepte aussi minimal (exécuté comme low), medium et xhigh (exécutés comme high). Dans notre test sur une question de comptage de nombres premiers, la réflexion coupée a utilisé 2 tokens de sortie, low 258 et max 319. Le raisonnement est facturé comme de la sortie.
Comment streamer la réponse ?
Ajoutez stream=True. Avec la réflexion activée, le raisonnement arrive d'abord dans delta.reasoning_content, puis la réponse dans delta.content, et le dernier chunk contient la consommation de tokens :
stream = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Write a haiku about latency."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Puis-je envoyer des images ?
Oui. DeepSeek V4.1 Flash lit les images nativement. Envoyez une URL publique ou une data URI base64 dans une partie image_url :
completion = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
{"type": "text", "text": "What does this chart show?"},
],
}],
)Une URL d'image peut compter jusqu'à 8 192 caractères et pointer vers un fichier de 32 MiB au maximum.
Quelles erreurs faut-il prévoir ?
| Erreur | Cause | Solution |
|---|---|---|
400 sur response_format | json_schema n'est pas pris en charge | Utilisez {"type": "json_object"} et décrivez la structure dans le prompt |
400 sur temperature ou top_p | Supérieur à 2 ou à 1 | Restez dans la plage ; avec la réflexion activée, ils ont de toute façon peu d'effet |
| 400 sur une URL d'image | Le fichier n'a pas pu être téléchargé comme image | Vérifiez que l'URL est publique et pointe vers une image |
| 401 | Clé absente ou incorrecte | Vérifiez l'en-tête Authorization |
Les erreurs renvoient {"error": {"code": ..., "message": "..."}}, et une requête qui échoue n'est pas facturée.
Questions fréquentes
L'API DeepSeek V4.1 Flash est-elle compatible OpenAI ?
Oui. Elle accepte les formats Chat Completions et Responses, donc le SDK OpenAI fonctionne en changeant seulement l'URL de base et le modèle. Elle accepte aussi le format Anthropic Messages.
Pourquoi l'ID de modèle diffère-t-il de celui de DeepSeek ?
DeepSeek nomme le modèle deepseek-flash sur sa propre API. SeedRouter utilise deepseek-v4.1-flash pour que la version fasse partie du nom. Le corps de requête est par ailleurs identique.
Combien coûte une requête DeepSeek V4.1 Flash ?
Elle est facturée au token, au tarif des heures pleines ou des heures creuses selon l'heure. Le guide des tarifs de DeepSeek V4.1 Flash donne les tarifs en direct et des exemples chiffrés.
Où trouver la liste complète des paramètres ?
La référence API de DeepSeek V4.1 Flash liste chaque champ, et la page DeepSeek V4.1 Flash propose un playground et les prix en direct.



