Claude Opus 5.5 est disponible sur SeedRouter

API DeepSeek V4.1 Flash : obtenir une clé et faire votre premier appel

Utiliser l’API DeepSeek V4.1 Flash : obtenir une clé, l’appeler avec le SDK OpenAI, activer ou couper la réflexion, streamer, images, erreurs courantes.

Lire en Markdown

Pour appeler DeepSeek V4.1 Flash, il vous faut une clé API d'une plateforme qui le propose et une requête avec son ID de modèle. Sur l'API de DeepSeek elle-même, le modèle s'appelle deepseek-flash, et les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp sont redirigés vers lui. Sur SeedRouter, l'ID de modèle est deepseek-v4.1-flash, et une seule clé l'appelle à l'usage dans le format de requête officiel : pointez le SDK OpenAI vers https://api.seedrouter.ai/v1 et gardez votre code.

Ce guide utilise SeedRouter ; les corps de requête sont les mêmes que sur l'API de DeepSeek.

Comment obtenir une clé API DeepSeek V4.1 Flash ?

  1. Connectez-vous à SeedRouter et ouvrez API keys.
  2. Créez une clé et copiez-la ; elle n'est affichée qu'une fois.
  3. Ajoutez du crédit quand vous en avez besoin. Les nouveaux comptes démarrent avec un petit solde gratuit, et il n'y a pas d'abonnement.

Stockez la clé dans une variable d'environnement comme SEEDROUTER_API_KEY, et ne l'utilisez que depuis du code côté serveur.

Comment appeler DeepSeek V4.1 Flash en Python ?

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["SEEDROUTER_API_KEY"],
    base_url="https://api.seedrouter.ai/v1",
)

completion = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Give me three names for a coffee shop."}],
)
print(completion.choices[0].message.content)

Le mode réflexion est activé par défaut : le message contient donc aussi le raisonnement du modèle dans reasoning_content, à côté de la réponse dans content.

Comment l'appeler en Node.js ou avec cURL ?

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.SEEDROUTER_API_KEY,
  baseURL: "https://api.seedrouter.ai/v1",
});

const completion = await client.chat.completions.create({
  model: "deepseek-v4.1-flash",
  messages: [{ role: "user", content: "Give me three names for a coffee shop." }],
});
console.log(completion.choices[0].message.content);
curl https://api.seedrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "deepseek-v4.1-flash", "messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]}'

La même clé répond aussi à l'API Responses (/v1/responses) et au format Anthropic Messages (/v1/messages) pour deepseek-v4.1-flash.

Comment couper la réflexion ou régler son effort ?

La réflexion est activée par défaut avec l'effort high. Coupez-la avec thinking, ou choisissez un effort avec reasoning_effort. Le SDK OpenAI transmet thinking via extra_body. La première requête coupe la réflexion pour la réponse la plus rapide et la moins chère ; la seconde utilise l'effort le plus élevé :

completion = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Classify: 'my card was charged twice'"}],
    extra_body={"thinking": {"type": "disabled"}},
)

completion = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "How many primes are there below 150?"}],
    reasoning_effort="max",
)
reasoning_effortEffet
noneRéflexion coupée
lowRaisonnement court
high (par défaut)La plupart des tâches
maxLes problèmes les plus difficiles

DeepSeek accepte aussi minimal (exécuté comme low), medium et xhigh (exécutés comme high). Dans notre test sur une question de comptage de nombres premiers, la réflexion coupée a utilisé 2 tokens de sortie, low 258 et max 319. Le raisonnement est facturé comme de la sortie.

Comment streamer la réponse ?

Ajoutez stream=True. Avec la réflexion activée, le raisonnement arrive d'abord dans delta.reasoning_content, puis la réponse dans delta.content, et le dernier chunk contient la consommation de tokens :

stream = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Write a haiku about latency."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Puis-je envoyer des images ?

Oui. DeepSeek V4.1 Flash lit les images nativement. Envoyez une URL publique ou une data URI base64 dans une partie image_url :

completion = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
            {"type": "text", "text": "What does this chart show?"},
        ],
    }],
)

Une URL d'image peut compter jusqu'à 8 192 caractères et pointer vers un fichier de 32 MiB au maximum.

Quelles erreurs faut-il prévoir ?

ErreurCauseSolution
400 sur response_formatjson_schema n'est pas pris en chargeUtilisez {"type": "json_object"} et décrivez la structure dans le prompt
400 sur temperature ou top_pSupérieur à 2 ou à 1Restez dans la plage ; avec la réflexion activée, ils ont de toute façon peu d'effet
400 sur une URL d'imageLe fichier n'a pas pu être téléchargé comme imageVérifiez que l'URL est publique et pointe vers une image
401Clé absente ou incorrecteVérifiez l'en-tête Authorization

Les erreurs renvoient {"error": {"code": ..., "message": "..."}}, et une requête qui échoue n'est pas facturée.

Questions fréquentes

L'API DeepSeek V4.1 Flash est-elle compatible OpenAI ?

Oui. Elle accepte les formats Chat Completions et Responses, donc le SDK OpenAI fonctionne en changeant seulement l'URL de base et le modèle. Elle accepte aussi le format Anthropic Messages.

Pourquoi l'ID de modèle diffère-t-il de celui de DeepSeek ?

DeepSeek nomme le modèle deepseek-flash sur sa propre API. SeedRouter utilise deepseek-v4.1-flash pour que la version fasse partie du nom. Le corps de requête est par ailleurs identique.

Combien coûte une requête DeepSeek V4.1 Flash ?

Elle est facturée au token, au tarif des heures pleines ou des heures creuses selon l'heure. Le guide des tarifs de DeepSeek V4.1 Flash donne les tarifs en direct et des exemples chiffrés.

Où trouver la liste complète des paramètres ?

La référence API de DeepSeek V4.1 Flash liste chaque champ, et la page DeepSeek V4.1 Flash propose un playground et les prix en direct.

Guides associés