DeepSeek V4.1 Flash Specs: Kontextfenster, maximale Ausgabe, Größe und Standardwerte
DeepSeek V4.1 Flash Specs: MoE mit 552 Mrd. Parametern, 1M Token Kontext, 384K maximale Ausgabe, Bildeingabe, Thinking-Modi und Standardwerte, die kappen.
Als Markdown lesenDeepSeek V4.1 Flash ist ein Mixture-of-Experts-Modell mit 552 Milliarden Parametern, einem Kontextfenster von 1M Token und einer maximalen Ausgabe von 393.216 Token (384K) pro Anfrage. Es liest Text und Bilder, schreibt Text und denkt vor der Antwort nach, sofern Sie Thinking nicht abschalten. DeepSeek hat es am 10. September 2026 veröffentlicht. Die Angabe, über die die meisten stolpern, ist das Standard-Ausgabelimit, das weit unter dem Maximum liegt.
DeepSeek V4.1 Flash Specs auf einen Blick
| Spec | Wert |
|---|---|
| Entwickler | DeepSeek |
| Veröffentlicht | 10. September 2026 |
| Architektur | Mixture of Experts, Causal Encoder–Decoder |
| Parameter gesamt | 552B |
| Aktive Parameter | 8B für die Eingabe, 16B für die Ausgabe |
| Kontextfenster | 1M Token |
| Maximale Ausgabe | 393.216 Token (384K), einschließlich Reasoning |
| Standard-Ausgabelimit | 8K ohne Thinking, 64K mit Thinking, 128K bei Aufwand max |
| Eingabe | Text und Bilder |
| Ausgabe | Text |
| Thinking | Standardmäßig an mit Aufwand high; none, low, high oder max |
| Modell-ID bei SeedRouter | deepseek-v4.1-flash |
| Modell-ID in DeepSeeks API | deepseek-flash |
Wie groß ist DeepSeek V4.1 Flash?
Insgesamt 552 Milliarden Parameter. DeepSeeks Release Note beschreibt eine „neue Causal-Encoder–Decoder-Architektur: nur 8B aktive Parameter für die Eingabe, 16B für die Ausgabe“. Pro Token läuft nur ein kleiner Teil des Modells, weshalb es trotz seiner Größe schnell und günstig bereitzustellen ist.
DeepSeek sagt außerdem, dass sein KV-Cache „1/4 des HBM“ und „1/8 des SSD-Speichers“ der vorherigen Generation braucht. Das ist wichtig für lange Agent-Sitzungen, in denen gecachte Eingabe einen Großteil der Kosten ausmacht.
Wie groß ist das Kontextfenster von DeepSeek V4.1 Flash?
1M Token. Prompt, Bilder, Gesprächsverlauf und Antwort teilen es sich. DeepSeeks API-Referenz formuliert es so: „Die Gesamtlänge aus Eingabe-Token und generierten Token ist durch die Kontextlänge des Modells begrenzt.“
Wie Kontext- und Ausgabelimits bei verschiedenen Modellen zusammenspielen, lesen Sie unter Kontextfenster vs. maximale Ausgabe-Token.
Wie hoch ist die maximale Ausgabe von DeepSeek V4.1 Flash?
393.216 Token pro Anfrage, von DeepSeek als „MAXIMUM: 384K“ angegeben. Das Reasoning zählt mit.
Der Haken ist der Standardwert. Wenn Sie max_tokens nicht setzen, liegt das Limit laut DeepSeeks Referenz bei „8K im Non-Thinking-Modus, 64K im Thinking-Modus (128K mit reasoning_effort auf max)“. Eine lange Antwort oder ein langer Reasoning-Verlauf erreicht diesen Standard lange vor der eigentlichen Obergrenze, und die Antwort endet mit finish_reason: "length".
Für längere Antworten setzen Sie max_tokens selbst, auf einen Wert von 1 bis 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}Sie zahlen nur für die Token, die das Modell schreibt, ein hohes Limit kostet also für sich genommen nicht mehr.
Liest DeepSeek V4.1 Flash Bilder?
Ja. DeepSeek nennt es ein Modell „mit nativem visuellem Verständnis“. Bei SeedRouter gehen Bilder als image_url-Teile in eine Nutzernachricht, entweder als öffentliche URL oder als base64-Data-URI. Eine URL darf bis zu 8.192 Zeichen lang sein und auf ein Bild von bis zu 32 MiB zeigen. Die Ausgabe ist immer Text.
Wie funktionieren die Thinking-Modi?
Thinking ist standardmäßig mit Aufwand high aktiv. Sie können:
- es mit
"thinking": {"type": "disabled"}oder"reasoning_effort": "none"abschalten, für schnelle Antworten mit weniger Ausgabe-Token; reasoning_effortauflow,highodermaxsetzen.
Das Reasoning kommt in reasoning_content zurück, neben der Antwort, und wird als Ausgabe-Token abgerechnet. Mit aktivem Thinking hat temperature keine Wirkung, und top_p-Werte unter 0,95 laufen als 0,95.
Welche APIs können es aufrufen?
Bei SeedRouter nimmt DeepSeek V4.1 Flash mit demselben Key drei Anfrageformate an:
| Format | Endpunkt |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
Tool-Aufrufe funktionieren in allen dreien. Das Anthropic-Format nutzt Claude Code, das Responses-Format nutzt Codex; die Einrichtung für Claude Code und Codex enthält getestete Konfigurationen. Jeder Parameter steht in der DeepSeek V4.1 Flash API-Referenz.
Wie wird abgerechnet?
Pro Token, mit separaten Tarifen für Eingabe mit Cache-Treffer, Eingabe ohne Cache-Treffer und Ausgabe. In der Nebenzeit halbieren sich die Tarife: Hauptzeit ist 01:00–04:00 und 06:00–10:00 UTC, Montag bis Freitag, jede andere Stunde ist Nebenzeit. Die DeepSeek V4.1 Flash Seite zeigt die aktuellen Tarife, und der Preisleitfaden rechnet Beispiele durch.
Häufig gestellte Fragen
Ist DeepSeek V4.1 Flash Open Source?
DeepSeek veröffentlicht die Gewichte auf Hugging Face; Ist DeepSeek V4.1 Flash kostenlos? erklärt, was das für die Kosten bedeutet.
Ist deepseek-v4-flash dasselbe Modell?
In DeepSeeks eigener API leitet der alte Name jetzt auf V4.1 Flash. DeepSeeks Preisseite sagt: „Die entsprechenden Modelle wurden eingestellt, ihre Anfragen werden vom Modell DeepSeek-V4.1-Flash bedient.“ V4.1 Flash vs. V4 Flash listet die Änderungen.
Warum stoppt DeepSeek V4.1 Flash bei 8K Token?
Das ist das Standard-Ausgabelimit ohne Thinking. Setzen Sie max_tokens auf bis zu 393216, um längere Antworten zu erlauben.
Umfasst das Kontextfenster die Ausgabe?
Ja. Eingabe und Ausgabe teilen sich das Fenster von 1M Token.
Wie schneidet es im Vergleich zu DeepSeek V4 Pro ab?
DeepSeek sieht V4.1 Flash in seinen Benchmarks vor V4 Pro, und es kostet weniger. Siehe DeepSeek V4.1 Flash vs. V4 Pro.



