Specyfikacja DeepSeek V4.1 Flash: okno kontekstu, maks. wyjście, rozmiar i wartości domyślne
Specyfikacja DeepSeek V4.1 Flash: MoE z 552B parametrów, kontekst 1M tokenów, maks. wyjście 384K, obrazy, rozumowanie i domyślne limity urywające odpowiedzi.
Czytaj jako MarkdownDeepSeek V4.1 Flash to model mixture-of-experts z 552 miliardami parametrów, oknem kontekstu 1M tokenów i maksymalnym wyjściem 393 216 tokenów (384K) na żądanie. Czyta tekst i obrazy, pisze tekst i rozumuje przed odpowiedzią, chyba że wyłączysz rozumowanie. DeepSeek wydał go 10 września 2026 r. Parametr, o który potyka się najwięcej osób, to domyślny limit wyjścia, dużo niższy od maksimum.
Specyfikacja DeepSeek V4.1 Flash w skrócie
| Parametr | Wartość |
|---|---|
| Twórca | DeepSeek |
| Premiera | 10 września 2026 r. |
| Architektura | Mixture of experts, Causal Encoder–Decoder |
| Łączna liczba parametrów | 552B |
| Aktywne parametry | 8B na wejście, 16B na wyjście |
| Okno kontekstu | 1M tokenów |
| Maks. wyjście | 393 216 tokenów (384K), wliczając rozumowanie |
| Domyślny limit wyjścia | 8K bez rozumowania, 64K z rozumowaniem, 128K przy poziomie max |
| Wejście | Tekst i obrazy |
| Wyjście | Tekst |
| Rozumowanie | Domyślnie włączone na poziomie high; none, low, high lub max |
| ID modelu w SeedRouter | deepseek-v4.1-flash |
| ID modelu w API DeepSeek | deepseek-flash |
Jak duży jest DeepSeek V4.1 Flash?
552 miliardy parametrów łącznie. Nota wydania DeepSeek opisuje „nową architekturę Causal Encoder–Decoder: tylko 8B aktywnych parametrów na wejście i 16B na wyjście”. Na każdy token pracuje tylko niewielka część modelu, dlatego mimo rozmiaru jest szybki i tani w serwowaniu.
DeepSeek podaje też, że jego pamięć podręczna KV potrzebuje „1/4 HBM” i „1/8 pamięci SSD” poprzedniej generacji. Ma to znaczenie w długich sesjach agentów, gdzie wejście z cache stanowi dużą część kosztu.
Jakie okno kontekstu ma DeepSeek V4.1 Flash?
1M tokenów. Prompt, obrazy, historia rozmowy i odpowiedź dzielą to okno. Dokumentacja API DeepSeek ujmuje to tak: „Łączna długość tokenów wejściowych i wygenerowanych tokenów jest ograniczona długością kontekstu modelu”.
Jak limity kontekstu i wyjścia współdziałają w różnych modelach, wyjaśnia tekst okno kontekstu a maksymalna liczba tokenów wyjściowych.
Jakie jest maksymalne wyjście DeepSeek V4.1 Flash?
393 216 tokenów na żądanie, co DeepSeek podaje jako „MAXIMUM: 384K”. Rozumowanie wlicza się do tego limitu.
Haczyk tkwi w wartości domyślnej. Jeśli nie ustawisz max_tokens, dokumentacja DeepSeek mówi, że limit wynosi „8K w trybie bez rozumowania, 64K w trybie rozumowania (128K przy reasoning_effort ustawionym na max)”. Długa odpowiedź lub długie rozumowanie trafiają na ten domyślny limit dużo wcześniej niż na prawdziwy pułap, a odpowiedź kończy się finish_reason: "length".
Aby dostać dłuższe odpowiedzi, ustaw max_tokens samodzielnie, na dowolną wartość od 1 do 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}Płacisz tylko za tokeny, które model napisze, więc wysoki limit sam w sobie nie kosztuje więcej.
Czy DeepSeek V4.1 Flash czyta obrazy?
Tak. DeepSeek nazywa go modelem „z natywnym rozumieniem obrazu”. W SeedRouter obrazy trafiają do wiadomości użytkownika jako części image_url: publiczny adres URL albo data URI w base64. URL może mieć do 8 192 znaków i wskazywać obraz o rozmiarze do 32 MiB. Wyjście to zawsze tekst.
Jak działają tryby rozumowania?
Rozumowanie jest domyślnie włączone na poziomie high. Możesz:
- wyłączyć je przez
"thinking": {"type": "disabled"}lub"reasoning_effort": "none", żeby dostać szybkie odpowiedzi z mniejszą liczbą tokenów wyjściowych; - ustawić
reasoning_effortnalow,highlubmax.
Rozumowanie wraca w reasoning_content, obok odpowiedzi, i jest rozliczane jako tokeny wyjściowe. Przy włączonym rozumowaniu temperature nie ma wpływu, a wartości top_p poniżej 0.95 działają jak 0.95.
Przez jakie API można go wywołać?
W SeedRouter DeepSeek V4.1 Flash przyjmuje trzy formaty żądań z tym samym kluczem:
| Format | Endpoint |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
Wywołania narzędzi działają we wszystkich trzech. Format Anthropic to ten, którego używa Claude Code, a format Responses to ten, którego używa Codex; konfiguracja Claude Code i Codex zawiera sprawdzone ustawienia. Wszystkie parametry są w dokumentacji API DeepSeek V4.1 Flash.
Ile kosztuje?
Za token, z osobnymi stawkami dla wejścia trafiającego w cache, wejścia spoza cache i wyjścia. Poza szczytem stawki spadają o połowę: godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC, od poniedziałku do piątku, a wszystkie pozostałe godziny są poza szczytem. Strona DeepSeek V4.1 Flash pokazuje aktualne stawki, a przewodnik po cenach zawiera wyliczone przykłady.
Najczęściej zadawane pytania
Czy DeepSeek V4.1 Flash jest open source?
DeepSeek publikuje wagi na Hugging Face; Czy DeepSeek V4.1 Flash jest za darmo? wyjaśnia, co to oznacza dla kosztów.
Czy deepseek-v4-flash to ten sam model?
We własnym API DeepSeek stara nazwa prowadzi teraz do V4.1 Flash. Cennik DeepSeek mówi, że „odpowiednie modele zostały wycofane, a ich żądania obsługuje model DeepSeek-V4.1-Flash”. V4.1 Flash vs V4 Flash wymienia, co się zmieniło.
Dlaczego DeepSeek V4.1 Flash zatrzymuje się na 8K tokenów?
To domyślny limit wyjścia przy wyłączonym rozumowaniu. Ustaw max_tokens do 393216, żeby pozwolić na dłuższe odpowiedzi.
Czy okno kontekstu obejmuje wyjście?
Tak. Wejście i wyjście dzielą okno 1M tokenów.
Jak wypada w porównaniu z DeepSeek V4 Pro?
DeepSeek podaje, że V4.1 Flash wyprzedza V4 Pro w jego benchmarkach, a przy tym kosztuje mniej. Zobacz DeepSeek V4.1 Flash vs V4 Pro.



