Claude Opus 5.5 jest już dostępny w SeedRouter

Specyfikacja DeepSeek V4.1 Flash: okno kontekstu, maks. wyjście, rozmiar i wartości domyślne

Specyfikacja DeepSeek V4.1 Flash: MoE z 552B parametrów, kontekst 1M tokenów, maks. wyjście 384K, obrazy, rozumowanie i domyślne limity urywające odpowiedzi.

Czytaj jako Markdown

DeepSeek V4.1 Flash to model mixture-of-experts z 552 miliardami parametrów, oknem kontekstu 1M tokenów i maksymalnym wyjściem 393 216 tokenów (384K) na żądanie. Czyta tekst i obrazy, pisze tekst i rozumuje przed odpowiedzią, chyba że wyłączysz rozumowanie. DeepSeek wydał go 10 września 2026 r. Parametr, o który potyka się najwięcej osób, to domyślny limit wyjścia, dużo niższy od maksimum.

Specyfikacja DeepSeek V4.1 Flash w skrócie

ParametrWartość
TwórcaDeepSeek
Premiera10 września 2026 r.
ArchitekturaMixture of experts, Causal Encoder–Decoder
Łączna liczba parametrów552B
Aktywne parametry8B na wejście, 16B na wyjście
Okno kontekstu1M tokenów
Maks. wyjście393 216 tokenów (384K), wliczając rozumowanie
Domyślny limit wyjścia8K bez rozumowania, 64K z rozumowaniem, 128K przy poziomie max
WejścieTekst i obrazy
WyjścieTekst
RozumowanieDomyślnie włączone na poziomie high; none, low, high lub max
ID modelu w SeedRouterdeepseek-v4.1-flash
ID modelu w API DeepSeekdeepseek-flash

Jak duży jest DeepSeek V4.1 Flash?

552 miliardy parametrów łącznie. Nota wydania DeepSeek opisuje „nową architekturę Causal Encoder–Decoder: tylko 8B aktywnych parametrów na wejście i 16B na wyjście”. Na każdy token pracuje tylko niewielka część modelu, dlatego mimo rozmiaru jest szybki i tani w serwowaniu.

DeepSeek podaje też, że jego pamięć podręczna KV potrzebuje „1/4 HBM” i „1/8 pamięci SSD” poprzedniej generacji. Ma to znaczenie w długich sesjach agentów, gdzie wejście z cache stanowi dużą część kosztu.

Jakie okno kontekstu ma DeepSeek V4.1 Flash?

1M tokenów. Prompt, obrazy, historia rozmowy i odpowiedź dzielą to okno. Dokumentacja API DeepSeek ujmuje to tak: „Łączna długość tokenów wejściowych i wygenerowanych tokenów jest ograniczona długością kontekstu modelu”.

Jak limity kontekstu i wyjścia współdziałają w różnych modelach, wyjaśnia tekst okno kontekstu a maksymalna liczba tokenów wyjściowych.

Jakie jest maksymalne wyjście DeepSeek V4.1 Flash?

393 216 tokenów na żądanie, co DeepSeek podaje jako „MAXIMUM: 384K”. Rozumowanie wlicza się do tego limitu.

Haczyk tkwi w wartości domyślnej. Jeśli nie ustawisz max_tokens, dokumentacja DeepSeek mówi, że limit wynosi „8K w trybie bez rozumowania, 64K w trybie rozumowania (128K przy reasoning_effort ustawionym na max)”. Długa odpowiedź lub długie rozumowanie trafiają na ten domyślny limit dużo wcześniej niż na prawdziwy pułap, a odpowiedź kończy się finish_reason: "length".

Aby dostać dłuższe odpowiedzi, ustaw max_tokens samodzielnie, na dowolną wartość od 1 do 393216:

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

Płacisz tylko za tokeny, które model napisze, więc wysoki limit sam w sobie nie kosztuje więcej.

Czy DeepSeek V4.1 Flash czyta obrazy?

Tak. DeepSeek nazywa go modelem „z natywnym rozumieniem obrazu”. W SeedRouter obrazy trafiają do wiadomości użytkownika jako części image_url: publiczny adres URL albo data URI w base64. URL może mieć do 8 192 znaków i wskazywać obraz o rozmiarze do 32 MiB. Wyjście to zawsze tekst.

Jak działają tryby rozumowania?

Rozumowanie jest domyślnie włączone na poziomie high. Możesz:

  • wyłączyć je przez "thinking": {"type": "disabled"} lub "reasoning_effort": "none", żeby dostać szybkie odpowiedzi z mniejszą liczbą tokenów wyjściowych;
  • ustawić reasoning_effort na low, high lub max.

Rozumowanie wraca w reasoning_content, obok odpowiedzi, i jest rozliczane jako tokeny wyjściowe. Przy włączonym rozumowaniu temperature nie ma wpływu, a wartości top_p poniżej 0.95 działają jak 0.95.

Przez jakie API można go wywołać?

W SeedRouter DeepSeek V4.1 Flash przyjmuje trzy formaty żądań z tym samym kluczem:

FormatEndpoint
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

Wywołania narzędzi działają we wszystkich trzech. Format Anthropic to ten, którego używa Claude Code, a format Responses to ten, którego używa Codex; konfiguracja Claude Code i Codex zawiera sprawdzone ustawienia. Wszystkie parametry są w dokumentacji API DeepSeek V4.1 Flash.

Ile kosztuje?

Za token, z osobnymi stawkami dla wejścia trafiającego w cache, wejścia spoza cache i wyjścia. Poza szczytem stawki spadają o połowę: godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC, od poniedziałku do piątku, a wszystkie pozostałe godziny są poza szczytem. Strona DeepSeek V4.1 Flash pokazuje aktualne stawki, a przewodnik po cenach zawiera wyliczone przykłady.

Najczęściej zadawane pytania

Czy DeepSeek V4.1 Flash jest open source?

DeepSeek publikuje wagi na Hugging Face; Czy DeepSeek V4.1 Flash jest za darmo? wyjaśnia, co to oznacza dla kosztów.

Czy deepseek-v4-flash to ten sam model?

We własnym API DeepSeek stara nazwa prowadzi teraz do V4.1 Flash. Cennik DeepSeek mówi, że „odpowiednie modele zostały wycofane, a ich żądania obsługuje model DeepSeek-V4.1-Flash”. V4.1 Flash vs V4 Flash wymienia, co się zmieniło.

Dlaczego DeepSeek V4.1 Flash zatrzymuje się na 8K tokenów?

To domyślny limit wyjścia przy wyłączonym rozumowaniu. Ustaw max_tokens do 393216, żeby pozwolić na dłuższe odpowiedzi.

Czy okno kontekstu obejmuje wyjście?

Tak. Wejście i wyjście dzielą okno 1M tokenów.

Jak wypada w porównaniu z DeepSeek V4 Pro?

DeepSeek podaje, że V4.1 Flash wyprzedza V4 Pro w jego benchmarkach, a przy tym kosztuje mniej. Zobacz DeepSeek V4.1 Flash vs V4 Pro.

Powiązane poradniki