Especificações do DeepSeek V4.1 Flash: janela de contexto, saída máxima, tamanho e padrões
Especificações do DeepSeek V4.1 Flash: MoE de 552B parâmetros, contexto de 1M tokens, saída máxima de 384K, imagens, raciocínio e padrões que cortam respostas.
Ler em MarkdownO DeepSeek V4.1 Flash é um modelo mixture-of-experts de 552 bilhões de parâmetros, com janela de contexto de 1M tokens e saída máxima de 393.216 tokens (384K) por requisição. Ele lê texto e imagens, escreve texto e raciocina antes de responder, a menos que você desligue o raciocínio. A DeepSeek o lançou em 10 de setembro de 2026. A especificação que mais pega as pessoas é o limite de saída padrão, muito abaixo do máximo.
Especificações do DeepSeek V4.1 Flash em resumo
| Especificação | Valor |
|---|---|
| Desenvolvedor | DeepSeek |
| Lançamento | 10 de setembro de 2026 |
| Arquitetura | Mixture of experts, Causal Encoder–Decoder |
| Parâmetros totais | 552B |
| Parâmetros ativos | 8B para a entrada, 16B para a saída |
| Janela de contexto | 1M tokens |
| Saída máxima | 393.216 tokens (384K), raciocínio incluído |
| Limite de saída padrão | 8K sem raciocínio, 64K com raciocínio, 128K com esforço max |
| Entrada | Texto e imagens |
| Saída | Texto |
| Raciocínio | Ligado por padrão com esforço high; none, low, high ou max |
| ID do modelo no SeedRouter | deepseek-v4.1-flash |
| ID do modelo na API da DeepSeek | deepseek-flash |
Qual é o tamanho do DeepSeek V4.1 Flash?
552 bilhões de parâmetros no total. A nota de lançamento da DeepSeek descreve uma "nova arquitetura Causal Encoder–Decoder: apenas 8B parâmetros ativos para a entrada e 16B para a saída". Só uma pequena parte do modelo roda em cada token, e é por isso que ele é rápido e barato de servir apesar do tamanho.
A DeepSeek também diz que o cache KV dele precisa de "1/4 da HBM" e "1/8 do armazenamento em SSD" da geração anterior. Isso importa em sessões longas de agentes, em que a entrada em cache responde por boa parte do custo.
Qual é a janela de contexto do DeepSeek V4.1 Flash?
1M tokens. Prompt, imagens, histórico da conversa e resposta compartilham essa janela. A referência da API da DeepSeek diz assim: "O comprimento total dos tokens de entrada e dos tokens gerados é limitado pelo comprimento de contexto do modelo".
Para ver como os limites de contexto e de saída interagem em diferentes modelos, veja janela de contexto vs máximo de tokens de saída.
Qual é a saída máxima do DeepSeek V4.1 Flash?
393.216 tokens por requisição, que a DeepSeek lista como "MAXIMUM: 384K". O raciocínio conta para esse limite.
O problema está no padrão. Se você não definir max_tokens, a referência da DeepSeek diz que o limite é "8K no modo sem raciocínio, 64K no modo com raciocínio (128K com reasoning_effort em max)". Uma resposta longa ou um raciocínio longo batem nesse padrão bem antes do teto real, e a resposta termina com finish_reason: "length".
Para ter respostas mais longas, defina max_tokens você mesmo, com qualquer valor de 1 a 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}Você paga só pelos tokens que o modelo escreve, então um limite alto não custa mais por si só.
O DeepSeek V4.1 Flash lê imagens?
Sim. A DeepSeek o descreve como um modelo "com compreensão visual nativa". No SeedRouter, as imagens vão em uma mensagem de usuário como partes image_url, seja uma URL pública ou um data URI em base64. Uma URL pode ter até 8.192 caracteres e apontar para uma imagem de até 32 MiB. A saída é sempre texto.
Como funcionam os modos de raciocínio?
O raciocínio vem ligado por padrão com esforço high. Você pode:
- desligá-lo com
"thinking": {"type": "disabled"}ou"reasoning_effort": "none", para respostas rápidas com menos tokens de saída; - definir
reasoning_effortcomolow,highoumax.
O raciocínio volta em reasoning_content, ao lado da resposta, e é cobrado como tokens de saída. Com o raciocínio ligado, temperature não tem efeito e valores de top_p abaixo de 0.95 rodam como 0.95.
Quais APIs podem chamá-lo?
No SeedRouter, o DeepSeek V4.1 Flash aceita três formatos de requisição com a mesma chave:
| Formato | Endpoint |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
Chamadas de ferramentas funcionam nos três. O formato da Anthropic é o que o Claude Code usa, e o formato Responses é o que o Codex usa; a configuração do Claude Code e do Codex tem configurações testadas. Todos os parâmetros estão na referência da API do DeepSeek V4.1 Flash.
Quanto custa?
Por token, com tarifas separadas para a entrada que acerta o cache, a entrada que não acerta e a saída. As tarifas caem pela metade fora do horário de pico: o horário de pico é das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta, e todas as outras horas são fora do pico. A página do DeepSeek V4.1 Flash mostra as tarifas atuais, e o guia de preços traz exemplos calculados.
Perguntas frequentes
O DeepSeek V4.1 Flash é open source?
A DeepSeek publica os pesos no Hugging Face; O DeepSeek V4.1 Flash é grátis? explica o que isso significa para o custo.
O deepseek-v4-flash é o mesmo modelo?
Na API da própria DeepSeek, o nome antigo agora aponta para o V4.1 Flash. A página de preços da DeepSeek diz que "os modelos correspondentes foram descontinuados, e as requisições deles são atendidas pelo modelo DeepSeek-V4.1-Flash". V4.1 Flash vs V4 Flash lista o que mudou.
Por que o DeepSeek V4.1 Flash para em 8K tokens?
É o limite de saída padrão com o raciocínio desligado. Defina max_tokens até 393216 para permitir respostas mais longas.
A janela de contexto inclui a saída?
Sim. Entrada e saída compartilham a janela de 1M tokens.
Como ele se compara ao DeepSeek V4 Pro?
A DeepSeek reporta o V4.1 Flash à frente do V4 Pro nos benchmarks dela, e ele custa menos. Veja DeepSeek V4.1 Flash vs V4 Pro.



