Claude Opus 5.5 já está disponível no SeedRouter

Especificações do DeepSeek V4.1 Flash: janela de contexto, saída máxima, tamanho e padrões

Especificações do DeepSeek V4.1 Flash: MoE de 552B parâmetros, contexto de 1M tokens, saída máxima de 384K, imagens, raciocínio e padrões que cortam respostas.

Ler em Markdown

O DeepSeek V4.1 Flash é um modelo mixture-of-experts de 552 bilhões de parâmetros, com janela de contexto de 1M tokens e saída máxima de 393.216 tokens (384K) por requisição. Ele lê texto e imagens, escreve texto e raciocina antes de responder, a menos que você desligue o raciocínio. A DeepSeek o lançou em 10 de setembro de 2026. A especificação que mais pega as pessoas é o limite de saída padrão, muito abaixo do máximo.

Especificações do DeepSeek V4.1 Flash em resumo

EspecificaçãoValor
DesenvolvedorDeepSeek
Lançamento10 de setembro de 2026
ArquiteturaMixture of experts, Causal Encoder–Decoder
Parâmetros totais552B
Parâmetros ativos8B para a entrada, 16B para a saída
Janela de contexto1M tokens
Saída máxima393.216 tokens (384K), raciocínio incluído
Limite de saída padrão8K sem raciocínio, 64K com raciocínio, 128K com esforço max
EntradaTexto e imagens
SaídaTexto
RaciocínioLigado por padrão com esforço high; none, low, high ou max
ID do modelo no SeedRouterdeepseek-v4.1-flash
ID do modelo na API da DeepSeekdeepseek-flash

Qual é o tamanho do DeepSeek V4.1 Flash?

552 bilhões de parâmetros no total. A nota de lançamento da DeepSeek descreve uma "nova arquitetura Causal Encoder–Decoder: apenas 8B parâmetros ativos para a entrada e 16B para a saída". Só uma pequena parte do modelo roda em cada token, e é por isso que ele é rápido e barato de servir apesar do tamanho.

A DeepSeek também diz que o cache KV dele precisa de "1/4 da HBM" e "1/8 do armazenamento em SSD" da geração anterior. Isso importa em sessões longas de agentes, em que a entrada em cache responde por boa parte do custo.

Qual é a janela de contexto do DeepSeek V4.1 Flash?

1M tokens. Prompt, imagens, histórico da conversa e resposta compartilham essa janela. A referência da API da DeepSeek diz assim: "O comprimento total dos tokens de entrada e dos tokens gerados é limitado pelo comprimento de contexto do modelo".

Para ver como os limites de contexto e de saída interagem em diferentes modelos, veja janela de contexto vs máximo de tokens de saída.

Qual é a saída máxima do DeepSeek V4.1 Flash?

393.216 tokens por requisição, que a DeepSeek lista como "MAXIMUM: 384K". O raciocínio conta para esse limite.

O problema está no padrão. Se você não definir max_tokens, a referência da DeepSeek diz que o limite é "8K no modo sem raciocínio, 64K no modo com raciocínio (128K com reasoning_effort em max)". Uma resposta longa ou um raciocínio longo batem nesse padrão bem antes do teto real, e a resposta termina com finish_reason: "length".

Para ter respostas mais longas, defina max_tokens você mesmo, com qualquer valor de 1 a 393216:

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

Você paga só pelos tokens que o modelo escreve, então um limite alto não custa mais por si só.

O DeepSeek V4.1 Flash lê imagens?

Sim. A DeepSeek o descreve como um modelo "com compreensão visual nativa". No SeedRouter, as imagens vão em uma mensagem de usuário como partes image_url, seja uma URL pública ou um data URI em base64. Uma URL pode ter até 8.192 caracteres e apontar para uma imagem de até 32 MiB. A saída é sempre texto.

Como funcionam os modos de raciocínio?

O raciocínio vem ligado por padrão com esforço high. Você pode:

  • desligá-lo com "thinking": {"type": "disabled"} ou "reasoning_effort": "none", para respostas rápidas com menos tokens de saída;
  • definir reasoning_effort como low, high ou max.

O raciocínio volta em reasoning_content, ao lado da resposta, e é cobrado como tokens de saída. Com o raciocínio ligado, temperature não tem efeito e valores de top_p abaixo de 0.95 rodam como 0.95.

Quais APIs podem chamá-lo?

No SeedRouter, o DeepSeek V4.1 Flash aceita três formatos de requisição com a mesma chave:

FormatoEndpoint
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

Chamadas de ferramentas funcionam nos três. O formato da Anthropic é o que o Claude Code usa, e o formato Responses é o que o Codex usa; a configuração do Claude Code e do Codex tem configurações testadas. Todos os parâmetros estão na referência da API do DeepSeek V4.1 Flash.

Quanto custa?

Por token, com tarifas separadas para a entrada que acerta o cache, a entrada que não acerta e a saída. As tarifas caem pela metade fora do horário de pico: o horário de pico é das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta, e todas as outras horas são fora do pico. A página do DeepSeek V4.1 Flash mostra as tarifas atuais, e o guia de preços traz exemplos calculados.

Perguntas frequentes

O DeepSeek V4.1 Flash é open source?

A DeepSeek publica os pesos no Hugging Face; O DeepSeek V4.1 Flash é grátis? explica o que isso significa para o custo.

O deepseek-v4-flash é o mesmo modelo?

Na API da própria DeepSeek, o nome antigo agora aponta para o V4.1 Flash. A página de preços da DeepSeek diz que "os modelos correspondentes foram descontinuados, e as requisições deles são atendidas pelo modelo DeepSeek-V4.1-Flash". V4.1 Flash vs V4 Flash lista o que mudou.

Por que o DeepSeek V4.1 Flash para em 8K tokens?

É o limite de saída padrão com o raciocínio desligado. Defina max_tokens até 393216 para permitir respostas mais longas.

A janela de contexto inclui a saída?

Sim. Entrada e saída compartilham a janela de 1M tokens.

Como ele se compara ao DeepSeek V4 Pro?

A DeepSeek reporta o V4.1 Flash à frente do V4 Pro nos benchmarks dela, e ele custa menos. Veja DeepSeek V4.1 Flash vs V4 Pro.

Guias relacionados