DeepSeek V4.1 Flash — raciocínio rápido e barato com imagens
O DeepSeek V4.1 Flash é o modelo rápido e de baixo custo da DeepSeek, com contexto de 1M de tokens e entrada de imagens. $0.24 / 1M entrada, $0.96 / 1M saída por 1M de tokens no horário de pico; metade disso fora do horário de pico.
- Raciocínio ligado ou desligado
- Contexto de 1M de tokens
- Entrada de imagem
- Preços fora do horário de pico
- Streaming
Experimente o DeepSeek V4.1 Flash
Converse com o DeepSeek V4.1 Flash, anexe imagens e veja os tokens e o custo de cada resposta.
deepseek-v4.1-flash$0.24 entrada · $0.96 saída por milhão de tokens (horário de pico agora)
Com o raciocínio ligado, temperature não tem efeito e um top_p abaixo de 0.95 é executado como 0.95.
Aceito, mas nenhuma probabilidade logarítmica é retornada.
Experimente um destes prompts
As mensagens são cobradas do seu saldo conforme as tarifas abaixo, como uma chamada de API. Requisições que falham não custam nada.
Saída real do DeepSeek V4.1 Flash
Um prompt, enviado ao DeepSeek V4.1 Flash com o raciocínio desligado. Sem edição.
Explain the difference between a mutex and a semaphore in two short paragraphs, and say when to use each.
A mutex is a locking mechanism designed for mutual exclusion: only the thread that locked it may unlock it, and it has a notion of ownership. It's binary (locked/unlocked) and is used to protect a shared resource so that only one thread accesses it at a time. A semaphore is a signaling mechanism built around a counter: it tracks how many permits are available, any thread can wait (decrement) or post (increment) it, and it doesn't care which thread does what. A binary semaphore looks similar to a mutex, but lacks ownership, so it can be released by a different thread—useful for signaling between threads rather than guarding a critical section. Use a mutex when you need to protect a shared resource (a data structure, file, or device) from concurrent access, which is the common case for locking critical sections. Use a semaphore when you need to control access to a pool of N identical resources (e.g., limiting concurrent database connections) or to signal between threads, such as a producer notifying a consumer that data is ready or a task-completion event. As a rule of thumb: mutex for mutual exclusion, semaphore for counting or signaling.
Gerado em 28 de setembro de 2026. As respostas variam de execução para execução.
Preços do DeepSeek V4.1 Flash
O DeepSeek V4.1 Flash é cobrado por token do seu saldo, com tarifas de horário de pico ou fora de pico conforme a hora. As tarifas abaixo são em tempo real, as mesmas cobradas na sua conta.
Os tamanhos de exemplo são ilustrativos e usam as tarifas do horário de pico. Sua cobrança segue os tokens informados por cada requisição e a hora em que ela roda.
| Item | Contado como | Tarifa | Cobrança |
|---|---|---|---|
| Entrada, horário de pico | Tokens de prompt que não estão no cache, 01:00–04:00 e 06:00–10:00 UTC, seg–sex | $0.24 / 1M | Por 1M de tokens |
| Saída, horário de pico | Tokens de resposta e raciocínio, horário de pico | $0.96 / 1M | Por 1M de tokens |
| Entrada em cache, horário de pico | Tokens de prompt que estão no cache, horário de pico | $0.0048 / 1M | Por 1M de tokens |
| Entrada, fora do horário de pico | Tokens de prompt que não estão no cache, todas as outras horas, incluindo fins de semana | $0.12 / 1M | Por 1M de tokens |
| Saída, fora do horário de pico | Tokens de resposta e raciocínio, fora do horário de pico | $0.48 / 1M | Por 1M de tokens |
| Entrada em cache, fora do horário de pico | Tokens de prompt que estão no cache, fora do horário de pico | $0.0024 / 1M | Por 1M de tokens |
| Requisição que falhou | Qualquer requisição que retorna um erro | Grátis | Não cobrada |
O que é o DeepSeek V4.1 Flash?
O DeepSeek V4.1 Flash é o modelo rápido e de baixo custo da DeepSeek, lançado em 10 de setembro de 2026. É um modelo mixture-of-experts de 552B parâmetros que ativa 8B parâmetros para ler e 16B para escrever, lê imagens nativamente e aceita até 1M de tokens de contexto.
Por padrão, o DeepSeek V4.1 Flash raciocina antes de responder, no nível high. Desligue o raciocínio para etapas rápidas e simples ou aumente o nível para max em problemas difíceis. A própria API da DeepSeek chama o modelo de deepseek-flash.
ID do modelo: deepseek-v4.1-flash · Entrada: texto, imagens · Saída: texto · Formatos: Chat Completions, Responses, Anthropic Messages.
Duas formas de usar o DeepSeek V4.1 Flash
Chame do seu código, ou deixe seu agente programador fazer.
Chame do seu backend
Aponte o SDK da OpenAI para o SeedRouter e mantenha seu código. O DeepSeek V4.1 Flash responde a Chat Completions, Responses e Anthropic Messages.
- 1Crie uma chave de API
- 2Defina a URL base como https://api.seedrouter.ai/v1
- 3Envie deepseek-v4.1-flash como modelo
Deixe seu agente programador fazer
Copie um prompt pronto. Seu agente mostra a requisição e o custo antes de gastar.
- 1Copie o prompt
- 2Cole no seu agente
- 3Aprove a requisição
No que o DeepSeek V4.1 Flash se destaca
O DeepSeek V4.1 Flash foi feito para trabalho em grande volume, em que velocidade e custo importam.
Loops de agentes
O DeepSeek V4.1 Flash executa muitas etapas baratas, e o contexto em cache mantém as leituras repetidas com custo baixo.
Programação do dia a dia
Escreva, revise e corrija código com o DeepSeek V4.1 Flash no Codex, no Claude Code ou nas suas próprias ferramentas.
Imagens no prompt
O DeepSeek V4.1 Flash lê capturas de tela, gráficos e fotos por URL ou base64.
Saída estruturada
Peça ao DeepSeek V4.1 Flash uma saída json_object e processe a resposta diretamente.
Raciocínio ligado ou desligado
Pule o raciocínio do DeepSeek V4.1 Flash em respostas rápidas ou aumente-o nas difíceis.
Taxas fora do horário de pico
Jobs em lote fora do horário de pico pagam metade do preço de pico.
O que as equipes criam com o DeepSeek V4.1 Flash
Classificação em escala
Marque tickets, avaliações e logs com o DeepSeek V4.1 Flash, com o raciocínio desligado, pelo menor custo.
Agentes de programação
Rode o DeepSeek V4.1 Flash no Codex para ciclos rápidos e baratos de editar e executar.
Leitura de capturas de tela
Transforme capturas de tela e gráficos em texto ou JSON.
Comece a usar o DeepSeek V4.1 Flash em quatro passos
- 01
Crie uma chave
Entre e crie uma chave de API. Adicione crédito sempre que precisar; não há assinatura.
- 02
Mude a URL base
Aponte o SDK da OpenAI para https://api.seedrouter.ai/v1. Seu código continua o mesmo.
- 03
Escolha o DeepSeek V4.1 Flash
Envie deepseek-v4.1-flash como modelo. Desligue o raciocínio ou defina o nível dele a cada requisição.
- 04
Verifique a conta
Cada requisição mostra seus tokens e cobrança em seus registros de uso.
DeepSeek V4.1 Flash no SeedRouter em resumo
O que você pode usar hoje.
| Recurso | DeepSeek V4.1 Flash |
|---|---|
| Chat Completions | Sim, formato oficial |
| Responses | Sim, funciona com o Codex |
| Anthropic Messages | Sim, funciona com o Claude Code |
| Entrada de imagem | Sim, por URL ou base64 |
| Streaming | Sim |
| Cache de contexto | Sim, automático, acertos no cache cobrados a uma tarifa menor |
| Saída JSON | Sim, json_object |
| Requisições com falha | Não cobrada |
FIM e conclusão com prefixo de chat (beta), a Files API e probabilidades logarítmicas não são oferecidos.
Limites do DeepSeek V4.1 Flash
Contexto de 1M de tokens
No DeepSeek V4.1 Flash, prompt, imagens e histórico compartilham uma única janela de 1M de tokens.
384K tokens de saída
Uma requisição ao DeepSeek V4.1 Flash escreve até 393.216 tokens, incluindo o raciocínio.
Amostragem com raciocínio ligado
Com o raciocínio ligado, temperature não tem efeito e top_p fica em 0.95 ou mais.
Tamanho da imagem
Uma URL de imagem para o DeepSeek V4.1 Flash pode apontar para um arquivo de até 32 MiB.
Por que chamar o DeepSeek V4.1 Flash pelo SeedRouter
Uma chave, três formatos
Chame o DeepSeek V4.1 Flash com Chat Completions, Responses ou Anthropic Messages, usando a mesma chave.
Pague por token
Recarregue uma vez e gaste em qualquer modelo. Sem plano, sem taxa mensal.
Falhas são grátis
Uma requisição que gera erro não é cobrada.
Preços em tempo real
As tarifas nesta página são as que a sua conta paga, no horário de pico e fora dele.
Cache de contexto
Prefixos de prompt repetidos são lidos do cache a uma tarifa menor do DeepSeek V4.1 Flash.
Raciocínio de volta na resposta
Com o raciocínio ligado, ele volta em reasoning_content, ao lado da resposta.
Streaming
Receba os tokens do DeepSeek V4.1 Flash em streaming à medida que chegam com stream: true.
Modelos relacionados
Outros modelos que você pode chamar com a mesma chave.
Use o Kimi K3 com o SDK da OpenAI ou da Anthropic: contexto de 1M de tokens, raciocínio sempre ativo com nível low, high ou max, preços por token em tempo real e um Playground.
Ver preçosGuias do DeepSeek V4.1 Flash
Passo a passo e comparações para este modelo.
Como usar a API do DeepSeek V4.1 Flash: obtenha uma chave, chame com o SDK da OpenAI, ative ou desative o raciocínio, streaming, imagens e erros comuns.
Preços da API do DeepSeek V4.1 Flash por milhão de tokens: horário de pico e fora dele, cache hits, horários, fórmula de cobrança e custo por solicitação.
Como usar o DeepSeek V4.1 Flash como modelo no Claude Code e no Codex CLI da OpenAI pela SeedRouter: variáveis de ambiente, config.toml e os nossos testes.
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: preço por token, entrada de imagens, concorrência e benchmarks da DeepSeek, com uma escolha clara para cada uso.
O que mudou do DeepSeek V4 Flash 0731 para o V4.1 Flash: nova arquitetura, visão nativa, cache menor, preços mais baixos, benchmarks e os nomes antigos.
O DeepSeek V4.1 Flash é grátis? Os pesos são gratuitos para baixar, a API é paga por token com tarifas baixas, e veja como testar hoje quase sem gastar.
Perguntas frequentes sobre o DeepSeek V4.1 Flash
O que é o DeepSeek V4.1 Flash?+
O DeepSeek V4.1 Flash é o modelo rápido e de baixo custo da DeepSeek, lançado em 10 de setembro de 2026. É um modelo mixture-of-experts de 552B parâmetros com entrada de imagens nativa, janela de contexto de 1M de tokens e raciocínio que você pode ligar ou desligar.
Quanto custa o DeepSeek V4.1 Flash?+
O DeepSeek V4.1 Flash custa $0.24 / 1M de entrada e $0.96 / 1M de saída por 1M de tokens no horário de pico (01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta). Todas as outras horas ficam fora do horário de pico, com metade dessas tarifas, e os acertos no cache custam uma fração da entrada.
Posso usar o DeepSeek V4.1 Flash de graça?+
Toda conta nova do SeedRouter começa com $0.10 de saldo gratuito, o suficiente para testar o DeepSeek V4.1 Flash com muitas requisições curtas. Depois disso, você paga por token, sem assinatura, e uma requisição que falha não é cobrada.
O DeepSeek V4.1 Flash aceita imagens?+
Sim. O DeepSeek V4.1 Flash lê imagens nativamente. Envie-as na requisição por URL pública ou em base64; ele retorna texto.
Como desligo o raciocínio no DeepSeek V4.1 Flash?+
Defina thinking como disabled ou reasoning_effort como none. A resposta chega na hora e usa menos tokens de saída.
O DeepSeek V4.1 Flash é o mesmo que o DeepSeek V4 Flash?+
Não. O DeepSeek V4.1 Flash substituiu o V4 Flash em 10 de setembro de 2026, com uma nova arquitetura e entrada de imagens nativa. A DeepSeek aposentou o V4 Flash e direciona os nomes antigos do modelo para o DeepSeek V4.1 Flash.
Posso rodar o DeepSeek V4.1 Flash localmente?+
Os pesos estão no Hugging Face. Com 552B parâmetros, ele exige hardware com várias GPUs, por isso a maioria das equipes chama o DeepSeek V4.1 Flash por uma API.
Qual é o ID do modelo DeepSeek V4.1 Flash e como faço para chamá-lo?+
No SeedRouter, o ID do modelo é deepseek-v4.1-flash. Crie uma chave de API do SeedRouter, aponte o SDK da OpenAI para https://api.seedrouter.ai/v1 e envie deepseek-v4.1-flash como modelo.
Sou cobrado se uma requisição ao DeepSeek V4.1 Flash falhar?+
Não. Uma requisição ao DeepSeek V4.1 Flash que retorna um erro não é cobrada. Você paga apenas pelos tokens que uma requisição concluída informa.
Experimente o DeepSeek V4.1 Flash agora
Envie sua primeira requisição ao DeepSeek V4.1 Flash pelo Playground ou pelo seu próprio código em minutos.
