Claude Opus 5.5 já está disponível no SeedRouter

Preço da API do DeepSeek V4.1 Flash: horário de pico, fora do pico e cache

Preços da API do DeepSeek V4.1 Flash por milhão de tokens: horário de pico e fora dele, cache hits, horários, fórmula de cobrança e custo por solicitação.

Ler em Markdown

O DeepSeek V4.1 Flash é cobrado por token, e a tarifa depende da hora. O horário de pico vai das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta; todas as outras horas, incluindo os fins de semana, ficam fora do horário de pico, com metade das tarifas de pico. A entrada que acerta o cache custa uma pequena fração da entrada nova, e não há cobrança para gravar no cache. Na SeedRouter não há assinatura, e uma solicitação que falha não é cobrada.

A tabela abaixo é lida da tabela de tarifas que cobra a sua conta, então mostra quanto custa uma solicitação hoje.

Quanto custa o DeepSeek V4.1 Flash por milhão de tokens?

DeepSeek V4.1 Flash

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

Fora do horário de pico cobre 133 das 168 horas de uma semana: todo o sábado e domingo, e cada hora de dia útil fora das duas janelas de pico.

Quais são os preços de tabela da DeepSeek?

Para referência, esta é a estrutura dos próprios preços da DeepSeek para o modelo, da sua página Models & Pricing. Cada linha é um múltiplo da tarifa de entrada no horário de pico:

LinhaHorário de picoFora do horário de pico
Entrada, cache miss1×0,5×
Entrada, cache hit0,02×0,01×
Saída4×2×

A tabela atual acima mostra a tarifa da SeedRouter para cada linha, e a página do DeepSeek V4.1 Flash as mostra ao lado do preço de tabela da DeepSeek. A tabela da própria DeepSeek também marca os feriados chineses como fora do horário de pico; a SeedRouter aplica o calendário de dias úteis toda semana.

Como uma solicitação ao DeepSeek V4.1 Flash é cobrada?

Cada resposta informa a contagem de tokens em usage, e a cobrança segue esses números:

  • prompt_cache_miss_tokens: tokens do prompt lidos do zero.
  • prompt_cache_hit_tokens: tokens do prompt servidos pelo cache.
  • completion_tokens: a resposta mais o raciocínio, quando o raciocínio está ativado.

A cobrança, com as tarifas da hora em que a solicitação é executada:

cost = ( cache-miss input × input rate
       + cache-hit input × cache-hit rate
       + completion × output rate ) / 1,000,000

Quanto custa uma tarefa com o DeepSeek V4.1 Flash?

O raciocínio muda principalmente o lado da saída. No nosso teste com a mesma pergunta de contagem de números primos, o raciocínio desativado usou 2 tokens de saída, o esforço low 258 e o max 319. Três formatos ilustrativos de trabalho, em tokens:

TarefaEntradaSaída
Uma classificação com o raciocínio desativadocerca de 150cerca de 10
Uma revisão de código com esforço highcerca de 5.000cerca de 1.500
Uma etapa de agente sobre um repositório grandecerca de 200.000, a maioria cache hitscerca de 3.000

Multiplique cada um pelas tarifas atuais acima e divida pela metade fora do horário de pico. A saída custa quatro vezes a entrada por token, então raciocínio e respostas costumam decidir a conta. Para um agente que relê os mesmos arquivos, os cache hits reduzem o lado da entrada a cerca de 2% da entrada nova.

O preço do DeepSeek V4 Flash mudou?

Duas vezes em 2026. Em 16 de agosto, a DeepSeek passou seus modelos V4 para preços no horário de pico e fora dele, com fora do horário de pico a metade da tarifa de pico. Em 10 de setembro, quando o V4.1 Flash substituiu o V4 Flash, o seu change log diz "API prices have been reduced accordingly". A mudança mais recente foi um corte, e os nomes antigos dos modelos agora rodam no V4.1 Flash pelo preço do V4.1 Flash.

Como pagar menos pelo DeepSeek V4.1 Flash?

  • Rode o trabalho flexível fora do horário de pico. Jobs em lote, avaliações e backfills custam metade fora das janelas de pico.
  • Desative o raciocínio em etapas simples. Classificação e extração raramente precisam de raciocínio, e raciocínio é saída.
  • Mantenha o contexto reutilizado no início do prompt. O cache é automático e não precisa de configuração; prefixos repetidos são cobrados pela tarifa de cache hit.
  • Defina max_tokens para que uma resposta longa não passe do que você pretendia pagar.

Perguntas frequentes

Quando é o horário de pico do DeepSeek V4.1 Flash?

Das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta. Todo o resto é fora do horário de pico.

Há cobrança para gravar no cache?

Não. O DeepSeek V4.1 Flash cobra cache misses e cache hits; gravar no cache não é cobrado à parte.

Existe assinatura do DeepSeek V4.1 Flash?

Não na SeedRouter. Você recarrega um saldo e paga por token, sem plano e sem mensalidade.

Como começo?

O guia da API do DeepSeek V4.1 Flash mostra como obter uma chave e fazer a primeira chamada.

Guias relacionados