Claude Opus 5.5 já está disponível no SeedRouter

Preço da API do Kimi K3: custo por milhão de tokens, cache e por tarefa

Preço da API do Kimi K3 por milhão de tokens: entrada, saída, entrada em cache e escritas no cache de 5 minutos ou 1 hora, com a fórmula e o custo por tarefa.

Ler em Markdown

O Kimi K3 é cobrado por token, com taxas separadas para entrada, saída, entrada em cache e escritas no cache. O preço não muda com o tamanho do prompt: um prompt de 900K tokens paga a mesma taxa por token que um de 900 tokens. A saída é o item mais caro, e o Kimi K3 sempre raciocina, então os tokens de raciocínio fazem parte da saída que você paga. Na SeedRouter não há assinatura, e uma solicitação que falha não é cobrada.

A tabela abaixo é lida da tabela de tarifas que cobra a sua conta, então mostra quanto uma solicitação custa hoje.

Quanto custa o Kimi K3 por milhão de tokens?

Kimi K3

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

A entrada em cache é o custo de um prefixo de prompt repetido quando ele é lido do cache. As duas colunas de escrita no cache são o custo de gravar um prefixo no cache, conforme o tempo que ele fica lá.

Quais são os preços de tabela da Moonshot?

Como referência, esta é a estrutura dos preços da própria Moonshot AI para o Kimi K3, da sua página de preços. Cada linha é um múltiplo da taxa de entrada:

ItemMúltiplo da entrada
Entrada (cache miss)1×
Entrada em cache (cache hit)0,1×
Escrita no cache, TTL de 5 minutos1×
Escrita no cache, TTL de 1 hora2×
Saída5×

A tabela ao vivo acima mostra a taxa da SeedRouter para cada item, e a página do Kimi K3 as mostra ao lado do preço de tabela da Moonshot.

Como uma solicitação ao Kimi K3 é cobrada?

Cada resposta informa suas contagens de tokens em usage, e a cobrança segue essas contagens:

  • prompt_tokens: o prompt inteiro, incluindo qualquer parte em cache ou escrita no cache.
  • prompt_tokens_details.cached_tokens: a parte lida do cache.
  • prompt_tokens_details.cache_write_tokens: a parte escrita no cache.
  • completion_tokens: a resposta mais o raciocínio.

A cobrança é:

cost = ( (prompt - cached - cache writes) × input rate
       + cached × cached-input rate
       + cache writes × cache-write rate for the TTL
       + completion × output rate ) / 1,000,000

Quanto custa uma tarefa com o Kimi K3?

Depende de quantos tokens a tarefa lê e escreve, e o esforço muda muito o lado da saída. No nosso teste com a mesma pergunta curta, o esforço low usou 25 tokens de saída e max usou 146, quase seis vezes a saída para o mesmo prompt. Três formatos ilustrativos de trabalho, em tokens:

TarefaEntradaSaída
Uma pergunta curta com esforço lowcerca de 100cerca de 30
Uma revisão de código de um arquivo com esforço highcerca de 5.000cerca de 1.500
Um passo de agente sobre um repositório grandecerca de 200.000, a maior parte em cachecerca de 3.000

Multiplique cada um pelas taxas ao vivo acima. Por token, a saída pesa cinco vezes mais que a entrada, então o raciocínio e a resposta costumam decidir a conta. Para um agente que relê o mesmo repositório, os cache hits reduzem o lado da entrada a um décimo.

Quanto custam 1.000 tokens do Kimi K3?

Mil tokens custam a taxa por milhão dividida por 1.000. A Moonshot conta cerca de 3 a 4 caracteres em inglês por token, então 1.000 tokens são alguns milhares de caracteres de texto. Na taxa de entrada em cache, eles custam um décimo da entrada nova.

Devo usar o cache de 5 minutos ou de 1 hora?

O cache é automático. Por padrão, um prefixo gravado fica por 5 minutos, e cada hit o renova. Defina prompt_cache_options.ttl como 1h quando suas solicitações forem espaçadas:

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)

A escrita de 1 hora custa o dobro da taxa de entrada, contra uma vez para a escrita de 5 minutos. Se suas solicitações chegam com mais de cinco minutos de intervalo, um prefixo lido três ou mais vezes dentro da hora sai mais barato com o TTL de 1 hora: uma escrita a 2× e dois hits a 0,1× (2,2×) contra três escritas de 5 minutos (3×).

Existe um jeito mais barato de rodar o Kimi K3?

Reduzir o esforço é a maior alavanca, já que a saída domina a conta. Mantenha o contexto longo e reutilizado no início do prompt para que ele seja lido do cache. Os pesos do Kimi K3 são abertos, mas com 2,8 trilhões de parâmetros, rodá-lo por conta própria exige hardware de data center, o que só compensa em volume muito alto.

Perguntas frequentes

O Kimi K3 cobra mais por prompts longos?

Não. O Kimi K3 usa preço fixo por token: não há faixa de contexto longo.

Existe assinatura do Kimi K3?

Não na SeedRouter. Você recarrega um saldo e paga por token. A API da própria Moonshot também cobra por token e só libera o Kimi K3 após uma primeira recarga.

Solicitações com falha são cobradas?

Não. Uma solicitação ao Kimi K3 que retorna erro não é cobrada.

Como começar?

O guia da API do Kimi K3 mostra como obter uma chave e fazer a primeira chamada.

Guias relacionados