Preço da API do Kimi K3: custo por milhão de tokens, cache e por tarefa
Preço da API do Kimi K3 por milhão de tokens: entrada, saída, entrada em cache e escritas no cache de 5 minutos ou 1 hora, com a fórmula e o custo por tarefa.
Ler em MarkdownO Kimi K3 é cobrado por token, com taxas separadas para entrada, saída, entrada em cache e escritas no cache. O preço não muda com o tamanho do prompt: um prompt de 900K tokens paga a mesma taxa por token que um de 900 tokens. A saída é o item mais caro, e o Kimi K3 sempre raciocina, então os tokens de raciocínio fazem parte da saída que você paga. Na SeedRouter não há assinatura, e uma solicitação que falha não é cobrada.
A tabela abaixo é lida da tabela de tarifas que cobra a sua conta, então mostra quanto uma solicitação custa hoje.
Quanto custa o Kimi K3 por milhão de tokens?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
A entrada em cache é o custo de um prefixo de prompt repetido quando ele é lido do cache. As duas colunas de escrita no cache são o custo de gravar um prefixo no cache, conforme o tempo que ele fica lá.
Quais são os preços de tabela da Moonshot?
Como referência, esta é a estrutura dos preços da própria Moonshot AI para o Kimi K3, da sua página de preços. Cada linha é um múltiplo da taxa de entrada:
| Item | Múltiplo da entrada |
|---|---|
| Entrada (cache miss) | 1× |
| Entrada em cache (cache hit) | 0,1× |
| Escrita no cache, TTL de 5 minutos | 1× |
| Escrita no cache, TTL de 1 hora | 2× |
| Saída | 5× |
A tabela ao vivo acima mostra a taxa da SeedRouter para cada item, e a página do Kimi K3 as mostra ao lado do preço de tabela da Moonshot.
Como uma solicitação ao Kimi K3 é cobrada?
Cada resposta informa suas contagens de tokens em usage, e a cobrança segue essas contagens:
prompt_tokens: o prompt inteiro, incluindo qualquer parte em cache ou escrita no cache.prompt_tokens_details.cached_tokens: a parte lida do cache.prompt_tokens_details.cache_write_tokens: a parte escrita no cache.completion_tokens: a resposta mais o raciocínio.
A cobrança é:
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000Quanto custa uma tarefa com o Kimi K3?
Depende de quantos tokens a tarefa lê e escreve, e o esforço muda muito o lado da saída. No nosso teste com a mesma pergunta curta, o esforço low usou 25 tokens de saída e max usou 146, quase seis vezes a saída para o mesmo prompt. Três formatos ilustrativos de trabalho, em tokens:
| Tarefa | Entrada | Saída |
|---|---|---|
Uma pergunta curta com esforço low | cerca de 100 | cerca de 30 |
Uma revisão de código de um arquivo com esforço high | cerca de 5.000 | cerca de 1.500 |
| Um passo de agente sobre um repositório grande | cerca de 200.000, a maior parte em cache | cerca de 3.000 |
Multiplique cada um pelas taxas ao vivo acima. Por token, a saída pesa cinco vezes mais que a entrada, então o raciocínio e a resposta costumam decidir a conta. Para um agente que relê o mesmo repositório, os cache hits reduzem o lado da entrada a um décimo.
Quanto custam 1.000 tokens do Kimi K3?
Mil tokens custam a taxa por milhão dividida por 1.000. A Moonshot conta cerca de 3 a 4 caracteres em inglês por token, então 1.000 tokens são alguns milhares de caracteres de texto. Na taxa de entrada em cache, eles custam um décimo da entrada nova.
Devo usar o cache de 5 minutos ou de 1 hora?
O cache é automático. Por padrão, um prefixo gravado fica por 5 minutos, e cada hit o renova. Defina prompt_cache_options.ttl como 1h quando suas solicitações forem espaçadas:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)A escrita de 1 hora custa o dobro da taxa de entrada, contra uma vez para a escrita de 5 minutos. Se suas solicitações chegam com mais de cinco minutos de intervalo, um prefixo lido três ou mais vezes dentro da hora sai mais barato com o TTL de 1 hora: uma escrita a 2× e dois hits a 0,1× (2,2×) contra três escritas de 5 minutos (3×).
Existe um jeito mais barato de rodar o Kimi K3?
Reduzir o esforço é a maior alavanca, já que a saída domina a conta. Mantenha o contexto longo e reutilizado no início do prompt para que ele seja lido do cache. Os pesos do Kimi K3 são abertos, mas com 2,8 trilhões de parâmetros, rodá-lo por conta própria exige hardware de data center, o que só compensa em volume muito alto.
Perguntas frequentes
O Kimi K3 cobra mais por prompts longos?
Não. O Kimi K3 usa preço fixo por token: não há faixa de contexto longo.
Existe assinatura do Kimi K3?
Não na SeedRouter. Você recarrega um saldo e paga por token. A API da própria Moonshot também cobra por token e só libera o Kimi K3 após uma primeira recarga.
Solicitações com falha são cobradas?
Não. Uma solicitação ao Kimi K3 que retorna erro não é cobrada.
Como começar?
O guia da API do Kimi K3 mostra como obter uma chave e fazer a primeira chamada.



