Claude Opus 5.5 já está disponível no SeedRouter

Kimi K3: parâmetros, janela de contexto e máximo de tokens de saída

Dados do Kimi K3: 2,8 trilhões de parâmetros, 16 de 896 especialistas ativos por token, janela de contexto de 1M tokens e até 1.048.576 tokens de saída.

Ler em Markdown

O Kimi K3 tem 2,8 trilhões de parâmetros e ativa 16 dos seus 896 especialistas em cada token. Sua janela de contexto é de 1.048.576 tokens, e uma única resposta pode ter até 1.048.576 tokens, embora o limite padrão seja 131.072. A Moonshot AI o chama de "o primeiro modelo open source do mundo na classe de 3 trilhões de parâmetros" e publicou os pesos completos. Ele sempre raciocina, lê texto e imagens e escreve texto.

Especificações do Kimi K3 em resumo

EspecificaçãoValor
DesenvolvedorMoonshot AI
Parâmetros totais2,8 trilhões
Especialistas896, com 16 ativos por token
ArquiteturaMixture of experts com Kimi Delta Attention e Attention Residuals
Janela de contexto1.048.576 tokens
Saída máxima1.048.576 tokens, raciocínio incluído
Limite de saída padrão131.072 tokens
RaciocínioSempre ligado; low, high ou max (padrão max)
EntradaTexto e imagens (imagens só em base64)
SaídaTexto
PesosPublicados pela Moonshot AI
ID do modelo no SeedRouterkimi-k3

Quantos parâmetros o Kimi K3 tem?

2,8 trilhões. O guia de início rápido da Moonshot AI chama o Kimi K3 de seu "modelo principal mais capaz até hoje, com 2,8 trilhões de parâmetros" e de "o primeiro modelo open source a chegar a 2,8 trilhões de parâmetros".

Quantos parâmetros ativos o Kimi K3 tem?

O guia de início rápido da Moonshot AI não informa uma contagem de parâmetros ativos. O que ele diz é que o modelo "ativa de forma eficiente 16 de 896 especialistas" por meio do framework Stable LatentMoE. Então só uma pequena parte dos 2,8 trilhões de parâmetros trabalha em cada token, o que mantém baixo o processamento por token. Todos os pesos ainda precisam ser carregados, e é por isso que rodar o Kimi K3 por conta própria exige hardware de data center com várias GPUs.

Que arquitetura o Kimi K3 usa?

Um modelo mixture-of-experts construído sobre duas mudanças de atenção. Nas palavras da Moonshot AI, ele "é construído sobre a Kimi Delta Attention (KDA), um mecanismo híbrido de atenção linear, e as Attention Residuals". A Moonshot AI diz que essas mudanças, junto com a disposição mais esparsa dos especialistas e novos métodos de treinamento, dão ao Kimi K3 "cerca de 2,5 vezes a eficiência geral de escala do K2". Os detalhes completos virão no relatório técnico do Kimi K3.

Qual é a janela de contexto do Kimi K3?

1.048.576 tokens, geralmente escrito como 1M. Prompt, imagens, histórico da conversa e resposta compartilham essa única janela.

Qual é a saída máxima do Kimi K3?

Até 1.048.576 tokens por requisição, definidos com max_completion_tokens. O padrão é 131.072. O guia de início rápido da Moonshot AI: "max_completion_tokens tem padrão 131072 e pode ser definido até 1048576".

Duas coisas para saber:

  • O raciocínio conta para o limite. O Kimi K3 sempre raciocina, e os tokens de raciocínio usam o mesmo orçamento da resposta.
  • max_tokens é o nome descontinuado do mesmo limite. Use max_completion_tokens.

Se uma resposta for cortada, aumente max_completion_tokens ou reduza reasoning_effort para que menos orçamento vá para o raciocínio. Janela de contexto vs máximo de tokens de saída explica como identificar uma resposta truncada em cada formato de API.

Dá para desligar o raciocínio do Kimi K3?

Não. O Kimi K3 sempre raciocina. Você pode definir reasoning_effort como low, high ou max; o padrão é max, o mais lento e o que usa mais tokens de saída. high atende à maioria das tarefas, e low serve para etapas rápidas e simples. O raciocínio volta em reasoning_content, ao lado de content, e é cobrado como tokens de saída.

Quais configurações são fixas?

A Moonshot AI fixa a amostragem do Kimi K3: temperature 1.0, top_p 0.95, n 1, presence_penalty 0 e frequency_penalty 0. Qualquer outro valor retorna erro, então deixe esses campos fora da requisição.

O Kimi K3 lê imagens?

Sim, mas só como data URIs em base64. Uma URL pública de imagem não é aceita e retorna 400, como na API do próprio Kimi. A saída é sempre texto.

Como chamo o Kimi K3?

No SeedRouter, o Kimi K3 aceita os formatos OpenAI Chat Completions, OpenAI Responses e Anthropic Messages com a mesma chave e o ID de modelo kimi-k3. O guia da API do Kimi K3 mostra a primeira requisição, a configuração do Claude Code e do Codex tem configurações testadas e a referência da API do Kimi K3 lista todos os parâmetros. Os preços atuais estão na página do Kimi K3.

Perguntas frequentes

Qual é o tamanho do Kimi K3?

2,8 trilhões de parâmetros no total, com 16 de 896 especialistas ativos por token.

O Kimi K3 é open source?

A Moonshot AI publicou os pesos completos do modelo. O Kimi K3 é grátis? explica o que é preciso para rodá-los por conta própria.

Por que o Kimi K3 para em 131.072 tokens?

É o limite de saída padrão. Defina max_completion_tokens até 1048576 para respostas mais longas.

Quem faz o Kimi K3?

A Moonshot AI, a empresa chinesa por trás do assistente Kimi.

Guias relacionados