Kimi K3: parâmetros, janela de contexto e máximo de tokens de saída
Dados do Kimi K3: 2,8 trilhões de parâmetros, 16 de 896 especialistas ativos por token, janela de contexto de 1M tokens e até 1.048.576 tokens de saída.
Ler em MarkdownO Kimi K3 tem 2,8 trilhões de parâmetros e ativa 16 dos seus 896 especialistas em cada token. Sua janela de contexto é de 1.048.576 tokens, e uma única resposta pode ter até 1.048.576 tokens, embora o limite padrão seja 131.072. A Moonshot AI o chama de "o primeiro modelo open source do mundo na classe de 3 trilhões de parâmetros" e publicou os pesos completos. Ele sempre raciocina, lê texto e imagens e escreve texto.
Especificações do Kimi K3 em resumo
| Especificação | Valor |
|---|---|
| Desenvolvedor | Moonshot AI |
| Parâmetros totais | 2,8 trilhões |
| Especialistas | 896, com 16 ativos por token |
| Arquitetura | Mixture of experts com Kimi Delta Attention e Attention Residuals |
| Janela de contexto | 1.048.576 tokens |
| Saída máxima | 1.048.576 tokens, raciocínio incluído |
| Limite de saída padrão | 131.072 tokens |
| Raciocínio | Sempre ligado; low, high ou max (padrão max) |
| Entrada | Texto e imagens (imagens só em base64) |
| Saída | Texto |
| Pesos | Publicados pela Moonshot AI |
| ID do modelo no SeedRouter | kimi-k3 |
Quantos parâmetros o Kimi K3 tem?
2,8 trilhões. O guia de início rápido da Moonshot AI chama o Kimi K3 de seu "modelo principal mais capaz até hoje, com 2,8 trilhões de parâmetros" e de "o primeiro modelo open source a chegar a 2,8 trilhões de parâmetros".
Quantos parâmetros ativos o Kimi K3 tem?
O guia de início rápido da Moonshot AI não informa uma contagem de parâmetros ativos. O que ele diz é que o modelo "ativa de forma eficiente 16 de 896 especialistas" por meio do framework Stable LatentMoE. Então só uma pequena parte dos 2,8 trilhões de parâmetros trabalha em cada token, o que mantém baixo o processamento por token. Todos os pesos ainda precisam ser carregados, e é por isso que rodar o Kimi K3 por conta própria exige hardware de data center com várias GPUs.
Que arquitetura o Kimi K3 usa?
Um modelo mixture-of-experts construído sobre duas mudanças de atenção. Nas palavras da Moonshot AI, ele "é construído sobre a Kimi Delta Attention (KDA), um mecanismo híbrido de atenção linear, e as Attention Residuals". A Moonshot AI diz que essas mudanças, junto com a disposição mais esparsa dos especialistas e novos métodos de treinamento, dão ao Kimi K3 "cerca de 2,5 vezes a eficiência geral de escala do K2". Os detalhes completos virão no relatório técnico do Kimi K3.
Qual é a janela de contexto do Kimi K3?
1.048.576 tokens, geralmente escrito como 1M. Prompt, imagens, histórico da conversa e resposta compartilham essa única janela.
Qual é a saída máxima do Kimi K3?
Até 1.048.576 tokens por requisição, definidos com max_completion_tokens. O padrão é 131.072. O guia de início rápido da Moonshot AI: "max_completion_tokens tem padrão 131072 e pode ser definido até 1048576".
Duas coisas para saber:
- O raciocínio conta para o limite. O Kimi K3 sempre raciocina, e os tokens de raciocínio usam o mesmo orçamento da resposta.
max_tokensé o nome descontinuado do mesmo limite. Usemax_completion_tokens.
Se uma resposta for cortada, aumente max_completion_tokens ou reduza reasoning_effort para que menos orçamento vá para o raciocínio. Janela de contexto vs máximo de tokens de saída explica como identificar uma resposta truncada em cada formato de API.
Dá para desligar o raciocínio do Kimi K3?
Não. O Kimi K3 sempre raciocina. Você pode definir reasoning_effort como low, high ou max; o padrão é max, o mais lento e o que usa mais tokens de saída. high atende à maioria das tarefas, e low serve para etapas rápidas e simples. O raciocínio volta em reasoning_content, ao lado de content, e é cobrado como tokens de saída.
Quais configurações são fixas?
A Moonshot AI fixa a amostragem do Kimi K3: temperature 1.0, top_p 0.95, n 1, presence_penalty 0 e frequency_penalty 0. Qualquer outro valor retorna erro, então deixe esses campos fora da requisição.
O Kimi K3 lê imagens?
Sim, mas só como data URIs em base64. Uma URL pública de imagem não é aceita e retorna 400, como na API do próprio Kimi. A saída é sempre texto.
Como chamo o Kimi K3?
No SeedRouter, o Kimi K3 aceita os formatos OpenAI Chat Completions, OpenAI Responses e Anthropic Messages com a mesma chave e o ID de modelo kimi-k3. O guia da API do Kimi K3 mostra a primeira requisição, a configuração do Claude Code e do Codex tem configurações testadas e a referência da API do Kimi K3 lista todos os parâmetros. Os preços atuais estão na página do Kimi K3.
Perguntas frequentes
Qual é o tamanho do Kimi K3?
2,8 trilhões de parâmetros no total, com 16 de 896 especialistas ativos por token.
O Kimi K3 é open source?
A Moonshot AI publicou os pesos completos do modelo. O Kimi K3 é grátis? explica o que é preciso para rodá-los por conta própria.
Por que o Kimi K3 para em 131.072 tokens?
É o limite de saída padrão. Defina max_completion_tokens até 1048576 para respostas mais longas.
Quem faz o Kimi K3?
A Moonshot AI, a empresa chinesa por trás do assistente Kimi.



