Claude Opus 5.5 è disponibile su SeedRouter

Kimi K3: parametri, finestra di contesto e token di output massimi

Specifiche di Kimi K3: 2.800 miliardi di parametri, 16 esperti attivi su 896 per token, una finestra di contesto da 1M token e fino a 1.048.576 token di output.

Leggi in Markdown

Kimi K3 ha 2.800 miliardi di parametri e attiva 16 dei suoi 896 esperti per ogni token. La sua finestra di contesto è di 1.048.576 token, e una singola risposta può arrivare a 1.048.576 token, anche se il limite predefinito è 131.072. Moonshot AI lo definisce "il primo modello open source al mondo nella classe da 3.000 miliardi di parametri" e ha rilasciato i pesi completi. Ragiona sempre, legge testo e immagini e scrive testo.

Le specifiche di Kimi K3 in sintesi

SpecificaValore
SviluppatoreMoonshot AI
Parametri totali2.800 miliardi
Esperti896, di cui 16 attivi per token
ArchitetturaMixture of experts con Kimi Delta Attention e Attention Residuals
Finestra di contesto1.048.576 token
Output massimo1.048.576 token, ragionamento incluso
Limite di output predefinito131.072 token
RagionamentoSempre attivo; low, high o max (predefinito max)
InputTesto e immagini (immagini solo in base64)
OutputTesto
PesiRilasciati da Moonshot AI
ID modello su SeedRouterkimi-k3

Quanti parametri ha Kimi K3?

2.800 miliardi. Il quickstart di Moonshot AI definisce Kimi K3 il suo "modello di punta più capace finora, con 2.800 miliardi di parametri" e "il primo modello open source a raggiungere 2.800 miliardi di parametri".

Quanti parametri attivi ha Kimi K3?

Il quickstart di Moonshot AI non indica un numero di parametri attivi. Quello che dice è che il modello "attiva in modo efficiente 16 esperti su 896" tramite il suo framework Stable LatentMoE. Quindi per ogni token lavora solo una piccola parte dei 2.800 miliardi di parametri, il che mantiene basso il calcolo per token. Tutti i pesi devono comunque essere caricati, ed è per questo che eseguire Kimi K3 in proprio richiede hardware da data center con più GPU.

Quale architettura usa Kimi K3?

Un modello mixture-of-experts costruito su due modifiche all'attenzione. Con le parole di Moonshot AI, "è costruito su Kimi Delta Attention (KDA), un meccanismo di attenzione lineare ibrido, e su Attention Residuals". Moonshot AI dice che queste modifiche, insieme a una disposizione degli esperti più sparsa e a nuovi metodi di addestramento, danno a Kimi K3 "circa 2,5 volte l'efficienza di scaling complessiva di K2". I dettagli completi arriveranno nel report tecnico di Kimi K3.

Qual è la finestra di contesto di Kimi K3?

1.048.576 token, di solito scritti 1M. Prompt, immagini, cronologia della conversazione e risposta condividono quest'unica finestra.

Qual è l'output massimo di Kimi K3?

Fino a 1.048.576 token per richiesta, impostati con max_completion_tokens. Il predefinito è 131.072. Dal quickstart di Moonshot AI: "max_completion_tokens ha come predefinito 131072 e può essere impostato fino a 1048576."

Due cose da sapere:

  • Il ragionamento conta nel limite. Kimi K3 ragiona sempre, e i suoi token di ragionamento usano lo stesso budget della risposta.
  • max_tokens è il nome deprecato dello stesso limite. Usa max_completion_tokens.

Se una risposta viene tagliata, alza max_completion_tokens o abbassa reasoning_effort così che una parte minore del budget vada al ragionamento. Finestra di contesto e token di output massimi spiega come riconoscere una risposta troncata in ogni formato di API.

Si può disattivare il ragionamento di Kimi K3?

No. Kimi K3 ragiona sempre. Puoi impostare reasoning_effort su low, high o max; il predefinito è max, il più lento e quello che usa più token di output. high va bene per la maggior parte dei compiti e low per i passaggi rapidi e semplici. Il ragionamento torna in reasoning_content, accanto a content, e viene fatturato come token di output.

Quali impostazioni sono fisse?

Moonshot AI fissa il campionamento di Kimi K3: temperature 1.0, top_p 0.95, n 1, presence_penalty 0 e frequency_penalty 0. Qualsiasi altro valore restituisce un errore, quindi lascia questi campi fuori dalla richiesta.

Kimi K3 legge le immagini?

Sì, ma solo come data URI in base64. Un URL pubblico di immagine non viene accettato e restituisce 400, come sull'API di Kimi. L'output è sempre testo.

Come si chiama Kimi K3?

Su SeedRouter, Kimi K3 accetta i formati OpenAI Chat Completions, OpenAI Responses e Anthropic Messages con la stessa chiave e l'ID modello kimi-k3. La guida all'API di Kimi K3 spiega la prima richiesta, il setup di Claude Code e Codex contiene configurazioni testate e il riferimento API di Kimi K3 elenca ogni parametro. I prezzi aggiornati sono nella pagina di Kimi K3.

Domande frequenti

Quanto è grande Kimi K3?

2.800 miliardi di parametri in totale, con 16 esperti attivi su 896 per token.

Kimi K3 è open source?

Moonshot AI ha rilasciato i pesi completi del modello. Kimi K3 è gratis? spiega cosa serve per eseguirli in proprio.

Perché Kimi K3 si ferma a 131.072 token?

È il limite di output predefinito. Imposta max_completion_tokens fino a 1048576 per risposte più lunghe.

Chi sviluppa Kimi K3?

Moonshot AI, l'azienda cinese che sta dietro all'assistente Kimi.

Guide correlate