Prezzi dell'API di Kimi K3: costo per milione di token, cache e per task
Prezzi dell'API di Kimi K3 per milione di token: input, output, input in cache e scritture in cache da 5 minuti o 1 ora, con formula e costo di un task.
Leggi in MarkdownKimi K3 è fatturato per token, con tariffe separate per input, output, input in cache e scritture della cache. Il prezzo non cambia con la lunghezza del prompt: un prompt da 900K token paga la stessa tariffa per token di uno da 900 token. L'output è la voce più cara, e Kimi K3 ragiona sempre, quindi i token di ragionamento fanno parte dell'output che paghi. Su SeedRouter non c'è alcun abbonamento e una richiesta che fallisce non viene addebitata.
La tabella qui sotto è letta dalla tabella delle tariffe che fattura il tuo account, quindi mostra cosa costa una richiesta oggi.
Quanto costa Kimi K3 per milione di token?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
L'input in cache è quanto costa un prefisso di prompt ripetuto quando viene letto dalla cache. Le due colonne di scrittura della cache indicano quanto costa scrivere un prefisso nella cache, in base a quanto a lungo ci resta.
Quali sono i prezzi di listino di Moonshot?
Per riferimento, questa è la struttura dei prezzi di Moonshot AI per Kimi K3, dalla sua pagina dei prezzi. Ogni riga è un multiplo della tariffa di input:
| Voce | Multiplo dell'input |
|---|---|
| Input (cache miss) | 1× |
| Input in cache (cache hit) | 0,1× |
| Scrittura della cache, TTL di 5 minuti | 1× |
| Scrittura della cache, TTL di 1 ora | 2× |
| Output | 5× |
La tabella live qui sopra mostra la tariffa di SeedRouter per ogni voce, e la pagina di Kimi K3 le mostra accanto al prezzo di listino di Moonshot.
Come viene fatturata una richiesta a Kimi K3?
Ogni risposta riporta i conteggi dei token in usage, e l'addebito li segue:
prompt_tokens: l'intero prompt, compresa ogni parte in cache o scritta in cache.prompt_tokens_details.cached_tokens: la parte letta dalla cache.prompt_tokens_details.cache_write_tokens: la parte scritta nella cache.completion_tokens: la risposta più il ragionamento.
L'addebito è:
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000Quanto costa un task con Kimi K3?
Dipende da quanti token il task legge e scrive, e lo sforzo cambia molto il lato dell'output. Nel nostro test sulla stessa breve domanda, lo sforzo low ha usato 25 token di output e max ne ha usati 146, quasi sei volte l'output per lo stesso prompt. Tre esempi indicativi di tipi di lavoro, in token:
| Task | Input | Output |
|---|---|---|
Una breve domanda con sforzo low | circa 100 | circa 30 |
La revisione del codice di un file con sforzo high | circa 5.000 | circa 1.500 |
| Un passo di un agente su un grande repository | circa 200.000, per lo più in cache | circa 3.000 |
Moltiplica ciascuno per le tariffe live qui sopra. Per token l'output pesa cinque volte l'input, quindi di solito sono il ragionamento e la risposta a decidere il conto. Per un agente che rilegge lo stesso repository, i cache hit riducono il lato dell'input a un decimo.
Quanto costano 1.000 token di Kimi K3?
Mille token costano la tariffa per milione divisa per 1.000. Moonshot calcola circa 3-4 caratteri inglesi per token, quindi 1.000 token sono qualche migliaio di caratteri di testo. Alla tariffa dell'input in cache costano un decimo dell'input nuovo.
Meglio la cache da 5 minuti o da 1 ora?
Il caching è automatico. Per impostazione predefinita un prefisso scritto resta per 5 minuti, e ogni hit lo rinnova. Imposta prompt_cache_options.ttl su 1h quando le tue richieste sono distanziate:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)La scrittura da 1 ora costa il doppio della tariffa di input, contro una volta per la scrittura da 5 minuti. Se le tue richieste arrivano a più di cinque minuti di distanza, un prefisso letto tre o più volte nell'ora costa meno con il TTL di 1 ora: una scrittura a 2× e due hit a 0,1× (2,2×) contro tre scritture da 5 minuti (3×).
C'è un modo più economico di usare Kimi K3?
Ridurre lo sforzo è la leva più grande, perché l'output domina il conto. Metti il contesto lungo e riutilizzato all'inizio del prompt, così viene letto dalla cache. I pesi di Kimi K3 sono aperti, ma con 2,8 trilioni di parametri eseguirlo in proprio richiede hardware da data center, che conviene solo a volumi molto alti.
Domande frequenti
Kimi K3 costa di più per i prompt lunghi?
No. Kimi K3 usa un prezzo per token fisso: non c'è una fascia per il contesto lungo.
Esiste un abbonamento a Kimi K3?
Non su SeedRouter. Ricarichi un saldo e paghi per token. Anche l'API di Moonshot fattura per token e sblocca Kimi K3 solo dopo una prima ricarica.
Le richieste fallite vengono addebitate?
No. Una richiesta a Kimi K3 che restituisce un errore non viene addebitata.
Come inizio?
La guida all'API di Kimi K3 mostra come ottenere una chiave e fare la prima chiamata.



