Claude Opus 5.5 est disponible sur SeedRouter

Prix de l'API Kimi K3 : coût par million de tokens, cache et tâche

Prix de l’API Kimi K3 par million de tokens : entrée, sortie, entrée en cache, écritures en cache de 5 min ou 1 h, formule de facturation et coût d’une tâche.

Lire en Markdown

Kimi K3 est facturé au token, avec des tarifs distincts pour l'entrée, la sortie, l'entrée en cache et les écritures en cache. Le prix ne change pas avec la longueur du prompt : un prompt de 900K tokens paie le même tarif par token qu'un prompt de 900 tokens. La sortie coûte le plus cher, et Kimi K3 raisonne toujours, donc les tokens de raisonnement font partie de la sortie que vous payez. Sur SeedRouter, il n'y a pas d'abonnement, et une requête qui échoue n'est pas facturée.

Le tableau ci-dessous est lu dans la grille tarifaire qui facture votre compte : il montre donc ce que coûte une requête aujourd'hui.

Combien coûte Kimi K3 par million de tokens ?

Kimi K3

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

L'entrée en cache correspond au coût d'un préfixe de prompt répété lorsqu'il est lu depuis le cache. Les deux colonnes d'écriture en cache correspondent au coût d'écriture d'un préfixe dans le cache, selon la durée pendant laquelle il y reste.

Quels sont les prix catalogue de Moonshot ?

À titre de référence, voici la structure des prix de Moonshot AI pour Kimi K3, d'après sa page de tarifs. Chaque ligne est un multiple du tarif d'entrée :

LigneMultiple de l'entrée
Entrée (cache manqué)1×
Entrée en cache (cache atteint)0,1×
Écriture en cache, TTL de 5 minutes1×
Écriture en cache, TTL d'une heure2×
Sortie5×

Le tableau en direct ci-dessus donne le tarif SeedRouter de chaque ligne, et la page Kimi K3 les affiche à côté du prix catalogue de Moonshot.

Comment une requête Kimi K3 est-elle facturée ?

Chaque réponse indique son nombre de tokens dans usage, et la facturation en découle :

  • prompt_tokens : le prompt entier, y compris toute partie lue depuis le cache ou écrite dans le cache.
  • prompt_tokens_details.cached_tokens : la partie lue depuis le cache.
  • prompt_tokens_details.cache_write_tokens : la partie écrite dans le cache.
  • completion_tokens : la réponse plus le raisonnement.

Le coût est :

cost = ( (prompt - cached - cache writes) × input rate
       + cached × cached-input rate
       + cache writes × cache-write rate for the TTL
       + completion × output rate ) / 1,000,000

Combien coûte une tâche Kimi K3 ?

Cela dépend du nombre de tokens que la tâche lit et écrit, et l'effort de raisonnement change beaucoup le côté sortie. Dans notre test sur la même question courte, l'effort low a utilisé 25 tokens de sortie et max en a utilisé 146, soit presque six fois plus de sortie pour le même prompt. Trois exemples de volumes de travail, en tokens :

TâcheEntréeSortie
Une question courte avec l'effort lowenviron 100environ 30
Une revue de code d'un fichier avec l'effort highenviron 5 000environ 1 500
Une étape d'agent sur un grand dépôtenviron 200 000, surtout en cacheenviron 3 000

Multipliez chaque ligne par les tarifs en direct ci-dessus. La sortie pèse cinq fois plus que l'entrée par token, donc le raisonnement et la réponse décident généralement de la facture. Pour un agent qui relit le même dépôt, les hits de cache réduisent le côté entrée à un dixième.

Combien coûtent 1 000 tokens Kimi K3 ?

Mille tokens coûtent le tarif par million divisé par 1 000. Moonshot compte environ 3 à 4 caractères anglais par token, donc 1 000 tokens représentent quelques milliers de caractères de texte. Au tarif d'entrée en cache, ils coûtent un dixième d'une entrée neuve.

Faut-il utiliser le cache de 5 minutes ou d'une heure ?

La mise en cache est automatique. Par défaut, un préfixe écrit reste 5 minutes, et chaque hit le prolonge. Définissez prompt_cache_options.ttl sur 1h quand vos requêtes sont espacées :

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)

L'écriture d'une heure coûte deux fois le tarif d'entrée, contre une fois pour l'écriture de 5 minutes. Si vos requêtes sont espacées de plus de cinq minutes, un préfixe lu trois fois ou plus dans l'heure revient moins cher avec le TTL d'une heure : une écriture à 2× et deux hits à 0,1× (2,2×), contre trois écritures de 5 minutes (3×).

Existe-t-il un moyen moins cher d'utiliser Kimi K3 ?

Baisser l'effort est le levier le plus important, puisque la sortie domine la facture. Placez le contexte long et réutilisé au début du prompt pour qu'il soit lu depuis le cache. Les poids de Kimi K3 sont ouverts, mais avec 2,8 billions de paramètres, l'exécuter vous-même demande du matériel de centre de données, qui n'est rentable qu'à très gros volume.

Questions fréquentes

Kimi K3 facture-t-il davantage les prompts longs ?

Non. Kimi K3 applique un prix fixe par token : il n'y a pas de palier pour le contexte long.

Existe-t-il un abonnement Kimi K3 ?

Pas sur SeedRouter. Vous rechargez un solde et payez au token. L'API de Moonshot facture aussi au token et ne débloque Kimi K3 qu'après une première recharge.

Les requêtes échouées sont-elles facturées ?

Non. Une requête Kimi K3 qui renvoie une erreur n'est pas facturée.

Comment démarrer ?

Le guide de l'API Kimi K3 explique comment obtenir une clé et faire le premier appel.

Guides associés