Claude Opus 5.5 ist auf SeedRouter verfügbar

Kimi K3 API-Preise: Kosten pro Million Token, Cache und pro Aufgabe

Kimi K3 API-Preise pro Million Token: Eingabe, Ausgabe, gecachte Eingabe und Cache-Schreiben für 5 Minuten oder 1 Stunde, mit Formel und Kosten pro Aufgabe.

Als Markdown lesen

Kimi K3 wird pro Token abgerechnet, mit separaten Tarifen für Eingabe, Ausgabe, gecachte Eingabe und Cache-Schreibvorgänge. Der Preis ändert sich nicht mit der Prompt-Länge: Ein Prompt mit 900K Token zahlt denselben Tarif pro Token wie einer mit 900 Token. Die Ausgabe kostet am meisten, und Kimi K3 denkt immer nach, daher gehören Reasoning-Token zur Ausgabe, die Sie bezahlen. Bei SeedRouter gibt es kein Abo, und eine fehlgeschlagene Anfrage wird nicht berechnet.

Die folgende Tabelle wird aus der Tariftabelle gelesen, nach der Ihr Konto abgerechnet wird, und zeigt daher, was eine Anfrage heute kostet.

Was kostet Kimi K3 pro Million Token?

Kimi K3

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

Gecachte Eingabe ist das, was ein wiederholtes Prompt-Präfix kostet, wenn es aus dem Cache gelesen wird. Die beiden Spalten für Cache-Schreibvorgänge zeigen, was das Schreiben eines Präfixes in den Cache kostet, je nachdem, wie lange es dort bleibt.

Wie lauten Moonshots Listenpreise?

Zur Einordnung zeigt diese Tabelle die Struktur von Moonshot AIs eigenen Preisen für Kimi K3, laut seiner Preisseite. Jede Zeile ist ein Vielfaches des Eingabetarifs:

PostenVielfaches der Eingabe
Eingabe (Cache-Miss)1×
Gecachte Eingabe (Cache-Hit)0,1×
Cache-Schreibvorgang, 5-Minuten-TTL1×
Cache-Schreibvorgang, 1-Stunden-TTL2×
Ausgabe5×

Die Live-Tabelle oben zeigt den SeedRouter-Tarif für jede Zeile, und die Kimi K3-Seite stellt sie neben Moonshots Listenpreis.

Wie wird eine Kimi K3-Anfrage abgerechnet?

Jede Antwort meldet ihre Token-Zahlen in usage, und die Kosten richten sich danach:

  • prompt_tokens: der gesamte Prompt, einschließlich gecachter oder in den Cache geschriebener Teile.
  • prompt_tokens_details.cached_tokens: der aus dem Cache gelesene Teil.
  • prompt_tokens_details.cache_write_tokens: der in den Cache geschriebene Teil.
  • completion_tokens: die Antwort plus das Reasoning.

Die Kosten betragen:

cost = ( (prompt - cached - cache writes) × input rate
       + cached × cached-input rate
       + cache writes × cache-write rate for the TTL
       + completion × output rate ) / 1,000,000

Was kostet eine Kimi K3-Aufgabe?

Das hängt davon ab, wie viele Token die Aufgabe liest und schreibt, und der Reasoning-Aufwand verändert die Ausgabeseite stark. In unserem Test mit derselben kurzen Frage verbrauchte low 25 Ausgabe-Token und max 146, also fast das Sechsfache an Ausgabe für denselben Prompt. Drei beispielhafte Aufgabengrößen in Token:

AufgabeEingabeAusgabe
Eine kurze Frage mit low-Aufwandetwa 100etwa 30
Ein Code-Review einer Datei mit high-Aufwandetwa 5.000etwa 1.500
Ein Agent-Schritt über ein großes Repositoryetwa 200.000, größtenteils gecachtetwa 3.000

Multiplizieren Sie jeden Wert mit den Live-Tarifen oben. Ausgabe wiegt pro Token fünfmal so viel wie Eingabe, daher bestimmen Reasoning und Antwort meist die Rechnung. Bei einem Agenten, der dasselbe Repository immer wieder liest, senken Cache-Hits die Eingabeseite auf ein Zehntel.

Was kosten 1.000 Kimi K3-Token?

Tausend Token kosten den Tarif pro Million geteilt durch 1.000. Moonshot rechnet mit etwa 3 bis 4 englischen Zeichen pro Token, 1.000 Token sind also einige tausend Zeichen Text. Zum Tarif für gecachte Eingabe kosten sie ein Zehntel frischer Eingabe.

Sollte ich den 5-Minuten- oder den 1-Stunden-Cache verwenden?

Caching geschieht automatisch. Standardmäßig bleibt ein geschriebenes Präfix 5 Minuten erhalten, und jeder Treffer verlängert es. Setzen Sie prompt_cache_options.ttl auf 1h, wenn Ihre Anfragen zeitlich weit auseinanderliegen:

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)

Der 1-Stunden-Schreibvorgang kostet das Doppelte des Eingabetarifs, der 5-Minuten-Schreibvorgang das Einfache. Wenn Ihre Anfragen mehr als fünf Minuten auseinanderliegen, ist ein Präfix, das innerhalb der Stunde dreimal oder öfter gelesen wird, mit der 1-Stunden-TTL günstiger: ein Schreibvorgang zu 2× und zwei Treffer zu 0,1× (2,2×) gegenüber drei 5-Minuten-Schreibvorgängen (3×).

Gibt es einen günstigeren Weg, Kimi K3 zu betreiben?

Ein geringerer Reasoning-Aufwand ist der größte Hebel, da die Ausgabe die Rechnung dominiert. Legen Sie langen, wiederverwendeten Kontext an den Anfang des Prompts, damit er aus dem Cache gelesen wird. Die Gewichte von Kimi K3 sind offen, doch bei 2,8 Billionen Parametern braucht der Eigenbetrieb Rechenzentrums-Hardware, die sich nur bei sehr hohem Volumen lohnt.

Häufig gestellte Fragen

Berechnet Kimi K3 mehr für lange Prompts?

Nein. Kimi K3 hat einheitliche Preise pro Token: Es gibt keine Langkontext-Stufe.

Gibt es ein Kimi K3-Abo?

Bei SeedRouter nicht. Sie laden Guthaben auf und zahlen pro Token. Moonshots eigene API rechnet ebenfalls pro Token ab und schaltet Kimi K3 erst nach der ersten Aufladung frei.

Werden fehlgeschlagene Anfragen berechnet?

Nein. Eine Kimi K3-Anfrage, die einen Fehler zurückgibt, wird nicht berechnet.

Wie fange ich an?

Der Kimi K3 API-Leitfaden zeigt, wie Sie einen Schlüssel erhalten und den ersten Aufruf senden.

Verwandte Leitfäden