Claude Opus 5.5 jest już dostępny w SeedRouter

Cennik API Kimi K3: koszt za milion tokenów, cache i koszt zadania

Cennik API Kimi K3 za milion tokenów: wejście, wyjście, wejście z cache i zapis do cache na 5 minut lub 1 godzinę, ze wzorem rozliczenia i kosztem zadania.

Czytaj jako Markdown

Kimi K3 jest rozliczany za tokeny, z osobnymi stawkami za wejście, wyjście, wejście z cache i zapis do cache. Cena nie zmienia się wraz z długością promptu: prompt o długości 900K tokenów płaci tę samą stawkę za token co prompt o długości 900 tokenów. Najdroższe jest wyjście, a Kimi K3 zawsze rozumuje, więc tokeny rozumowania są częścią wyjścia, za które płacisz. Na SeedRouter nie ma subskrypcji, a żądanie zakończone błędem nie jest rozliczane.

Poniższa tabela jest odczytywana z tabeli stawek, według której rozliczane jest Twoje konto, więc pokazuje, ile żądanie kosztuje dziś.

Ile kosztuje Kimi K3 za milion tokenów?

Kimi K3

Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.

Wejście z cache to koszt powtarzanego prefiksu promptu, gdy jest odczytywany z cache. Dwie kolumny zapisu do cache pokazują koszt zapisania prefiksu w cache, zależnie od tego, jak długo tam pozostaje.

Jakie są ceny katalogowe Moonshot?

Dla porównania, tak wygląda struktura własnych cen Moonshot AI za Kimi K3 z jej strony cennika. Każda pozycja to wielokrotność stawki za wejście:

PozycjaWielokrotność wejścia
Wejście (cache miss)1×
Wejście z cache (cache hit)0.1×
Zapis do cache, TTL 5 minut1×
Zapis do cache, TTL 1 godzina2×
Wyjście5×

Tabela na żywo powyżej pokazuje stawkę SeedRouter dla każdej pozycji, a strona Kimi K3 zestawia je z ceną katalogową Moonshot.

Jak rozliczane jest żądanie do Kimi K3?

Każda odpowiedź podaje liczbę tokenów w usage, a opłata jest liczona na jej podstawie:

  • prompt_tokens: cały prompt, łącznie z częścią z cache i częścią zapisaną do cache.
  • prompt_tokens_details.cached_tokens: część odczytana z cache.
  • prompt_tokens_details.cache_write_tokens: część zapisana do cache.
  • completion_tokens: odpowiedź plus rozumowanie.

Opłata wynosi:

cost = ( (prompt - cached - cache writes) × input rate
       + cached × cached-input rate
       + cache writes × cache-write rate for the TTL
       + completion × output rate ) / 1,000,000

Ile kosztuje jedno zadanie w Kimi K3?

To zależy od tego, ile tokenów zadanie czyta i zapisuje, a poziom rozumowania mocno zmienia stronę wyjścia. W naszym teście na tym samym krótkim pytaniu poziom low zużył 25 tokenów wyjścia, a max 146, czyli prawie sześć razy więcej wyjścia przy tym samym prompcie. Trzy przykładowe rodzaje pracy, w tokenach:

ZadanieWejścieWyjście
Krótkie pytanie na poziomie lowokoło 100około 30
Code review jednego pliku na poziomie highokoło 5 000około 1 500
Krok agenta w dużym repozytoriumokoło 200 000, głównie z cacheokoło 3 000

Pomnóż każdą wartość przez aktualne stawki powyżej. Wyjście waży za token pięć razy więcej niż wejście, więc o rachunku zwykle decydują rozumowanie i odpowiedź. W przypadku agenta, który ponownie czyta to samo repozytorium, trafienia w cache obniżają stronę wejścia do jednej dziesiątej.

Ile kosztuje 1 000 tokenów Kimi K3?

Tysiąc tokenów kosztuje tyle, co stawka za milion podzielona przez 1 000. Moonshot liczy mniej więcej 3–4 znaki angielskiego tekstu na token, więc 1 000 tokenów to kilka tysięcy znaków tekstu. Po stawce za wejście z cache kosztują one jedną dziesiątą świeżego wejścia.

Cache na 5 minut czy na 1 godzinę?

Cache działa automatycznie. Domyślnie zapisany prefiks pozostaje przez 5 minut, a każde trafienie go odświeża. Ustaw prompt_cache_options.ttl na 1h, gdy Twoje żądania są rozłożone w czasie:

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)

Zapis na 1 godzinę kosztuje dwukrotność stawki za wejście, wobec jednokrotności dla zapisu na 5 minut. Jeśli Twoje żądania przychodzą w odstępach dłuższych niż pięć minut, prefiks odczytany trzy lub więcej razy w ciągu godziny wychodzi taniej z TTL 1 godziny: jeden zapis po 2× i dwa trafienia po 0.1× (2.2×) wobec trzech zapisów na 5 minut (3×).

Czy da się korzystać z Kimi K3 taniej?

Największą dźwignią jest niższy poziom rozumowania, bo o rachunku decyduje wyjście. Trzymaj długi, wielokrotnie używany kontekst na początku promptu, aby był odczytywany z cache. Wagi Kimi K3 są otwarte, ale przy 2,8 bln parametrów samodzielne uruchomienie wymaga sprzętu klasy centrum danych, co opłaca się tylko przy bardzo dużej skali.

Najczęściej zadawane pytania

Czy Kimi K3 kosztuje więcej przy długich promptach?

Nie. Kimi K3 ma stałą cenę za token: nie ma osobnego progu dla długiego kontekstu.

Czy istnieje subskrypcja Kimi K3?

Nie na SeedRouter. Doładowujesz saldo i płacisz za tokeny. Własne API Moonshot również rozlicza za tokeny i odblokowuje Kimi K3 dopiero po pierwszym doładowaniu.

Czy żądania zakończone błędem są rozliczane?

Nie. Żądanie do Kimi K3, które zwraca błąd, nie jest rozliczane.

Jak zacząć?

Poradnik API Kimi K3 pokazuje, jak uzyskać klucz i wykonać pierwsze wywołanie.

Powiązane poradniki