Ceny Grok 4.7: pamięć podręczna, rozumowanie i koszt żądania
Poznaj ceny Grok 4.7 i wpływ rozumowania na koszt. Oblicz opłatę według aktualnych stawek bez podwójnego liczenia tokenów z pamięci podręcznej.
Czytaj jako MarkdownCeny Grok 4.7 zależą od tokenów wejściowych, wejścia z pamięci podręcznej i zużycia na wyjściu. Oficjalne stawki początkowe wynoszą 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. Są to ceny katalogowe modelu; szacując żądanie SeedRouter, użyj poniższej tabeli aktualnych stawek SeedRouter.[1]
Widoczna długość odpowiedzi to tylko część obliczenia. Krótka odpowiedź może obejmować dodatkowe tokeny rozumowania, a długi prompt może zawierać wejście z pamięci podręcznej. Strona modelu Grok 4.7 łączy Playground z aktualnymi cenami.
Ile kosztuje Grok 4.7?
Oficjalne ogłoszenie podaje powyższe stawki wejścia i wyjścia jako ceny początkowe Grok 4.7. Opisuje też osobny wariant fast o innej cenie. Ten przewodnik dotyczy modelu grok-4.7; cena wariantu o podobnej nazwie nie jest z nim zamienna.[2]
Dla żądania wysłanego przez SeedRouter użyj tych aktualnych stawek za tokeny:
Cennik jest czasowo niedostępny. Spróbuj ponownie wkrótce.
Odczytaj stawki dla progu odpowiadającego długości wejścia żądania. W SeedRouter wejście poniżej 200 000 tokenów korzysta ze standardowego progu; od 200 000 tokenów próg długiego kontekstu obejmuje całe żądanie. Wejście, wejście z pamięci podręcznej i wyjście używają odpowiedniego progu. Granica ta określa cenę, a nie rezerwację takiej liczby tokenów.
Dla service_tier: "priority" lub "fast" podwój stawki za tokeny wybranego progu długości wejścia. Mnożnik dotyczy kosztów tokenów; opłaty za narzędzia są obliczane osobno.
Oficjalny przegląd API podaje okno kontekstowe 500 000 tokenów. Ten limit możliwości nie oznacza, że każde żądanie jest rozliczane za całe okno.[1]
Które pola użycia uwzględnić w obliczeniu?
Dla API Responses zachowaj trzy wartości ze zwróconego usage:
| Pole użycia | Jak go użyć |
|---|---|
input_tokens | Całkowite wejście, w tym część z pamięci podręcznej |
input_tokens_details.cached_tokens | Część wejścia rozliczana według stawki dla pamięci podręcznej |
output_tokens | Całkowite wyjście używane w obliczeniu tokenów |
Odejmij tokeny z pamięci podręcznej od całego wejścia przed zastosowaniem zwykłej stawki wejściowej. W przeciwnym razie te same tokeny policzysz raz jako zwykłe wejście, a drugi raz jako wejście z pamięci podręcznej.
Dla stawek podanych za milion tokenów:
uncached input = input_tokens - cached_tokens
token cost = (
uncached input × input rate
+ cached_tokens × cached-input rate
+ output_tokens × output rate
) / 1,000,000Dla każdego składnika użyj stawek z aktualnej tabeli. Próg długości wejścia wybierz na podstawie całego wejścia przed odjęciem tokenów z pamięci podręcznej. Oszacowanie tokenów nie obejmuje automatycznie osobnych opłat za narzędzia; żądanie korzystające z płatnego narzędzia wyszukiwania wymaga uwzględnienia również tego użycia.
Dlaczego krótka odpowiedź może zużyć więcej tokenów wyjściowych?
Rozumowanie wpływa na zużycie wyjścia, nawet gdy końcowa odpowiedź jest krótka. Na przykład jedno ukończone żądanie Responses do Grok 4.7, zweryfikowane 10 października 2026 r., zwróciło:
{
"input_tokens": 3340,
"input_tokens_details": { "cached_tokens": 1152 },
"output_tokens": 22,
"output_tokens_details": { "reasoning_tokens": 21 },
"total_tokens": 3362
}To żądanie zawiera 2188 tokenów wejściowych spoza pamięci podręcznej, 1152 tokeny wejściowe z pamięci podręcznej i 22 tokeny wyjściowe. Jego 21 tokenów rozumowania to część całkowitego wyjścia. Ponowne ich dodanie zmieniłoby 22 w 43 i zawyżyło szacowaną opłatę za wyjście.
Te liczby opisują jedno ukończone żądanie, a nie średnią lub prognozę dla innych promptów. Planując budżet aplikacji, zapisuj raportowane zużycie dla reprezentatywnych zadań i sprawdzaj, czy każdy wynik spełnia wymagania zadania.
Czy strumieniowanie zmienia cenę tokenów?
Strumieniowanie zmienia sposób dostarczania odpowiedzi. Oszacowanie nadal wykorzystuje wejście, wejście z pamięci podręcznej i wyjście ukończonego żądania. Zachowuj końcowe informacje o użyciu zamiast traktować każdy fragment tekstu jako osobne płatne żądanie.
W weryfikacji Grok 4.7 przeprowadzonej przez SeedRouter żądania Chat i Responses, ze strumieniowaniem i bez niego, zakończyły się z uwzględnieniem wejścia z pamięci podręcznej. Potwierdza to obliczanie użycia; nie oznacza, że dwie oddzielnie wygenerowane odpowiedzi zużywają identyczną liczbę tokenów.
Jak porównać koszt dwóch promptów?
Zachowaj tę samą treść zadania i te same kryteria akceptacji. Dla każdej próby zapisz całkowite wejście, wejście z pamięci podręcznej, wyjście i przydatność odpowiedzi. Porównaj całkowity wydatek potrzebny do uzyskania akceptowalnego wyniku, w tym udane generacje wymagające powtórzenia z powodu niewystarczającej jakości odpowiedzi.
W długiej rozmowie usuwaj nieistotną historię dopiero po sprawdzeniu, że krótsza wersja nadal odpowiada prawidłowo. Przy powtarzanym kontekście sprawdzaj liczbę tokenów z pamięci podręcznej; samo powtórzenie tekstu nie dowodzi trafienia w pamięć podręczną. W zadaniach wymagających dużo rozumowania porównuj rzeczywiste zużycie wyjścia, a nie tylko liczbę słów widocznych w odpowiedzi.
Pytania o ceny
Czy oficjalna stawka podstawowa to cena, którą płacę w SeedRouter?
Dla SeedRouter użyj aktualizowanej tabeli powyżej. Oficjalna cena początkowa stanowi przydatny punkt odniesienia, ale oszacowanie wynika z aktualnych progów długości wejścia i stawek za tokeny w usłudze.
Czy należy dodać reasoning_tokens do output_tokens?
Nie. W pokazanych powyżej danych Responses rozumowanie jest już uwzględnione w całkowitym wyjściu. Jego szczegółowy podział pomaga zrozumieć wykonaną pracę i nie stanowi drugiej opłaty za wyjście.
Czy powtórzenie promptu gwarantuje zniżkę za wejście z pamięci podręcznej?
Nie. Użyj liczby tokenów z pamięci podręcznej podanej w odpowiedzi. Stawkę dla pamięci podręcznej zastosuj tylko do tej części, a zwykłą stawkę wejściową do reszty.
Gdzie sprawdzić ostateczną opłatę?
Rejestry użycia pokazują opłatę za ukończone żądanie. Dla nowego oszacowania odśwież sekcję cen Grok 4.7 i użyj danych o zużyciu podanych dla danego żądania. Żądania zwracające błąd nie są rozliczane.
Źródła
- SpaceXAI API: modele Grok i ceny, sprawdzono 10 października 2026 r.
- Przedstawiamy Grok 4.7, 21 września 2026 r.



