Prezzi di Grok 4.7: input nella cache, ragionamento e costo delle richieste
Scopri i prezzi di Grok 4.7, input nella cache e ragionamento. Stima il costo con le tariffe attuali senza contare due volte i token nella cache.
Leggi in MarkdownI prezzi di Grok 4.7 dipendono dai token di input, dall’input nella cache e dal consumo di output. Le tariffe iniziali ufficiali sono di 2 dollari per milione di token di input e 6 dollari per milione di token di output. Queste tariffe di riferimento descrivono il prezzo di listino del modello; per stimare una richiesta SeedRouter, usa la tabella dei prezzi attuali di SeedRouter qui sotto.[1]
La lunghezza visibile della risposta è solo una parte del calcolo. Una risposta breve può includere token di ragionamento aggiuntivi, mentre un prompt lungo può contenere input nella cache. La pagina del modello Grok 4.7 riunisce il Playground e i prezzi attuali.
Quanto costa Grok 4.7?
L’annuncio ufficiale indica le tariffe di input e output riportate sopra come prezzi iniziali di Grok 4.7. Descrive anche una variante fast separata, con un prezzo diverso. Questa guida riguarda il modello grok-4.7; il prezzo di una variante dal nome simile non è intercambiabile con il suo.[2]
Per una richiesta effettuata tramite SeedRouter, usa queste tariffe attuali dei token:
I prezzi non sono momentaneamente disponibili. Riprova tra poco.
Leggi le tariffe della fascia corrispondente alla lunghezza dell’input della richiesta. Su SeedRouter, gli input inferiori a 200.000 token usano la fascia standard; da 200.000 token in su, la fascia di contesto lungo si applica all’intera richiesta. Input, input nella cache e output usano ciascuno la fascia corrispondente. La soglia è un confine di prezzo, non una prenotazione di quel numero di token.
Con service_tier: "priority" o "fast", raddoppia le tariffe dei token della fascia di lunghezza dell’input selezionata. Questo moltiplicatore si applica ai costi dei token; i costi degli strumenti vengono calcolati separatamente.
La panoramica ufficiale dell’API indica una finestra di contesto di 500.000 token. Questo limite di capacità non significa che ogni richiesta venga fatturata per l’intera finestra.[1]
Quali campi di utilizzo servono per il calcolo?
Per l’API Responses, conserva tre valori del campo usage restituito:
| Campo di utilizzo | Come usarlo |
|---|---|
input_tokens | Input totale, inclusa la parte nella cache |
input_tokens_details.cached_tokens | Parte dell’input addebitata alla tariffa dell’input nella cache |
output_tokens | Output totale usato nel calcolo dei token |
Sottrai i token nella cache dall’input totale prima di applicare la normale tariffa di input. Altrimenti, nella stima conteggeresti gli stessi token nella cache una volta come input normale e una seconda volta come input nella cache.
Con tariffe espresse per milione di token:
uncached input = input_tokens - cached_tokens
token cost = (
uncached input × input rate
+ cached_tokens × cached-input rate
+ output_tokens × output rate
) / 1,000,000Usa le tariffe della tabella attuale per ogni termine. Seleziona la fascia di lunghezza dell’input usando l’input totale prima di sottrarre i token nella cache. Una stima dei token non include automaticamente i costi separati degli strumenti; una richiesta che usa uno strumento di ricerca a pagamento deve considerare anche quell’utilizzo.
Perché una risposta breve può usare più token di output?
Il ragionamento contribuisce al consumo di output anche quando la risposta finale è breve. Per esempio, una richiesta Responses di Grok 4.7 completata e verificata il 10 ottobre 2026 ha restituito:
{
"input_tokens": 3340,
"input_tokens_details": { "cached_tokens": 1152 },
"output_tokens": 22,
"output_tokens_details": { "reasoning_tokens": 21 },
"total_tokens": 3362
}Questa richiesta contiene 2.188 token di input non nella cache, 1.152 token di input nella cache e 22 token di output. I suoi 21 token di ragionamento sono un dettaglio del totale di output. Aggiungerli di nuovo trasformerebbe 22 in 43 e sovrastimerebbe il costo dell’output.
Questi numeri descrivono una richiesta completata, non una media o una previsione per altri prompt. Per pianificare il budget della tua applicazione, registra il consumo riportato per attività rappresentative e verifica se ogni risultato soddisfa i requisiti dell’attività.
Lo streaming cambia il prezzo dei token?
Lo streaming cambia il modo in cui arriva la risposta. La stima usa comunque input, input nella cache e output della richiesta completata. Conserva le informazioni finali di utilizzo, invece di considerare ogni frammento di testo una richiesta fatturabile separata.
Nella verifica di Grok 4.7 svolta da SeedRouter, le richieste Chat e Responses, con e senza streaming, si sono completate conteggiando l’input nella cache. Questo verifica il calcolo dell’utilizzo; non significa che due risposte generate separatamente consumino esattamente lo stesso numero di token.
Come confronto il costo di due prompt?
Mantieni invariati l’attività e i criteri di accettazione. Registra input totale, input nella cache, output e utilizzabilità della risposta per ogni tentativo. Confronta la spesa totale necessaria per ottenere un risultato accettabile, incluse le generazioni riuscite che hai dovuto ripetere perché le risposte erano insufficienti.
Per una conversazione lunga, rimuovi la cronologia irrilevante solo dopo aver verificato che la versione più breve risponda ancora correttamente. Per il contesto ripetuto, controlla il numero di token nella cache: ripetere il testo, da solo, non dimostra un riscontro nella cache. Per le attività con molto ragionamento, confronta il consumo effettivo di output invece di contare solo le parole visualizzate nella risposta.
Domande sui prezzi
La tariffa ufficiale di riferimento è il prezzo che pago su SeedRouter?
Per SeedRouter, usa la tabella aggiornata qui sopra. Il prezzo iniziale ufficiale offre un riferimento utile, mentre la stima dipende dalle fasce attuali di lunghezza dell’input e dalle tariffe dei token del servizio.
Devo aggiungere reasoning_tokens a output_tokens?
No. Nei dati di utilizzo Responses mostrati sopra, il ragionamento è già incluso nell’output totale. Usa il dettaglio del ragionamento per capire il lavoro svolto, non come un secondo addebito di output.
Ripetere un prompt garantisce uno sconto per l’input nella cache?
No. Usa il numero di token nella cache riportato dalla risposta. Applica la tariffa dell’input nella cache solo a quella parte e la normale tariffa di input al resto.
Dove posso controllare l’addebito finale?
I registri di utilizzo mostrano l’addebito della richiesta completata. Per una nuova stima, aggiorna la sezione prezzi di Grok 4.7 e usa il consumo riportato per quella richiesta. Le richieste che restituiscono un errore non vengono addebitate.
Fonti
- SpaceXAI API: modelli Grok e prezzi, verificato il 10 ottobre 2026.
- Presentazione di Grok 4.7, 21 settembre 2026.



