Prezzi di Claude Haiku 5.5: token, cache e soglia di 100K
Scopri i prezzi dei token di Claude Haiku 5.5, la soglia di input di 100K, letture e scritture cache e come stimare una richiesta completata.
Leggi in MarkdownI prezzi di Claude Haiku 5.5 dipendono da dove lo chiami e da quanto contesto contiene la richiesta. Anthropic pubblica tariffe distinte per prompt fino a 100.000 token e prompt oltre tale soglia. Su SeedRouter usa la tabella aggiornata sotto per stimare una richiesta; non sostituire la tariffa mostrata nella tua applicazione con la tabella del produttore.[1]
Questa guida distingue struttura ufficiale dei prezzi, conteggio della cache e dati di utilizzo necessari per una stima. La pagina di Claude Haiku 5.5 include Playground e prezzi attuali. Se stai scegliendo tra modelli, inizia dalla guida Haiku 5.5 contro Sonnet 5.5.
Quanto addebita Anthropic per Claude Haiku 5.5?
Questi sono i prezzi pubblicati da Anthropic, controllati il 9 ottobre 2026. Tutti gli importi sono per milione di token. Descrivono i suoi prezzi standard dei token, non le tariffe attuali addebitate da SeedRouter.[1]
| Categoria di token | Prompt fino a 100K token | Prompt oltre 100K token |
|---|---|---|
| Input | $0,10 | $0,50 |
| Output | $0,50 | $2,50 |
| Scrittura cache di cinque minuti | $0,125 | $0,625 |
| Scrittura cache di un'ora | $0,20 | $1,00 |
| Lettura cache | $0,01 | $0,05 |
La sola tariffa dei token di output non descrive l'intera richiesta. Una risposta breve può seguire un documento lungo e un documento ripetuto può generare utilizzo di lettura cache invece di input interamente nuovo. Tieni separate queste categorie quando confronti le fatture.
Cosa cambia alla soglia di 100K?
La panoramica ufficiale assegna tariffe diverse di input, output e cache alle due fasce di dimensione del prompt. Superare la soglia influisce quindi su più del costo dell'input aggiuntivo. Controlla le regole di prezzo del servizio che usi effettivamente e conserva l'utilizzo dichiarato, soprattutto quando una richiesta combina input nuovo e contesto in cache.[1]
La soglia non è il limite della finestra di contesto. Haiku 5.5 ha una finestra di 1M token e un output massimo standard di 128.000 token. Sono limiti di capacità; non significano che ogni chiamata riservi o fatturi l'intera finestra. Un valore elevato di max_tokens è un budget di output, mentre l'utilizzo restituito descrive quanto consumato dal modello.[1]
Una verifica utile dell'applicazione consiste nel confrontare due lavori reali: uno con soli estratti rilevanti e uno con il documento fonte completo. Registra se l'input più breve produce ancora un risultato accettabile prima di considerare meno token come un risparmio.
Come incidono letture e scritture cache sulla fattura?
Una scrittura cache crea un prefisso di prompt riutilizzabile; una lettura lo riutilizza. Haiku 5.5 ha un prompt minimo memorizzabile in cache di 512 token. Aggiungere un controllo cache a un prompt più breve non dimostra che sia stato memorizzato: esamina cache_creation_input_tokens e cache_read_input_tokens nella risposta.[2]
Le durate di cinque minuti e un'ora hanno tariffe di scrittura diverse. Mantieni il prefisso di durata maggiore prima di quello di durata minore e usa al massimo quattro punti di interruzione cache. Istruzioni ripetute e materiale di riferimento sono candidati utili quando restano invariati tra richieste. Cambiare spesso il testo vicino all'inizio del prefisso riduce le possibilità di riutilizzarlo.[2]
Per ogni richiesta, mantieni input senza cache, creazione cache, letture cache e output in colonne separate. Non conteggiare due volte gli stessi token di creazione sommando sia il conteggio totale sia la suddivisione cinque minuti/un'ora. Usa la suddivisione per distribuire il totale nelle categorie appropriate.
Quali sono le tariffe attuali di SeedRouter?
Questa tabella legge le tariffe attuali. È la fonte dei prezzi per una richiesta tramite SeedRouter; le fasce ufficiali di contesto sopra sono un riferimento separato.
Claude Haiku 5.5
Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.
| Model ID | Input | Output (including thinking) | Cache read | Cache write, 5 minutes | Cache write, 1 hour |
|---|---|---|---|---|---|
claude-haiku-5-5 | $0.35 | $1.75 | $0.035 | $0.4375 | unavailable |
Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.
La sezione prezzi della pagina del modello usa le stesse tariffe attuali nei suoi esempi. Aggiorna la tabella prima di stimare un nuovo carico di lavoro. Una voce di prezzo assente non dimostra che il relativo utilizzo sia gratuito.
Come posso stimare una richiesta completata?
Per tariffe dei token espresse per milione, moltiplica ogni categoria di utilizzo per la tariffa corrispondente e dividi per un milione. Somma i risultati:
estimated cost = (
uncached input tokens × input rate
+ output tokens × output rate
+ cache-read tokens × cache-read rate
+ five-minute cache-write tokens × five-minute write rate
+ one-hour cache-write tokens × one-hour write rate
) / 1,000,000I token di pensiero fanno parte dell'utilizzo di output. Se una risposta include una suddivisione dei token di pensiero, non aggiungerla al totale dichiarato dei token di output. Lo sforzo di pensiero predefinito è medium; cambiarlo può modificare la quantità di ragionamento generato, quindi confronta attività completate invece di presumere un conteggio identico a ogni impostazione.[3]
Per prevedere un carico di lavoro, conserva un insieme rappresentativo di richieste, il loro utilizzo e se il risultato ha superato le tue verifiche. Includi i tentativi ripetuti dovuti a risposte inadeguate. Una risposta economica che richiede un secondo tentativo ha un costo totale diverso da una prima risposta accettabile. La documentazione API spiega campi, motivi di arresto e limiti da registrare.
Domande sui prezzi
Il prezzo ufficiale per contesto breve è quello che pago su SeedRouter?
Usa la tabella aggiornata per SeedRouter. La tabella pubblicata da Anthropic descrive i suoi prezzi; nomi di modello identici non stabiliscono addebiti identici.
Impostare max_tokens a 128000 addebita tutti quei token?
Imposta il budget massimo di output. Stima una richiesta completata dall'uso dichiarato, incluso il pensiero, ed esamina il motivo di arresto per vedere se l'output ha raggiunto quel limite.[1]
Un campo di controllo cache garantisce un cache hit?
No. Il prompt deve rispettare la lunghezza minima e corrispondere a un prefisso in cache utilizzabile. Il conteggio di lettura cache della risposta dimostra il riutilizzo.[2]
Le richieste fallite vengono addebitate?
Le richieste che restituiscono un errore non vengono addebitate. Una risposta completata senza errori che si ferma al limite di output resta una generazione completata; esamina l'utilizzo e il motivo di arresto.



