Claude Opus 5.5 est disponible sur SeedRouter
LogoSeedRouter

Rechercher un modèle par nom, ex. « nano banana »

Rechercher un modèle par nom, ex. « nano banana »

Claude Haiku 5.5 : tarifs, tokens, cache et seuil de 100K

Comprenez les prix des tokens Claude Haiku 5.5, le seuil de 100K en entrée, les écritures et lectures du cache et le coût d’une requête terminée.

Lire en Markdown

Les tarifs de Claude Haiku 5.5 dépendent du service utilisé pour l’appeler et de la quantité de contexte contenue dans la requête. Anthropic publie des tarifs distincts pour les prompts jusqu’à 100 000 tokens et ceux dépassant ce seuil. Sur SeedRouter, utilisez le tableau en direct ci-dessous pour estimer une requête ; ne remplacez pas le tarif affiché dans votre application par la grille du fabricant.[1]

Ce guide distingue la structure officielle des prix, la comptabilisation du cache et les données d’utilisation nécessaires à une estimation. La page du modèle Claude Haiku 5.5 comprend un Playground et les prix actuels. Si vous choisissez entre plusieurs modèles, commencez par le guide Haiku 5.5 versus Sonnet 5.5.

Combien Anthropic facture-t-il pour Claude Haiku 5.5 ?

Voici les prix publiés par Anthropic, vérifiés le 9 octobre 2026. Tous les montants sont par million de tokens. Ils décrivent sa tarification standard des tokens, pas les tarifs en direct facturés par SeedRouter.[1]

Catégorie de tokensPrompt jusqu’à 100K tokensPrompt au-delà de 100K tokens
Entrée$0,10$0,50
Sortie$0,50$2,50
Écriture du cache de cinq minutes$0,125$0,625
Écriture du cache d’une heure$0,20$1,00
Lecture du cache$0,01$0,05

Un tarif de tokens de sortie ne décrit pas à lui seul toute la requête. Une réponse courte peut suivre un long document, et un document répété peut produire de l’utilisation en lecture du cache plutôt qu’une entrée entièrement nouvelle. Gardez ces catégories séparées lorsque vous comparez les factures.

Qu’est-ce qui change au seuil de 100K ?

La présentation officielle attribue des tarifs d’entrée, de sortie et de cache différents aux deux plages de taille des prompts. Franchir le seuil affecte donc plus que le coût de l’entrée supplémentaire. Vérifiez les règles de tarification du service réellement utilisé et conservez l’utilisation déclarée, surtout lorsqu’une requête combine une nouvelle entrée avec du contexte mis en cache.[1]

Ce seuil n’est pas la limite de la fenêtre de contexte. Haiku 5.5 dispose d’une fenêtre de contexte de 1M tokens et d’un maximum standard de sortie de 128 000 tokens. Ce sont des plafonds de capacité ; ils ne signifient pas que chaque appel réserve ou facture la fenêtre entière. Une valeur élevée de max_tokens constitue un budget de sortie, tandis que l’utilisation retournée décrit ce que le modèle a consommé.[1]

Une vérification utile dans l’application consiste à comparer deux tâches réelles : l’une avec les seuls extraits pertinents, l’autre avec le document source complet. Notez si l’entrée plus courte produit toujours un résultat acceptable avant de considérer la réduction des tokens comme une économie.

Comment les écritures et lectures du cache affectent-elles la facture ?

Une écriture du cache crée un préfixe de prompt réutilisable ; une lecture le réutilise. Haiku 5.5 exige au moins 512 tokens pour qu’un prompt soit mis en cache. Ajouter un contrôle du cache à un prompt plus court ne prouve pas sa mise en cache : examinez cache_creation_input_tokens et cache_read_input_tokens dans la réponse.[2]

Les durées de vie de cinq minutes et d’une heure ont des tarifs d’écriture différents. Placez le préfixe à durée de vie longue avant celui à durée plus courte et n’utilisez pas plus de quatre points de rupture du cache. Les instructions répétées et les documents de référence sont de bons candidats lorsqu’ils restent inchangés d’une requête à l’autre. Un texte qui change souvent près du début du préfixe réduit les possibilités de réutilisation.[2]

Pour chaque requête, gardez l’entrée non mise en cache, la création du cache, les lectures du cache et la sortie dans des colonnes distinctes. Ne comptez pas deux fois les mêmes tokens de création du cache en ajoutant à la fois le total de création et sa ventilation cinq minutes/une heure. Utilisez cette ventilation pour répartir le total entre les bonnes catégories.

Quels sont les tarifs actuels de SeedRouter ?

Ce tableau lit les tarifs actuels. Il constitue la source des prix d’une requête effectuée via SeedRouter ; les paliers officiels de contexte ci-dessus servent de référence séparée.

Claude Haiku 5.5

Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-haiku-5-5$0.35$1.75$0.035$0.4375unavailable

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.

La section tarifs de la page du modèle utilise les mêmes tarifs actuels pour ses exemples. Actualisez le tableau avant d’estimer une nouvelle charge de travail. L’absence d’une ligne tarifaire ne prouve pas que l’utilisation correspondante est gratuite.

Comment estimer le coût d’une requête terminée ?

Pour des tarifs de tokens exprimés par million, multipliez chaque catégorie d’utilisation par son tarif correspondant et divisez par un million. Additionnez les résultats :

estimated cost = (
  uncached input tokens × input rate
  + output tokens × output rate
  + cache-read tokens × cache-read rate
  + five-minute cache-write tokens × five-minute write rate
  + one-hour cache-write tokens × one-hour write rate
) / 1,000,000

Les tokens de réflexion font partie de l’utilisation en sortie. Si une réponse contient une ventilation des tokens de réflexion, ne l’ajoutez pas au total des tokens de sortie déclarés. L’effort de réflexion par défaut est medium ; sa modification peut changer la quantité de raisonnement généré. Comparez donc les tâches terminées plutôt que de supposer un nombre de tokens identique pour chaque réglage.[3]

Pour prévoir une charge de travail, conservez un ensemble représentatif de requêtes, leur utilisation et l’indication que le résultat a réussi ou non vos vérifications. Incluez les nouvelles tentatives dues à des réponses insuffisantes. Une réponse peu coûteuse nécessitant un deuxième essai a un coût total différent d’une première réponse acceptable. La référence API explique les champs, motifs d’arrêt et limites à consigner.

Questions sur les tarifs

Le prix officiel pour un contexte court est-il celui que je paie sur SeedRouter ?

Utilisez le tableau en direct pour SeedRouter. La grille publiée par Anthropic décrit ses propres prix ; des noms de modèles identiques ne prouvent pas des frais identiques.

Définir max_tokens à 128000 facture-t-il tous ces tokens ?

Ce paramètre fixe le budget maximal de sortie. Estimez une requête terminée à partir de l’utilisation déclarée, réflexion comprise, et examinez le motif d’arrêt pour voir si la sortie a atteint cette limite.[1]

Un champ de contrôle du cache garantit-il une lecture réussie du cache ?

Non. Le prompt doit respecter la longueur minimale et correspondre à un préfixe mis en cache utilisable. Le nombre de tokens lus dans le cache déclaré par la réponse prouve la réutilisation.[2]

Les requêtes échouées sont-elles facturées ?

Les requêtes qui renvoient une erreur ne sont pas facturées. Une réponse réussie qui s’arrête à sa limite de sortie reste une génération terminée ; examinez son utilisation et son motif d’arrêt.

Sources

  1. Anthropic : présentation et tarifs de Claude Haiku 5.5.
  2. Anthropic : mise en cache des prompts.
  3. Anthropic : nouveautés de Haiku 5.5.

Guides associés