Claude Opus 5.5 est disponible sur SeedRouter
LogoSeedRouter

Rechercher un modèle par nom, ex. « nano banana »

Rechercher un modèle par nom, ex. « nano banana »

Prix de Grok 4.7 : entrée en cache, raisonnement et coût des requêtes

Comprenez les prix de Grok 4.7, le cache et le raisonnement. Estimez le coût avec les tarifs actuels sans compter deux fois les tokens en cache.

Lire en Markdown

Les prix de Grok 4.7 dépendent des tokens d’entrée, de l’entrée en cache et de la consommation en sortie. Les tarifs de départ officiels sont de 2 dollars par million de tokens d’entrée et de 6 dollars par million de tokens de sortie. Ces tarifs de référence décrivent le prix catalogue du modèle ; pour estimer une requête SeedRouter, utilisez le tableau des tarifs actuels de SeedRouter ci-dessous.[1]

La longueur visible de la réponse n’est qu’une partie du calcul. Une réponse courte peut inclure des tokens de raisonnement supplémentaires, tandis qu’un long prompt peut contenir de l’entrée en cache. La page du modèle Grok 4.7 rassemble le Playground et les tarifs actuels.

Combien coûte Grok 4.7 ?

L’annonce officielle présente les tarifs d’entrée et de sortie ci-dessus comme les prix de départ de Grok 4.7. Elle décrit aussi une variante fast distincte, à un autre prix. Ce guide porte sur le modèle grok-4.7 ; le tarif d’une variante au nom similaire ne peut pas remplacer le sien.[2]

Pour une requête effectuée via SeedRouter, utilisez ces tarifs actuels par token :

La tarification est temporairement indisponible. Veuillez revenir bientôt.

Consultez les tarifs du palier correspondant à la longueur d’entrée de la requête. Sur SeedRouter, les entrées de moins de 200 000 tokens utilisent le palier standard ; à partir de 200 000 tokens, le palier de contexte long s’applique à toute la requête. L’entrée, l’entrée en cache et la sortie utilisent chacune le palier correspondant. Ce seuil est une limite tarifaire, pas une réservation de ce nombre de tokens.

Avec service_tier: "priority" ou "fast", doublez les tarifs des tokens du palier de longueur d’entrée sélectionné. Ce multiplicateur s’applique aux frais de tokens ; les frais d’outils sont calculés séparément.

La présentation officielle de l’API indique une fenêtre de contexte de 500 000 tokens. Cette limite de capacité ne signifie pas que chaque requête est facturée pour la fenêtre entière.[1]

Quels champs d’utilisation entrent dans le calcul ?

Pour l’API Responses, conservez trois valeurs du champ usage retourné :

Champ d’utilisationComment l’utiliser
input_tokensEntrée totale, partie en cache comprise
input_tokens_details.cached_tokensPartie de l’entrée facturée au tarif de l’entrée en cache
output_tokensSortie totale utilisée dans le calcul des tokens

Soustrayez les tokens en cache de l’entrée totale avant d’appliquer le tarif d’entrée ordinaire. Sinon, les mêmes tokens en cache sont comptés une fois comme entrée ordinaire, puis une autre fois comme entrée en cache dans votre estimation.

Pour des tarifs exprimés par million de tokens :

uncached input = input_tokens - cached_tokens

token cost = (
  uncached input × input rate
  + cached_tokens × cached-input rate
  + output_tokens × output rate
) / 1,000,000

Utilisez les tarifs du tableau actuel pour chaque terme. Sélectionnez le palier de longueur d’entrée à partir de l’entrée totale, avant de soustraire les tokens en cache. Une estimation des tokens n’inclut pas automatiquement les frais d’outils distincts ; une requête utilisant un outil de recherche payant doit aussi tenir compte de cette utilisation.

Pourquoi une réponse courte peut-elle utiliser plus de tokens de sortie ?

Le raisonnement contribue à la consommation en sortie, même lorsque la réponse finale est brève. Par exemple, une requête Responses Grok 4.7 terminée et vérifiée le 10 octobre 2026 a retourné :

{
  "input_tokens": 3340,
  "input_tokens_details": { "cached_tokens": 1152 },
  "output_tokens": 22,
  "output_tokens_details": { "reasoning_tokens": 21 },
  "total_tokens": 3362
}

Cette requête contient 2 188 tokens d’entrée hors cache, 1 152 tokens d’entrée en cache et 22 tokens de sortie. Ses 21 tokens de raisonnement constituent un détail du total de sortie. Les ajouter à nouveau ferait passer 22 à 43 et surestimerait les frais de sortie.

Ces chiffres décrivent une requête terminée, pas une moyenne ni une prévision pour d’autres prompts. Pour établir le budget de votre application, enregistrez la consommation rapportée sur des tâches représentatives et vérifiez si chaque résultat répond aux exigences de la tâche.

Le streaming change-t-il le prix des tokens ?

Le streaming change la façon dont la réponse arrive. L’estimation repose toujours sur l’entrée, l’entrée en cache et la sortie de la requête terminée. Conservez les informations finales d’utilisation au lieu de traiter chaque fragment de texte comme une requête facturable distincte.

Lors de la vérification de Grok 4.7 par SeedRouter, les requêtes Chat et Responses, avec et sans streaming, se sont terminées en comptabilisant l’entrée en cache. Cela vérifie le calcul de l’utilisation ; cela ne signifie pas que deux réponses générées séparément consomment un nombre identique de tokens.

Comment comparer le coût de deux prompts ?

Gardez la même tâche et les mêmes critères d’acceptation. Pour chaque tentative, notez l’entrée totale, l’entrée en cache, la sortie et si la réponse était exploitable. Comparez le montant total dépensé pour obtenir un résultat acceptable, y compris les générations réussies que vous avez dû répéter parce que leurs réponses étaient insuffisantes.

Pour une longue conversation, retirez l’historique non pertinent uniquement après avoir vérifié que la version plus courte répond toujours correctement. Pour un contexte répété, examinez le nombre de tokens en cache ; la répétition du texte ne prouve pas à elle seule une utilisation du cache. Pour les tâches nécessitant beaucoup de raisonnement, comparez la consommation réelle en sortie plutôt que de compter uniquement les mots affichés dans la réponse.

Questions sur les prix

Le tarif de référence officiel est-il le prix que je paie sur SeedRouter ?

Pour SeedRouter, utilisez le tableau actualisé ci-dessus. Le prix de départ officiel fournit un repère utile, tandis que les paliers de longueur d’entrée et les tarifs actuels des tokens du service déterminent l’estimation.

Faut-il ajouter reasoning_tokens à output_tokens ?

Non. Dans l’utilisation Responses présentée ci-dessus, le raisonnement est déjà inclus dans la sortie totale. Utilisez le détail du raisonnement pour comprendre le travail effectué, pas comme une deuxième facturation de sortie.

Répéter un prompt garantit-il une réduction pour l’entrée en cache ?

Non. Utilisez le nombre de tokens en cache indiqué dans la réponse. Appliquez le tarif d’entrée en cache uniquement à cette partie, et le tarif d’entrée ordinaire au reste.

Où vérifier le montant final ?

Vos relevés d’utilisation affichent le montant de la requête terminée. Pour une nouvelle estimation, actualisez la section des prix de Grok 4.7 et utilisez la consommation rapportée pour cette requête. Les requêtes qui renvoient une erreur ne sont pas facturées.

Sources

  1. SpaceXAI API : modèles Grok et tarifs, consulté le 10 octobre 2026.
  2. Présentation de Grok 4.7, 21 septembre 2026.

Guides associés