Claude Opus 5.5 est disponible sur SeedRouter

Effort de raisonnement de GPT-6.1 Sol : low, medium, high, xhigh ou max ?

Quel effort de raisonnement choisir pour GPT-6.1 Sol : temps, tokens et coûts réels en low, medium, high, xhigh et max, pourquoi il semble lent, où commencer.

Lire en Markdown

Démarrez GPT-6.1 Sol en medium, son réglage par défaut, et utilisez low quand vous voulez la réponse rapidement. Ne montez l'effort à high, xhigh ou max que pour les tâches qui échouent en medium : longs refactorings, débogage difficile, travail d'agent en plusieurs étapes. Sur les tâches courtes des tests ci-dessous, chaque niveau d'effort a donné la bonne réponse, mais max a mis environ dix fois plus de temps à afficher son premier mot et a utilisé de deux fois et demie à cinq fois plus de tokens que low.

C'est aussi la principale raison pour laquelle GPT-6.1 Sol semble lent. Il raisonne toujours avant de répondre, et vous attendez la fin de ce raisonnement avant le premier texte visible.

Quels efforts de raisonnement GPT-6.1 Sol prend-il en charge ?

Cinq : low, medium, high, xhigh et max. La valeur par défaut est medium. Selon la page du modèle GPT-6.1 Sol d'OpenAI, « les efforts de raisonnement none et minimal ne sont pas pris en charge » : contrairement à GPT-6 Sol, il est donc impossible de désactiver le raisonnement. Sans none, les paramètres d'échantillonnage comme temperature et top_p n'ont pas d'effet non plus.

L'effort se définit par requête. Dans l'API Responses, c'est reasoning.effort :

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

Dans Chat Completions, le champ s'appelle reasoning_effort. Les tokens de raisonnement sont comptés dans output_tokens, facturés comme de la sortie, et partagent le budget de max_output_tokens avec la réponse.

Comment les cinq efforts se comparent-ils en pratique ?

Le test a envoyé à GPT-6.1 Sol, via SeedRouter le 5 octobre 2026, trois prompts aux réponses connues, une fois par niveau d'effort, les cinq niveaux en même temps. Les temps sont des secondes entre la requête et la réponse complète. Le coût est calculé aux prix catalogue d'OpenAI de $2 en entrée et $10 en sortie par million de tokens, vérifiés le 5 octobre 2026.

Problème de dénombrement — combien d'entiers de 1 à 1000 sont divisibles par 3 ou par 5 mais pas par 7 (réponse : 401).

EffortSecondesTokens de raisonnementTokens de sortieCoûtCorrect
low14,051225$0,0023Oui
medium13,446187$0,0020Oui
high14,6134272$0,0028Oui
xhigh16,2303362$0,0037Oui
max20,4516574$0,0058Oui

Problème de dénombrement plus difficile — combien d'entiers de 1 à 99 999 sont des multiples de 7 et ne contiennent aucun chiffre 7 (réponse : 8 434).

EffortSecondesTokens de raisonnementTokens de sortieCoûtCorrect
low17,5473711$0,0072Oui
medium27,61 0311 273$0,0128Oui
high28,31 0341 255$0,0126Oui
xhigh31,21 5521 763$0,0177Oui
max42,62 0702 259$0,0227Oui

Revue de code — trouver les bugs d'une fonction Python median de quatre lignes qui trie son entrée sur place et gère mal les listes de longueur paire.

EffortSecondesTokens de raisonnementTokens de sortieCoûtA trouvé les deux bugs
low14,976221$0,0023Oui, avec une version corrigée
medium15,491194$0,0020Oui
high19,5296396$0,0040Oui
xhigh19,5516606$0,0061Oui
max28,41 0341 114$0,0112Oui

Il s'agit d'exécutions uniques sur des tâches courtes : prenez-les comme un ordre de grandeur, pas comme un benchmark. Le nombre de tokens de raisonnement varie d'une exécution à l'autre, et c'est sur les tâches plus difficiles qu'un effort plus élevé justifie son coût.

Pourquoi GPT-6.1 Sol est-il lent ?

L'essentiel de l'attente vient du raisonnement, et le raisonnement passe en premier. Un second test a diffusé en streaming la même explication de 300 mots à trois niveaux d'effort et mesuré l'arrivée du premier texte visible :

EffortPremier texte aprèsTemps totalTokens de raisonnementVitesse de réponse
low3,0 s20,5 s5625 tokens/s
medium13,6 s24,7 s82440 tokens/s
max30,6 s43,5 s2 51734 tokens/s

Une fois la réponse lancée, elle arrive à un rythme similaire à chaque niveau. Ce qui change, c'est la phase silencieuse qui la précède : en max, le modèle a passé une demi-minute à raisonner avant d'écrire quoi que ce soit. Si vos utilisateurs regardent un indicateur de chargement, low avec streaming est le réglage qui paraît le plus rapide.

OpenAI a aussi annoncé GPT-6.1 Sol Ultrafast, avec une « génération de tokens jusqu'à 8x plus rapide que sa vitesse standard dans Codex », dans son article de lancement.

xhigh ou max peuvent-ils être moins bons que medium ?

Sur une tâche donnée, oui : un effort plus élevé ne garantit pas une meilleure réponse. Dans les exécutions ci-dessus, max n'a jamais battu low en exactitude, il a seulement coûté plus cher. Les résultats d'OpenAI vont dans le même sens pour le travail courant : GPT-6.1 Sol a battu le meilleur score DeepSWE de GPT-6 Sol « à un effort de raisonnement plus faible », et son plus grand gain de factualité par rapport à GPT-6 Sol a été obtenu à l'effort low.

Là où un effort plus élevé paie dans les chiffres d'OpenAI, c'est sur le travail long et difficile : ses résultats OSWorld 2.0 et Terminal-Bench Science pour GPT-6.1 Sol sont donnés à l'effort maximal. La règle pratique consiste à mesurer sur vos propres tâches. Lancez un échantillon en medium et un niveau au-dessus, et ne gardez le niveau supérieur que là où il corrige des échecs.

Quel effort utiliser ?

  • low — réponses de chat, classification, extraction, modifications de code simples, tout ce qu'un utilisateur attend.
  • medium — le réglage par défaut pour l'aide au code, les revues et la plupart des étapes d'agent.
  • high — modifications sur plusieurs fichiers et débogage qui échoue en medium.
  • xhigh — longs refactorings et planification sur de nombreuses étapes.
  • max — les problèmes les plus difficiles, où une mauvaise réponse coûte plus cher que les tokens supplémentaires.

Pour un agent complet, mélangez les niveaux : planifiez à un effort plus élevé, exécutez les étapes d'outils courantes en low ou medium. Les prix de chaque niveau figurent sur la page GPT-6.1 Sol, et le guide des prix de GPT-6.1 Sol explique comment les tokens de raisonnement apparaissent sur la facture.

Questions fréquentes

Quel est l'effort de raisonnement par défaut de GPT-6.1 Sol ?

medium. Si vous omettez le champ, GPT-6.1 Sol raisonne en medium.

Faut-il utiliser low ou medium avec GPT-6.1 Sol ?

Utilisez medium par défaut et low là où la vitesse compte plus que la profondeur. Dans le test ci-dessus, low a répondu correctement à chaque question et a affiché son premier texte en environ trois secondes, contre environ quatorze en medium.

Pourquoi GPT-6.1 Sol est-il si lent ?

Il raisonne avant de répondre, et le raisonnement n'est pas diffusé sous forme de texte. À partir de medium, cette phase silencieuse représente l'essentiel de l'attente. Baissez l'effort ou diffusez la réponse en streaming pour afficher du texte plus tôt.

xhigh est-il meilleur que high sur GPT-6.1 Sol ?

Seulement sur les tâches qui en ont besoin. Sur des tâches courtes, les deux niveaux ont donné les mêmes réponses, et xhigh a utilisé plus de tokens. Testez les deux sur votre propre travail avant de payer pour xhigh.

Peut-on désactiver le raisonnement de GPT-6.1 Sol ?

Non. GPT-6.1 Sol ne prend en charge ni none ni minimal. Si vous avez besoin de réponses sans raisonnement, GPT-6 Sol prend toujours en charge none. Voir le comparatif GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.

Guides associés