Effort de raisonnement de GPT-6.1 Sol : low, medium, high, xhigh ou max ?
Quel effort de raisonnement choisir pour GPT-6.1 Sol : temps, tokens et coûts réels en low, medium, high, xhigh et max, pourquoi il semble lent, où commencer.
Lire en MarkdownDémarrez GPT-6.1 Sol en medium, son réglage par défaut, et utilisez low quand vous voulez la réponse rapidement. Ne montez l'effort à high, xhigh ou max que pour les tâches qui échouent en medium : longs refactorings, débogage difficile, travail d'agent en plusieurs étapes. Sur les tâches courtes des tests ci-dessous, chaque niveau d'effort a donné la bonne réponse, mais max a mis environ dix fois plus de temps à afficher son premier mot et a utilisé de deux fois et demie à cinq fois plus de tokens que low.
C'est aussi la principale raison pour laquelle GPT-6.1 Sol semble lent. Il raisonne toujours avant de répondre, et vous attendez la fin de ce raisonnement avant le premier texte visible.
Quels efforts de raisonnement GPT-6.1 Sol prend-il en charge ?
Cinq : low, medium, high, xhigh et max. La valeur par défaut est medium. Selon la page du modèle GPT-6.1 Sol d'OpenAI, « les efforts de raisonnement none et minimal ne sont pas pris en charge » : contrairement à GPT-6 Sol, il est donc impossible de désactiver le raisonnement. Sans none, les paramètres d'échantillonnage comme temperature et top_p n'ont pas d'effet non plus.
L'effort se définit par requête. Dans l'API Responses, c'est reasoning.effort :
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)Dans Chat Completions, le champ s'appelle reasoning_effort. Les tokens de raisonnement sont comptés dans output_tokens, facturés comme de la sortie, et partagent le budget de max_output_tokens avec la réponse.
Comment les cinq efforts se comparent-ils en pratique ?
Le test a envoyé à GPT-6.1 Sol, via SeedRouter le 5 octobre 2026, trois prompts aux réponses connues, une fois par niveau d'effort, les cinq niveaux en même temps. Les temps sont des secondes entre la requête et la réponse complète. Le coût est calculé aux prix catalogue d'OpenAI de $2 en entrée et $10 en sortie par million de tokens, vérifiés le 5 octobre 2026.
Problème de dénombrement — combien d'entiers de 1 à 1000 sont divisibles par 3 ou par 5 mais pas par 7 (réponse : 401).
| Effort | Secondes | Tokens de raisonnement | Tokens de sortie | Coût | Correct |
|---|---|---|---|---|---|
low | 14,0 | 51 | 225 | $0,0023 | Oui |
medium | 13,4 | 46 | 187 | $0,0020 | Oui |
high | 14,6 | 134 | 272 | $0,0028 | Oui |
xhigh | 16,2 | 303 | 362 | $0,0037 | Oui |
max | 20,4 | 516 | 574 | $0,0058 | Oui |
Problème de dénombrement plus difficile — combien d'entiers de 1 à 99 999 sont des multiples de 7 et ne contiennent aucun chiffre 7 (réponse : 8 434).
| Effort | Secondes | Tokens de raisonnement | Tokens de sortie | Coût | Correct |
|---|---|---|---|---|---|
low | 17,5 | 473 | 711 | $0,0072 | Oui |
medium | 27,6 | 1 031 | 1 273 | $0,0128 | Oui |
high | 28,3 | 1 034 | 1 255 | $0,0126 | Oui |
xhigh | 31,2 | 1 552 | 1 763 | $0,0177 | Oui |
max | 42,6 | 2 070 | 2 259 | $0,0227 | Oui |
Revue de code — trouver les bugs d'une fonction Python median de quatre lignes qui trie son entrée sur place et gère mal les listes de longueur paire.
| Effort | Secondes | Tokens de raisonnement | Tokens de sortie | Coût | A trouvé les deux bugs |
|---|---|---|---|---|---|
low | 14,9 | 76 | 221 | $0,0023 | Oui, avec une version corrigée |
medium | 15,4 | 91 | 194 | $0,0020 | Oui |
high | 19,5 | 296 | 396 | $0,0040 | Oui |
xhigh | 19,5 | 516 | 606 | $0,0061 | Oui |
max | 28,4 | 1 034 | 1 114 | $0,0112 | Oui |
Il s'agit d'exécutions uniques sur des tâches courtes : prenez-les comme un ordre de grandeur, pas comme un benchmark. Le nombre de tokens de raisonnement varie d'une exécution à l'autre, et c'est sur les tâches plus difficiles qu'un effort plus élevé justifie son coût.
Pourquoi GPT-6.1 Sol est-il lent ?
L'essentiel de l'attente vient du raisonnement, et le raisonnement passe en premier. Un second test a diffusé en streaming la même explication de 300 mots à trois niveaux d'effort et mesuré l'arrivée du premier texte visible :
| Effort | Premier texte après | Temps total | Tokens de raisonnement | Vitesse de réponse |
|---|---|---|---|---|
low | 3,0 s | 20,5 s | 56 | 25 tokens/s |
medium | 13,6 s | 24,7 s | 824 | 40 tokens/s |
max | 30,6 s | 43,5 s | 2 517 | 34 tokens/s |
Une fois la réponse lancée, elle arrive à un rythme similaire à chaque niveau. Ce qui change, c'est la phase silencieuse qui la précède : en max, le modèle a passé une demi-minute à raisonner avant d'écrire quoi que ce soit. Si vos utilisateurs regardent un indicateur de chargement, low avec streaming est le réglage qui paraît le plus rapide.
OpenAI a aussi annoncé GPT-6.1 Sol Ultrafast, avec une « génération de tokens jusqu'à 8x plus rapide que sa vitesse standard dans Codex », dans son article de lancement.
xhigh ou max peuvent-ils être moins bons que medium ?
Sur une tâche donnée, oui : un effort plus élevé ne garantit pas une meilleure réponse. Dans les exécutions ci-dessus, max n'a jamais battu low en exactitude, il a seulement coûté plus cher. Les résultats d'OpenAI vont dans le même sens pour le travail courant : GPT-6.1 Sol a battu le meilleur score DeepSWE de GPT-6 Sol « à un effort de raisonnement plus faible », et son plus grand gain de factualité par rapport à GPT-6 Sol a été obtenu à l'effort low.
Là où un effort plus élevé paie dans les chiffres d'OpenAI, c'est sur le travail long et difficile : ses résultats OSWorld 2.0 et Terminal-Bench Science pour GPT-6.1 Sol sont donnés à l'effort maximal. La règle pratique consiste à mesurer sur vos propres tâches. Lancez un échantillon en medium et un niveau au-dessus, et ne gardez le niveau supérieur que là où il corrige des échecs.
Quel effort utiliser ?
low— réponses de chat, classification, extraction, modifications de code simples, tout ce qu'un utilisateur attend.medium— le réglage par défaut pour l'aide au code, les revues et la plupart des étapes d'agent.high— modifications sur plusieurs fichiers et débogage qui échoue enmedium.xhigh— longs refactorings et planification sur de nombreuses étapes.max— les problèmes les plus difficiles, où une mauvaise réponse coûte plus cher que les tokens supplémentaires.
Pour un agent complet, mélangez les niveaux : planifiez à un effort plus élevé, exécutez les étapes d'outils courantes en low ou medium. Les prix de chaque niveau figurent sur la page GPT-6.1 Sol, et le guide des prix de GPT-6.1 Sol explique comment les tokens de raisonnement apparaissent sur la facture.
Questions fréquentes
Quel est l'effort de raisonnement par défaut de GPT-6.1 Sol ?
medium. Si vous omettez le champ, GPT-6.1 Sol raisonne en medium.
Faut-il utiliser low ou medium avec GPT-6.1 Sol ?
Utilisez medium par défaut et low là où la vitesse compte plus que la profondeur. Dans le test ci-dessus, low a répondu correctement à chaque question et a affiché son premier texte en environ trois secondes, contre environ quatorze en medium.
Pourquoi GPT-6.1 Sol est-il si lent ?
Il raisonne avant de répondre, et le raisonnement n'est pas diffusé sous forme de texte. À partir de medium, cette phase silencieuse représente l'essentiel de l'attente. Baissez l'effort ou diffusez la réponse en streaming pour afficher du texte plus tôt.
xhigh est-il meilleur que high sur GPT-6.1 Sol ?
Seulement sur les tâches qui en ont besoin. Sur des tâches courtes, les deux niveaux ont donné les mêmes réponses, et xhigh a utilisé plus de tokens. Testez les deux sur votre propre travail avant de payer pour xhigh.
Peut-on désactiver le raisonnement de GPT-6.1 Sol ?
Non. GPT-6.1 Sol ne prend en charge ni none ni minimal. Si vous avez besoin de réponses sans raisonnement, GPT-6 Sol prend toujours en charge none. Voir le comparatif GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.



