Sforzo di ragionamento di GPT-6.1 Sol: low, medium, high, xhigh o max?
Quale sforzo di ragionamento usare con GPT-6.1 Sol: tempi reali, token e costi con low, medium, high, xhigh e max, perché sembra lento e da dove partire.
Leggi in MarkdownParti con GPT-6.1 Sol a medium, il suo valore predefinito, e usa low quando vuoi la risposta in fretta. Alza lo sforzo a high, xhigh o max solo per le attività che falliscono con medium: lunghi refactoring, debug difficili, lavoro degli agenti in più passaggi. Sulle attività brevi dei test qui sotto ogni livello di sforzo ha dato la risposta giusta, ma max ha impiegato circa dieci volte tanto a mostrare la prima parola e ha usato da due volte e mezzo a cinque volte i token di low.
È anche il motivo principale per cui GPT-6.1 Sol sembra lento. Ragiona sempre prima di rispondere, e aspetti quel ragionamento prima del primo testo visibile.
Quali sforzi di ragionamento supporta GPT-6.1 Sol?
Cinque: low, medium, high, xhigh e max. Il valore predefinito è medium. Secondo la pagina del modello GPT-6.1 Sol di OpenAI, «gli sforzi di ragionamento none e minimal non sono supportati», quindi a differenza di GPT-6 Sol non c'è modo di disattivare il ragionamento. Senza none, nemmeno le impostazioni di campionamento come temperature e top_p hanno effetto.
Lo sforzo si imposta per ogni richiesta. Nella Responses API è reasoning.effort:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)In Chat Completions il campo è reasoning_effort. I token di ragionamento vengono contati in output_tokens, fatturati come output e condividono con la risposta il budget di max_output_tokens.
Come si confrontano i cinque sforzi nella pratica?
Il test ha inviato a GPT-6.1 Sol tramite SeedRouter, il 5 ottobre 2026, tre prompt con risposta nota, una volta per livello di sforzo, tutti e cinque i livelli in contemporanea. I tempi sono i secondi dalla richiesta alla risposta completa. Il costo è calcolato ai prezzi di listino di OpenAI di $2 di input e $10 di output per milione di token, verificati il 5 ottobre 2026.
Problema di conteggio — quanti interi da 1 a 1000 sono divisibili per 3 o per 5 ma non per 7 (risposta: 401).
| Sforzo | Secondi | Token di ragionamento | Token di output | Costo | Corretta |
|---|---|---|---|---|---|
low | 14,0 | 51 | 225 | $0,0023 | Sì |
medium | 13,4 | 46 | 187 | $0,0020 | Sì |
high | 14,6 | 134 | 272 | $0,0028 | Sì |
xhigh | 16,2 | 303 | 362 | $0,0037 | Sì |
max | 20,4 | 516 | 574 | $0,0058 | Sì |
Problema di conteggio più difficile — quanti interi da 1 a 99.999 sono multipli di 7 e non contengono la cifra 7 (risposta: 8.434).
| Sforzo | Secondi | Token di ragionamento | Token di output | Costo | Corretta |
|---|---|---|---|---|---|
low | 17,5 | 473 | 711 | $0,0072 | Sì |
medium | 27,6 | 1.031 | 1.273 | $0,0128 | Sì |
high | 28,3 | 1.034 | 1.255 | $0,0126 | Sì |
xhigh | 31,2 | 1.552 | 1.763 | $0,0177 | Sì |
max | 42,6 | 2.070 | 2.259 | $0,0227 | Sì |
Revisione del codice — trovare i bug in una funzione Python median di quattro righe che ordina l'input sul posto e gestisce male le liste di lunghezza pari.
| Sforzo | Secondi | Token di ragionamento | Token di output | Costo | Ha trovato entrambi i bug |
|---|---|---|---|---|---|
low | 14,9 | 76 | 221 | $0,0023 | Sì, con una versione corretta |
medium | 15,4 | 91 | 194 | $0,0020 | Sì |
high | 19,5 | 296 | 396 | $0,0040 | Sì |
xhigh | 19,5 | 516 | 606 | $0,0061 | Sì |
max | 28,4 | 1.034 | 1.114 | $0,0112 | Sì |
Sono singole esecuzioni su attività brevi, quindi prendile come un ordine di grandezza, non come un benchmark. Il numero di token di ragionamento varia da un'esecuzione all'altra, ed è sulle attività più difficili che uno sforzo più alto ripaga il suo costo.
Perché GPT-6.1 Sol è lento?
Gran parte dell'attesa è ragionamento, e il ragionamento viene prima. Un secondo test ha trasmesso in streaming la stessa spiegazione di 300 parole con tre livelli di sforzo e ha misurato quando arrivava il primo testo visibile:
| Sforzo | Primo testo dopo | Tempo totale | Token di ragionamento | Velocità della risposta |
|---|---|---|---|---|
low | 3,0 s | 20,5 s | 56 | 25 token/s |
medium | 13,6 s | 24,7 s | 824 | 40 token/s |
max | 30,6 s | 43,5 s | 2.517 | 34 token/s |
Una volta iniziata, la risposta arriva in streaming a un ritmo simile a ogni livello. Quello che cambia è la parte silenziosa che la precede: con max il modello ha passato mezzo minuto a ragionare prima di scrivere qualcosa. Se i tuoi utenti guardano un indicatore di caricamento, low con lo streaming è l'impostazione che sembra più veloce.
OpenAI ha anche annunciato GPT-6.1 Sol Ultrafast, con una «generazione dei token fino a 8 volte più veloce rispetto alla velocità standard in Codex», nel suo post di lancio.
xhigh o max possono andare peggio di medium?
Su una singola attività, sì: uno sforzo più alto non garantisce una risposta migliore. Nelle esecuzioni qui sopra, max non ha mai battuto low in correttezza, è solo costato di più. Anche i risultati di OpenAI vanno nella stessa direzione per il lavoro di routine: GPT-6.1 Sol ha superato il miglior punteggio DeepSWE di GPT-6 Sol «con uno sforzo di ragionamento più basso», e il suo maggiore guadagno di fattualità rispetto a GPT-6 Sol è arrivato con sforzo low.
Nei numeri di OpenAI uno sforzo più alto ripaga nel lavoro lungo e difficile: i risultati di GPT-6.1 Sol su OSWorld 2.0 e Terminal-Bench Science sono riportati con lo sforzo massimo. La regola pratica è misurare sulle tue attività. Esegui un campione con medium e con un livello più alto, e tieni il livello più alto solo dove corregge degli errori.
Quale sforzo usare?
low— risposte in chat, classificazione, estrazione, modifiche semplici al codice, qualsiasi cosa per cui un utente aspetta.medium— il valore predefinito per l'aiuto nel coding, le revisioni e la maggior parte dei passaggi degli agenti.high— modifiche su più file e debug che falliscono conmedium.xhigh— lunghi refactoring e pianificazione su molti passaggi.max— i problemi più difficili, dove una risposta sbagliata costa più dei token extra.
Per un agente intero, mescola i livelli: pianifica con uno sforzo più alto ed esegui i passaggi di routine con gli strumenti a low o medium. I prezzi di ogni livello sono nella pagina di GPT-6.1 Sol, e la guida ai prezzi di GPT-6.1 Sol spiega come compaiono i token di ragionamento nel conto.
Domande frequenti
Qual è lo sforzo di ragionamento predefinito di GPT-6.1 Sol?
medium. Se ometti il campo, GPT-6.1 Sol ragiona con medium.
Meglio low o medium con GPT-6.1 Sol?
Usa medium come predefinito e low dove la velocità conta più della profondità. Nel test qui sopra, low ha risposto correttamente a ogni domanda e ha mostrato il primo testo in circa tre secondi, contro circa quattordici con medium.
Perché GPT-6.1 Sol è così lento?
Ragiona prima di rispondere, e il ragionamento non viene trasmesso come testo. Da medium in su, quella fase silenziosa occupa la maggior parte dell'attesa. Abbassa lo sforzo o usa lo streaming per iniziare a mostrare testo prima.
xhigh è meglio di high su GPT-6.1 Sol?
Solo nelle attività che lo richiedono. Sulle attività brevi i due livelli hanno dato le stesse risposte, e xhigh ha usato più token. Prova entrambi sul tuo lavoro prima di pagare per xhigh.
Si può disattivare il ragionamento in GPT-6.1 Sol?
No. GPT-6.1 Sol non supporta none né minimal. Se ti servono risposte senza ragionamento, GPT-6 Sol supporta ancora none. Vedi il confronto GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.



