Claude Opus 5.5 è disponibile su SeedRouter

Sforzo di ragionamento di GPT-6.1 Sol: low, medium, high, xhigh o max?

Quale sforzo di ragionamento usare con GPT-6.1 Sol: tempi reali, token e costi con low, medium, high, xhigh e max, perché sembra lento e da dove partire.

Leggi in Markdown

Parti con GPT-6.1 Sol a medium, il suo valore predefinito, e usa low quando vuoi la risposta in fretta. Alza lo sforzo a high, xhigh o max solo per le attività che falliscono con medium: lunghi refactoring, debug difficili, lavoro degli agenti in più passaggi. Sulle attività brevi dei test qui sotto ogni livello di sforzo ha dato la risposta giusta, ma max ha impiegato circa dieci volte tanto a mostrare la prima parola e ha usato da due volte e mezzo a cinque volte i token di low.

È anche il motivo principale per cui GPT-6.1 Sol sembra lento. Ragiona sempre prima di rispondere, e aspetti quel ragionamento prima del primo testo visibile.

Quali sforzi di ragionamento supporta GPT-6.1 Sol?

Cinque: low, medium, high, xhigh e max. Il valore predefinito è medium. Secondo la pagina del modello GPT-6.1 Sol di OpenAI, «gli sforzi di ragionamento none e minimal non sono supportati», quindi a differenza di GPT-6 Sol non c'è modo di disattivare il ragionamento. Senza none, nemmeno le impostazioni di campionamento come temperature e top_p hanno effetto.

Lo sforzo si imposta per ogni richiesta. Nella Responses API è reasoning.effort:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

In Chat Completions il campo è reasoning_effort. I token di ragionamento vengono contati in output_tokens, fatturati come output e condividono con la risposta il budget di max_output_tokens.

Come si confrontano i cinque sforzi nella pratica?

Il test ha inviato a GPT-6.1 Sol tramite SeedRouter, il 5 ottobre 2026, tre prompt con risposta nota, una volta per livello di sforzo, tutti e cinque i livelli in contemporanea. I tempi sono i secondi dalla richiesta alla risposta completa. Il costo è calcolato ai prezzi di listino di OpenAI di $2 di input e $10 di output per milione di token, verificati il 5 ottobre 2026.

Problema di conteggio — quanti interi da 1 a 1000 sono divisibili per 3 o per 5 ma non per 7 (risposta: 401).

SforzoSecondiToken di ragionamentoToken di outputCostoCorretta
low14,051225$0,0023Sì
medium13,446187$0,0020Sì
high14,6134272$0,0028Sì
xhigh16,2303362$0,0037Sì
max20,4516574$0,0058Sì

Problema di conteggio più difficile — quanti interi da 1 a 99.999 sono multipli di 7 e non contengono la cifra 7 (risposta: 8.434).

SforzoSecondiToken di ragionamentoToken di outputCostoCorretta
low17,5473711$0,0072Sì
medium27,61.0311.273$0,0128Sì
high28,31.0341.255$0,0126Sì
xhigh31,21.5521.763$0,0177Sì
max42,62.0702.259$0,0227Sì

Revisione del codice — trovare i bug in una funzione Python median di quattro righe che ordina l'input sul posto e gestisce male le liste di lunghezza pari.

SforzoSecondiToken di ragionamentoToken di outputCostoHa trovato entrambi i bug
low14,976221$0,0023Sì, con una versione corretta
medium15,491194$0,0020Sì
high19,5296396$0,0040Sì
xhigh19,5516606$0,0061Sì
max28,41.0341.114$0,0112Sì

Sono singole esecuzioni su attività brevi, quindi prendile come un ordine di grandezza, non come un benchmark. Il numero di token di ragionamento varia da un'esecuzione all'altra, ed è sulle attività più difficili che uno sforzo più alto ripaga il suo costo.

Perché GPT-6.1 Sol è lento?

Gran parte dell'attesa è ragionamento, e il ragionamento viene prima. Un secondo test ha trasmesso in streaming la stessa spiegazione di 300 parole con tre livelli di sforzo e ha misurato quando arrivava il primo testo visibile:

SforzoPrimo testo dopoTempo totaleToken di ragionamentoVelocità della risposta
low3,0 s20,5 s5625 token/s
medium13,6 s24,7 s82440 token/s
max30,6 s43,5 s2.51734 token/s

Una volta iniziata, la risposta arriva in streaming a un ritmo simile a ogni livello. Quello che cambia è la parte silenziosa che la precede: con max il modello ha passato mezzo minuto a ragionare prima di scrivere qualcosa. Se i tuoi utenti guardano un indicatore di caricamento, low con lo streaming è l'impostazione che sembra più veloce.

OpenAI ha anche annunciato GPT-6.1 Sol Ultrafast, con una «generazione dei token fino a 8 volte più veloce rispetto alla velocità standard in Codex», nel suo post di lancio.

xhigh o max possono andare peggio di medium?

Su una singola attività, sì: uno sforzo più alto non garantisce una risposta migliore. Nelle esecuzioni qui sopra, max non ha mai battuto low in correttezza, è solo costato di più. Anche i risultati di OpenAI vanno nella stessa direzione per il lavoro di routine: GPT-6.1 Sol ha superato il miglior punteggio DeepSWE di GPT-6 Sol «con uno sforzo di ragionamento più basso», e il suo maggiore guadagno di fattualità rispetto a GPT-6 Sol è arrivato con sforzo low.

Nei numeri di OpenAI uno sforzo più alto ripaga nel lavoro lungo e difficile: i risultati di GPT-6.1 Sol su OSWorld 2.0 e Terminal-Bench Science sono riportati con lo sforzo massimo. La regola pratica è misurare sulle tue attività. Esegui un campione con medium e con un livello più alto, e tieni il livello più alto solo dove corregge degli errori.

Quale sforzo usare?

  • low — risposte in chat, classificazione, estrazione, modifiche semplici al codice, qualsiasi cosa per cui un utente aspetta.
  • medium — il valore predefinito per l'aiuto nel coding, le revisioni e la maggior parte dei passaggi degli agenti.
  • high — modifiche su più file e debug che falliscono con medium.
  • xhigh — lunghi refactoring e pianificazione su molti passaggi.
  • max — i problemi più difficili, dove una risposta sbagliata costa più dei token extra.

Per un agente intero, mescola i livelli: pianifica con uno sforzo più alto ed esegui i passaggi di routine con gli strumenti a low o medium. I prezzi di ogni livello sono nella pagina di GPT-6.1 Sol, e la guida ai prezzi di GPT-6.1 Sol spiega come compaiono i token di ragionamento nel conto.

Domande frequenti

Qual è lo sforzo di ragionamento predefinito di GPT-6.1 Sol?

medium. Se ometti il campo, GPT-6.1 Sol ragiona con medium.

Meglio low o medium con GPT-6.1 Sol?

Usa medium come predefinito e low dove la velocità conta più della profondità. Nel test qui sopra, low ha risposto correttamente a ogni domanda e ha mostrato il primo testo in circa tre secondi, contro circa quattordici con medium.

Perché GPT-6.1 Sol è così lento?

Ragiona prima di rispondere, e il ragionamento non viene trasmesso come testo. Da medium in su, quella fase silenziosa occupa la maggior parte dell'attesa. Abbassa lo sforzo o usa lo streaming per iniziare a mostrare testo prima.

xhigh è meglio di high su GPT-6.1 Sol?

Solo nelle attività che lo richiedono. Sulle attività brevi i due livelli hanno dato le stesse risposte, e xhigh ha usato più token. Prova entrambi sul tuo lavoro prima di pagare per xhigh.

Si può disattivare il ragionamento in GPT-6.1 Sol?

No. GPT-6.1 Sol non supporta none né minimal. Se ti servono risposte senza ragionamento, GPT-6 Sol supporta ancora none. Vedi il confronto GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.

Guide correlate