Esforço de raciocínio do GPT-6.1 Sol: low, medium, high, xhigh ou max?
Qual esforço de raciocínio usar no GPT-6.1 Sol: tempos, tokens e custos reais em low, medium, high, xhigh e max, por que ele parece lento e por onde começar.
Ler em MarkdownComece o GPT-6.1 Sol em medium, o padrão, e use low quando quiser a resposta rápido. Suba o esforço para high, xhigh ou max só para tarefas que falham em medium: refatorações longas, depuração difícil, trabalho de agente em várias etapas. Nas tarefas curtas dos testes abaixo, todos os níveis de esforço deram a resposta certa, mas o max levou cerca de dez vezes mais tempo para mostrar a primeira palavra e usou de duas vezes e meia a cinco vezes os tokens do low.
Esse também é o principal motivo de o GPT-6.1 Sol parecer lento. Ele sempre raciocina antes de responder, e você espera por esse raciocínio antes do primeiro texto visível.
Quais esforços de raciocínio o GPT-6.1 Sol aceita?
Cinco: low, medium, high, xhigh e max. O padrão é medium. Segundo a página do modelo GPT-6.1 Sol da OpenAI, "os esforços de raciocínio none e minimal não são suportados", então, ao contrário do GPT-6 Sol, não há como desligar o raciocínio. Sem none, configurações de amostragem como temperature e top_p também não têm efeito.
Defina o esforço por requisição. Na Responses API, o campo é reasoning.effort:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)Na Chat Completions, o campo é reasoning_effort. Os tokens de raciocínio são contados em output_tokens, cobrados como saída e dividem o limite de max_output_tokens com a resposta.
Como os cinco esforços se comparam na prática?
O teste enviou ao GPT-6.1 Sol, pela SeedRouter, em 5 de outubro de 2026, três prompts com respostas conhecidas, uma vez por nível de esforço, com os cinco níveis ao mesmo tempo. Os tempos são segundos da requisição até a resposta completa. O custo segue os preços de tabela da OpenAI, $2 de entrada e $10 de saída por milhão de tokens, consultados em 5 de outubro de 2026.
Problema de contagem: quantos inteiros de 1 a 1000 são divisíveis por 3 ou 5, mas não por 7 (resposta: 401).
| Esforço | Segundos | Tokens de raciocínio | Tokens de saída | Custo | Correto |
|---|---|---|---|---|---|
low | 14,0 | 51 | 225 | $0,0023 | Sim |
medium | 13,4 | 46 | 187 | $0,0020 | Sim |
high | 14,6 | 134 | 272 | $0,0028 | Sim |
xhigh | 16,2 | 303 | 362 | $0,0037 | Sim |
max | 20,4 | 516 | 574 | $0,0058 | Sim |
Problema de contagem mais difícil: quantos inteiros de 1 a 99.999 são múltiplos de 7 e não contêm o dígito 7 (resposta: 8.434).
| Esforço | Segundos | Tokens de raciocínio | Tokens de saída | Custo | Correto |
|---|---|---|---|---|---|
low | 17,5 | 473 | 711 | $0,0072 | Sim |
medium | 27,6 | 1.031 | 1.273 | $0,0128 | Sim |
high | 28,3 | 1.034 | 1.255 | $0,0126 | Sim |
xhigh | 31,2 | 1.552 | 1.763 | $0,0177 | Sim |
max | 42,6 | 2.070 | 2.259 | $0,0227 | Sim |
Revisão de código: encontrar os bugs de uma função Python median de quatro linhas que ordena a entrada no próprio lugar e trata mal listas de tamanho par.
| Esforço | Segundos | Tokens de raciocínio | Tokens de saída | Custo | Achou os dois bugs |
|---|---|---|---|---|---|
low | 14,9 | 76 | 221 | $0,0023 | Sim, com uma versão corrigida |
medium | 15,4 | 91 | 194 | $0,0020 | Sim |
high | 19,5 | 296 | 396 | $0,0040 | Sim |
xhigh | 19,5 | 516 | 606 | $0,0061 | Sim |
max | 28,4 | 1.034 | 1.114 | $0,0112 | Sim |
São execuções únicas em tarefas curtas, então trate os números como uma noção de escala, não como benchmark. A contagem de tokens de raciocínio varia entre execuções, e é nas tarefas mais difíceis que um esforço maior compensa o custo.
Por que o GPT-6.1 Sol é lento?
A maior parte da espera é raciocínio, e o raciocínio vem primeiro. Um segundo teste fez streaming da mesma explicação de 300 palavras em três níveis de esforço e mediu quando chegou o primeiro texto visível:
| Esforço | Primeiro texto após | Tempo total | Tokens de raciocínio | Velocidade da resposta |
|---|---|---|---|---|
low | 3,0 s | 20,5 s | 56 | 25 tokens/s |
medium | 13,6 s | 24,7 s | 824 | 40 tokens/s |
max | 30,6 s | 43,5 s | 2.517 | 34 tokens/s |
Depois que a resposta começa, ela chega em ritmo parecido em todos os níveis. O que muda é a parte silenciosa antes dela: em max, o modelo passou meio minuto raciocinando antes de escrever qualquer coisa. Se os seus usuários ficam olhando para um indicador de carregamento, low com streaming é a configuração que parece mais rápida.
A OpenAI também anunciou o GPT-6.1 Sol Ultrafast, com "geração de tokens até 8x mais rápida em comparação com sua velocidade padrão no Codex", no seu post de lançamento.
xhigh ou max podem ser piores que medium?
Em uma tarefa específica, sim: esforço maior não garante uma resposta melhor. Nas execuções acima, o max nunca superou o low em acerto, só custou mais. Os próprios resultados da OpenAI apontam na mesma direção para o trabalho rotineiro: o GPT-6.1 Sol superou a melhor pontuação do GPT-6 Sol no DeepSWE "com um esforço de raciocínio menor", e o seu maior ganho de factualidade sobre o GPT-6 Sol veio com esforço low.
Onde o esforço maior compensa nos números da OpenAI é no trabalho longo e difícil: os resultados do GPT-6.1 Sol no OSWorld 2.0 e no Terminal-Bench Science foram informados com esforço máximo. A regra prática é medir nas suas próprias tarefas. Rode uma amostra em medium e em um nível acima, e mantenha o nível mais alto só onde ele corrige falhas.
Qual esforço você deve usar?
low: respostas de chat, classificação, extração, edições simples de código, qualquer coisa pela qual um usuário espera.medium: o padrão para ajuda com código, revisões e a maioria das etapas de agente.high: mudanças em vários arquivos e depuração que falha emmedium.xhigh: refatorações longas e planejamento ao longo de muitas etapas.max: os problemas mais difíceis, em que uma resposta errada custa mais que os tokens extras.
Para um agente inteiro, misture níveis: planeje com esforço maior e rode as etapas rotineiras de ferramentas em low ou medium. Os preços de cada nível estão na página do GPT-6.1 Sol, e o guia de preços do GPT-6.1 Sol explica como os tokens de raciocínio aparecem na fatura.
Perguntas frequentes
Qual é o esforço de raciocínio padrão do GPT-6.1 Sol?
medium. Se você omitir o campo, o GPT-6.1 Sol raciocina em medium.
Usar low ou medium no GPT-6.1 Sol?
Use medium como padrão e low onde a velocidade importa mais que a profundidade. No teste acima, o low respondeu certo a todas as perguntas e mostrou o primeiro texto em cerca de três segundos, contra cerca de catorze em medium.
Por que o GPT-6.1 Sol é tão lento?
Ele raciocina antes de responder, e o raciocínio não chega como texto no streaming. Em medium e acima, essa fase silenciosa ocupa a maior parte da espera. Baixe o esforço ou faça streaming da resposta para começar a mostrar texto mais cedo.
xhigh é melhor que high no GPT-6.1 Sol?
Só em tarefas que precisam disso. Em tarefas curtas, os dois níveis deram as mesmas respostas, e o xhigh usou mais tokens. Teste os dois no seu próprio trabalho antes de pagar pelo xhigh.
Dá para desligar o raciocínio do GPT-6.1 Sol?
Não. O GPT-6.1 Sol não aceita none nem minimal. Se você precisa de respostas sem raciocínio, o GPT-6 Sol ainda aceita none. Veja a comparação entre GPT-6.1 Sol, GPT-6 Astra e GPT-6 Sol.



