Claude Opus 5.5 já está disponível no SeedRouter

Esforço de raciocínio do GPT-6.1 Sol: low, medium, high, xhigh ou max?

Qual esforço de raciocínio usar no GPT-6.1 Sol: tempos, tokens e custos reais em low, medium, high, xhigh e max, por que ele parece lento e por onde começar.

Ler em Markdown

Comece o GPT-6.1 Sol em medium, o padrão, e use low quando quiser a resposta rápido. Suba o esforço para high, xhigh ou max só para tarefas que falham em medium: refatorações longas, depuração difícil, trabalho de agente em várias etapas. Nas tarefas curtas dos testes abaixo, todos os níveis de esforço deram a resposta certa, mas o max levou cerca de dez vezes mais tempo para mostrar a primeira palavra e usou de duas vezes e meia a cinco vezes os tokens do low.

Esse também é o principal motivo de o GPT-6.1 Sol parecer lento. Ele sempre raciocina antes de responder, e você espera por esse raciocínio antes do primeiro texto visível.

Quais esforços de raciocínio o GPT-6.1 Sol aceita?

Cinco: low, medium, high, xhigh e max. O padrão é medium. Segundo a página do modelo GPT-6.1 Sol da OpenAI, "os esforços de raciocínio none e minimal não são suportados", então, ao contrário do GPT-6 Sol, não há como desligar o raciocínio. Sem none, configurações de amostragem como temperature e top_p também não têm efeito.

Defina o esforço por requisição. Na Responses API, o campo é reasoning.effort:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

Na Chat Completions, o campo é reasoning_effort. Os tokens de raciocínio são contados em output_tokens, cobrados como saída e dividem o limite de max_output_tokens com a resposta.

Como os cinco esforços se comparam na prática?

O teste enviou ao GPT-6.1 Sol, pela SeedRouter, em 5 de outubro de 2026, três prompts com respostas conhecidas, uma vez por nível de esforço, com os cinco níveis ao mesmo tempo. Os tempos são segundos da requisição até a resposta completa. O custo segue os preços de tabela da OpenAI, $2 de entrada e $10 de saída por milhão de tokens, consultados em 5 de outubro de 2026.

Problema de contagem: quantos inteiros de 1 a 1000 são divisíveis por 3 ou 5, mas não por 7 (resposta: 401).

EsforçoSegundosTokens de raciocínioTokens de saídaCustoCorreto
low14,051225$0,0023Sim
medium13,446187$0,0020Sim
high14,6134272$0,0028Sim
xhigh16,2303362$0,0037Sim
max20,4516574$0,0058Sim

Problema de contagem mais difícil: quantos inteiros de 1 a 99.999 são múltiplos de 7 e não contêm o dígito 7 (resposta: 8.434).

EsforçoSegundosTokens de raciocínioTokens de saídaCustoCorreto
low17,5473711$0,0072Sim
medium27,61.0311.273$0,0128Sim
high28,31.0341.255$0,0126Sim
xhigh31,21.5521.763$0,0177Sim
max42,62.0702.259$0,0227Sim

Revisão de código: encontrar os bugs de uma função Python median de quatro linhas que ordena a entrada no próprio lugar e trata mal listas de tamanho par.

EsforçoSegundosTokens de raciocínioTokens de saídaCustoAchou os dois bugs
low14,976221$0,0023Sim, com uma versão corrigida
medium15,491194$0,0020Sim
high19,5296396$0,0040Sim
xhigh19,5516606$0,0061Sim
max28,41.0341.114$0,0112Sim

São execuções únicas em tarefas curtas, então trate os números como uma noção de escala, não como benchmark. A contagem de tokens de raciocínio varia entre execuções, e é nas tarefas mais difíceis que um esforço maior compensa o custo.

Por que o GPT-6.1 Sol é lento?

A maior parte da espera é raciocínio, e o raciocínio vem primeiro. Um segundo teste fez streaming da mesma explicação de 300 palavras em três níveis de esforço e mediu quando chegou o primeiro texto visível:

EsforçoPrimeiro texto apósTempo totalTokens de raciocínioVelocidade da resposta
low3,0 s20,5 s5625 tokens/s
medium13,6 s24,7 s82440 tokens/s
max30,6 s43,5 s2.51734 tokens/s

Depois que a resposta começa, ela chega em ritmo parecido em todos os níveis. O que muda é a parte silenciosa antes dela: em max, o modelo passou meio minuto raciocinando antes de escrever qualquer coisa. Se os seus usuários ficam olhando para um indicador de carregamento, low com streaming é a configuração que parece mais rápida.

A OpenAI também anunciou o GPT-6.1 Sol Ultrafast, com "geração de tokens até 8x mais rápida em comparação com sua velocidade padrão no Codex", no seu post de lançamento.

xhigh ou max podem ser piores que medium?

Em uma tarefa específica, sim: esforço maior não garante uma resposta melhor. Nas execuções acima, o max nunca superou o low em acerto, só custou mais. Os próprios resultados da OpenAI apontam na mesma direção para o trabalho rotineiro: o GPT-6.1 Sol superou a melhor pontuação do GPT-6 Sol no DeepSWE "com um esforço de raciocínio menor", e o seu maior ganho de factualidade sobre o GPT-6 Sol veio com esforço low.

Onde o esforço maior compensa nos números da OpenAI é no trabalho longo e difícil: os resultados do GPT-6.1 Sol no OSWorld 2.0 e no Terminal-Bench Science foram informados com esforço máximo. A regra prática é medir nas suas próprias tarefas. Rode uma amostra em medium e em um nível acima, e mantenha o nível mais alto só onde ele corrige falhas.

Qual esforço você deve usar?

  • low: respostas de chat, classificação, extração, edições simples de código, qualquer coisa pela qual um usuário espera.
  • medium: o padrão para ajuda com código, revisões e a maioria das etapas de agente.
  • high: mudanças em vários arquivos e depuração que falha em medium.
  • xhigh: refatorações longas e planejamento ao longo de muitas etapas.
  • max: os problemas mais difíceis, em que uma resposta errada custa mais que os tokens extras.

Para um agente inteiro, misture níveis: planeje com esforço maior e rode as etapas rotineiras de ferramentas em low ou medium. Os preços de cada nível estão na página do GPT-6.1 Sol, e o guia de preços do GPT-6.1 Sol explica como os tokens de raciocínio aparecem na fatura.

Perguntas frequentes

Qual é o esforço de raciocínio padrão do GPT-6.1 Sol?

medium. Se você omitir o campo, o GPT-6.1 Sol raciocina em medium.

Usar low ou medium no GPT-6.1 Sol?

Use medium como padrão e low onde a velocidade importa mais que a profundidade. No teste acima, o low respondeu certo a todas as perguntas e mostrou o primeiro texto em cerca de três segundos, contra cerca de catorze em medium.

Por que o GPT-6.1 Sol é tão lento?

Ele raciocina antes de responder, e o raciocínio não chega como texto no streaming. Em medium e acima, essa fase silenciosa ocupa a maior parte da espera. Baixe o esforço ou faça streaming da resposta para começar a mostrar texto mais cedo.

xhigh é melhor que high no GPT-6.1 Sol?

Só em tarefas que precisam disso. Em tarefas curtas, os dois níveis deram as mesmas respostas, e o xhigh usou mais tokens. Teste os dois no seu próprio trabalho antes de pagar pelo xhigh.

Dá para desligar o raciocínio do GPT-6.1 Sol?

Não. O GPT-6.1 Sol não aceita none nem minimal. Se você precisa de respostas sem raciocínio, o GPT-6 Sol ainda aceita none. Veja a comparação entre GPT-6.1 Sol, GPT-6 Astra e GPT-6 Sol.

Guias relacionados