Claude Opus 5.5 ya está disponible en SeedRouter

Esfuerzo de razonamiento de GPT-6.1 Sol: ¿low, medium, high, xhigh o max?

Qué esfuerzo de razonamiento usar en GPT-6.1 Sol: tiempos, tokens y costes reales con low, medium, high, xhigh y max, por qué parece lento y por dónde empezar.

Leer en Markdown

Empieza GPT-6.1 Sol en medium, su valor predeterminado, y usa low cuando quieras la respuesta rápido. Sube el esfuerzo a high, xhigh o max solo para las tareas que fallen en medium: refactorizaciones largas, depuración difícil, trabajo de agentes en varios pasos. En las tareas cortas de las pruebas de abajo, todos los niveles de esfuerzo dieron la respuesta correcta, pero max tardó unas diez veces más en mostrar su primera palabra y usó entre dos veces y media y cinco veces los tokens de low.

Esa es también la principal razón por la que GPT-6.1 Sol parece lento. Siempre razona antes de responder, y tienes que esperar a ese razonamiento antes de ver el primer texto.

¿Qué niveles de esfuerzo de razonamiento admite GPT-6.1 Sol?

Cinco: low, medium, high, xhigh y max. El predeterminado es medium. Según la página de modelo de GPT-6.1 Sol de OpenAI, «los esfuerzos de razonamiento none y minimal no son compatibles», así que, a diferencia de GPT-6 Sol, no hay forma de desactivar el razonamiento. Sin none, los parámetros de muestreo como temperature y top_p tampoco tienen ningún efecto.

El esfuerzo se fija en cada solicitud. En la Responses API es reasoning.effort:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

En Chat Completions el campo es reasoning_effort. Los tokens de razonamiento se cuentan en output_tokens, se facturan como salida y comparten con la respuesta el presupuesto de max_output_tokens.

¿Cómo se comparan los cinco niveles en la práctica?

La prueba envió a GPT-6.1 Sol, a través de SeedRouter, tres prompts con respuesta conocida el 5 de octubre de 2026, una vez por nivel de esfuerzo y los cinco niveles a la vez. Los tiempos son los segundos desde la solicitud hasta la respuesta completa. El coste está calculado a los precios de lista de OpenAI de $2 de entrada y $10 de salida por millón de tokens, consultados el 5 de octubre de 2026.

Problema de conteo: cuántos enteros del 1 al 1000 son divisibles por 3 o por 5 pero no por 7 (respuesta: 401).

EsfuerzoSegundosTokens de razonamientoTokens de salidaCosteCorrecto
low14,051225$0,0023Sí
medium13,446187$0,0020Sí
high14,6134272$0,0028Sí
xhigh16,2303362$0,0037Sí
max20,4516574$0,0058Sí

Problema de conteo más difícil: cuántos enteros del 1 al 99.999 son múltiplos de 7 y no contienen el dígito 7 (respuesta: 8.434).

EsfuerzoSegundosTokens de razonamientoTokens de salidaCosteCorrecto
low17,5473711$0,0072Sí
medium27,61.0311.273$0,0128Sí
high28,31.0341.255$0,0126Sí
xhigh31,21.5521.763$0,0177Sí
max42,62.0702.259$0,0227Sí

Revisión de código: encontrar los errores en una función median de Python de cuatro líneas que ordena su entrada en el sitio y gestiona mal las listas de longitud par.

EsfuerzoSegundosTokens de razonamientoTokens de salidaCosteEncontró los dos errores
low14,976221$0,0023Sí, con una versión corregida
medium15,491194$0,0020Sí
high19,5296396$0,0040Sí
xhigh19,5516606$0,0061Sí
max28,41.0341.114$0,0112Sí

Son ejecuciones únicas en tareas cortas, así que tómalas como una idea de la escala, no como un benchmark. El número de tokens de razonamiento varía entre ejecuciones, y es en las tareas más difíciles donde un esfuerzo mayor justifica su coste.

¿Por qué GPT-6.1 Sol es lento?

La mayor parte de la espera es razonamiento, y el razonamiento va primero. Una segunda prueba transmitió en streaming la misma explicación de 300 palabras con tres niveles de esfuerzo y midió cuándo llegaba el primer texto visible:

EsfuerzoPrimer texto trasTiempo totalTokens de razonamientoVelocidad de respuesta
low3,0 s20,5 s5625 tokens/s
medium13,6 s24,7 s82440 tokens/s
max30,6 s43,5 s2.51734 tokens/s

Una vez que empieza la respuesta, se transmite a un ritmo parecido en todos los niveles. Lo que cambia es la parte silenciosa previa: con max, el modelo pasó medio minuto razonando antes de escribir nada. Si tus usuarios miran un indicador de carga, low con streaming es el ajuste que parece más rápido.

OpenAI también ha anunciado GPT-6.1 Sol Ultrafast, con una «generación de tokens hasta 8 veces más rápida que su velocidad estándar en Codex», en su publicación de lanzamiento.

¿Puede xhigh o max ser peor que medium?

En una tarea concreta, sí: un esfuerzo mayor no garantiza una respuesta mejor. En las ejecuciones de arriba, max nunca superó a low en acierto; solo costó más. Los propios resultados de OpenAI apuntan en la misma dirección para el trabajo rutinario: GPT-6.1 Sol superó la mejor puntuación de GPT-6 Sol en DeepSWE «con un esfuerzo de razonamiento menor», y su mayor mejora en factualidad frente a GPT-6 Sol llegó con esfuerzo low.

Donde un esfuerzo mayor compensa en las cifras de OpenAI es en el trabajo largo y difícil: sus resultados de OSWorld 2.0 y Terminal-Bench Science para GPT-6.1 Sol se publican con el esfuerzo máximo. La regla práctica es medir en tus propias tareas. Ejecuta una muestra en medium y en un nivel por encima, y quédate con el nivel más alto solo donde corrija fallos.

¿Qué esfuerzo deberías usar?

  • low: respuestas de chat, clasificación, extracción, ediciones de código sencillas, cualquier cosa que un usuario esté esperando.
  • medium: el predeterminado para ayuda con código, revisiones y la mayoría de los pasos de agentes.
  • high: cambios en varios archivos y depuración que falla en medium.
  • xhigh: refactorizaciones largas y planificación a lo largo de muchos pasos.
  • max: los problemas más difíciles, en los que una respuesta incorrecta cuesta más que los tokens adicionales.

Para un agente completo, combina niveles: planifica con un esfuerzo mayor y ejecuta los pasos rutinarios de herramientas en low o medium. Los precios de cada nivel están en la página de GPT-6.1 Sol, y la guía de precios de GPT-6.1 Sol explica cómo aparecen los tokens de razonamiento en la factura.

Preguntas frecuentes

¿Cuál es el esfuerzo de razonamiento predeterminado de GPT-6.1 Sol?

medium. Si omites el campo, GPT-6.1 Sol razona en medium.

¿Uso low o medium en GPT-6.1 Sol?

Usa medium como predeterminado y low donde la velocidad importe más que la profundidad. En la prueba de arriba, low respondió correctamente a todas las preguntas y mostró su primer texto en unos tres segundos, frente a unos catorce en medium.

¿Por qué GPT-6.1 Sol es tan lento?

Razona antes de responder, y el razonamiento no se transmite como texto. En medium y por encima, esa fase silenciosa ocupa la mayor parte de la espera. Baja el esfuerzo o usa streaming para empezar a mostrar texto antes.

¿Es mejor xhigh que high en GPT-6.1 Sol?

Solo en las tareas que lo necesitan. En tareas cortas, ambos niveles dieron las mismas respuestas, y xhigh usó más tokens. Prueba los dos con tu propio trabajo antes de pagar por xhigh.

¿Se puede desactivar el razonamiento en GPT-6.1 Sol?

No. GPT-6.1 Sol no admite none ni minimal. Si necesitas respuestas sin razonamiento, GPT-6 Sol sigue admitiendo none. Consulta la comparativa GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol.

Guías relacionadas