GPT-6.1 Sol 추론 강도: low, medium, high, xhigh, max 중 무엇을 쓸까
GPT-6.1 Sol 추론 강도 선택법: low, medium, high, xhigh, max의 실제 응답 시간, 토큰 수, 비용, 느리게 느껴지는 이유, 어디서 시작할지 정리했습니다.
Markdown으로 읽기GPT-6.1 Sol은 기본값인 medium에서 시작하고, 답을 빨리 받고 싶을 때는 low를 쓰세요. high, xhigh, max로 추론 강도를 올리는 것은 medium에서 실패하는 작업, 즉 긴 리팩터링, 어려운 디버깅, 여러 단계의 에이전트 작업에만 하세요. 아래 테스트의 짧은 작업에서는 모든 추론 강도가 정답을 냈지만, max는 첫 단어가 나오기까지 약 10배 오래 걸렸고 low보다 2.5~5배의 토큰을 썼습니다.
GPT-6.1 Sol이 느리게 느껴지는 주된 이유도 이것입니다. 답하기 전에 항상 추론하므로, 처음 보이는 텍스트가 나오기 전에 그 추론을 기다려야 합니다.
GPT-6.1 Sol은 어떤 추론 강도를 지원하나요?
다섯 가지입니다: low, medium, high, xhigh, max. 기본값은 medium입니다. OpenAI의 GPT-6.1 Sol 모델 페이지에 따르면 "none과 minimal 추론 강도는 지원되지 않으므로", GPT-6 Sol과 달리 추론을 끌 방법이 없습니다. none이 없으니 temperature, top_p 같은 샘플링 설정도 효과가 없습니다.
추론 강도는 요청마다 설정합니다. Responses API에서는 reasoning.effort입니다:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)Chat Completions에서는 reasoning_effort 필드입니다. 추론 토큰은 output_tokens에 포함되어 출력으로 과금되며, 답변과 함께 max_output_tokens 예산을 나눠 씁니다.
다섯 가지 추론 강도는 실제로 어떻게 다른가요?
2026년 10월 5일, 정답이 알려진 프롬프트 세 개를 SeedRouter를 통해 GPT-6.1 Sol에 추론 강도마다 한 번씩, 다섯 레벨을 동시에 보냈습니다. 시간은 요청부터 답변 완료까지의 초 단위입니다. 비용은 2026년 10월 5일에 확인한 OpenAI 정가, 100만 토큰당 입력 $2, 출력 $10 기준입니다.
경우의 수 문제 — 1부터 1000까지의 정수 중 3 또는 5로 나누어떨어지지만 7로는 나누어떨어지지 않는 수는 몇 개인가(정답: 401).
| 추론 강도 | 초 | 추론 토큰 | 출력 토큰 | 비용 | 정답 여부 |
|---|---|---|---|---|---|
low | 14.0 | 51 | 225 | $0.0023 | 예 |
medium | 13.4 | 46 | 187 | $0.0020 | 예 |
high | 14.6 | 134 | 272 | $0.0028 | 예 |
xhigh | 16.2 | 303 | 362 | $0.0037 | 예 |
max | 20.4 | 516 | 574 | $0.0058 | 예 |
더 어려운 경우의 수 문제 — 1부터 99,999까지의 정수 중 7의 배수이면서 숫자 7을 포함하지 않는 수는 몇 개인가(정답: 8,434).
| 추론 강도 | 초 | 추론 토큰 | 출력 토큰 | 비용 | 정답 여부 |
|---|---|---|---|---|---|
low | 17.5 | 473 | 711 | $0.0072 | 예 |
medium | 27.6 | 1,031 | 1,273 | $0.0128 | 예 |
high | 28.3 | 1,034 | 1,255 | $0.0126 | 예 |
xhigh | 31.2 | 1,552 | 1,763 | $0.0177 | 예 |
max | 42.6 | 2,070 | 2,259 | $0.0227 | 예 |
코드 리뷰 — 입력을 제자리에서 정렬하고 짝수 길이 리스트를 잘못 처리하는 4줄짜리 Python median 함수의 버그 찾기.
| 추론 강도 | 초 | 추론 토큰 | 출력 토큰 | 비용 | 버그 두 개 모두 발견 |
|---|---|---|---|---|---|
low | 14.9 | 76 | 221 | $0.0023 | 예, 수정 버전 포함 |
medium | 15.4 | 91 | 194 | $0.0020 | 예 |
high | 19.5 | 296 | 396 | $0.0040 | 예 |
xhigh | 19.5 | 516 | 606 | $0.0061 | 예 |
max | 28.4 | 1,034 | 1,114 | $0.0112 | 예 |
짧은 작업을 한 번씩 실행한 결과이므로 벤치마크가 아니라 규모 감각으로 보세요. 추론 토큰 수는 실행할 때마다 달라지며, 더 높은 추론 강도가 비용값을 하는 것은 더 어려운 작업입니다.
GPT-6.1 Sol은 왜 느린가요?
기다리는 시간의 대부분은 추론이고, 추론이 먼저 옵니다. 두 번째 테스트에서는 같은 300단어 설명을 세 가지 추론 강도로 스트리밍하고, 처음 보이는 텍스트가 도착한 시점을 측정했습니다:
| 추론 강도 | 첫 텍스트까지 | 전체 시간 | 추론 토큰 | 답변 속도 |
|---|---|---|---|---|
low | 3.0초 | 20.5초 | 56 | 25 토큰/초 |
medium | 13.6초 | 24.7초 | 824 | 40 토큰/초 |
max | 30.6초 | 43.5초 | 2,517 | 34 토큰/초 |
답변이 시작되면 어떤 레벨에서든 비슷한 속도로 스트리밍됩니다. 달라지는 것은 그 앞의 조용한 구간입니다. max에서는 모델이 아무것도 쓰기 전에 30초가량 추론했습니다. 사용자가 로딩 표시를 보고 기다린다면, 스트리밍과 함께 쓰는 low가 가장 빠르게 느껴지는 설정입니다.
OpenAI는 출시 발표에서 "Codex에서 표준 속도 대비 최대 8배 빠른 토큰 생성"을 제공하는 GPT-6.1 Sol Ultrafast도 발표했습니다.
xhigh나 max가 medium보다 나쁠 수도 있나요?
특정 작업에서는 그렇습니다. 추론 강도가 높다고 더 나은 답이 보장되지는 않습니다. 위의 실행에서 max는 정확도에서 low를 한 번도 이기지 못했고, 비용만 더 들었습니다. 일상적인 작업에 대해서는 OpenAI 자체 결과도 같은 방향을 가리킵니다. GPT-6.1 Sol은 "더 낮은 추론 강도로" GPT-6 Sol의 DeepSWE 최고점을 넘었고, GPT-6 Sol 대비 사실성 향상이 가장 컸던 것은 low 추론 강도에서였습니다.
OpenAI 수치에서 높은 추론 강도가 효과를 보는 곳은 길고 어려운 작업입니다. GPT-6.1 Sol의 OSWorld 2.0과 Terminal-Bench Science 결과는 최대 추론 강도에서 보고되었습니다. 실무 원칙은 자신의 작업으로 측정하는 것입니다. 샘플을 medium과 한 단계 높은 레벨로 실행해 보고, 실패를 고쳐 주는 곳에서만 높은 레벨을 유지하세요.
어떤 추론 강도를 써야 하나요?
low— 채팅 답변, 분류, 추출, 간단한 코드 수정 등 사용자가 기다리는 모든 작업.medium— 코딩 도움, 리뷰, 대부분의 에이전트 단계의 기본값.high— 여러 파일에 걸친 변경,medium에서 실패하는 디버깅.xhigh— 긴 리팩터링과 여러 단계에 걸친 계획.max— 틀린 답의 대가가 추가 토큰보다 큰, 가장 어려운 문제.
에이전트 전체로는 레벨을 섞어 쓰세요. 계획은 높은 추론 강도로, 일상적인 도구 단계는 low나 medium으로 실행합니다. 모든 레벨의 가격은 GPT-6.1 Sol 페이지에 있고, GPT-6.1 Sol 요금 가이드에서 추론 토큰이 청구서에 어떻게 나타나는지 설명합니다.
자주 묻는 질문
GPT-6.1 Sol의 기본 추론 강도는 무엇인가요?
medium입니다. 필드를 생략하면 GPT-6.1 Sol은 medium으로 추론합니다.
GPT-6.1 Sol은 low와 medium 중 무엇을 써야 하나요?
기본값으로는 medium을, 깊이보다 속도가 중요한 곳에는 low를 쓰세요. 위 테스트에서 low는 모든 질문에 정답을 냈고, 첫 텍스트를 약 3초 만에 보여 줬습니다. medium은 약 14초였습니다.
GPT-6.1 Sol은 왜 이렇게 느린가요?
답하기 전에 추론하며, 그 추론은 텍스트로 스트리밍되지 않습니다. medium 이상에서는 이 조용한 구간이 대기 시간의 대부분을 차지합니다. 추론 강도를 낮추거나 응답을 스트리밍하면 텍스트를 더 빨리 보여 줄 수 있습니다.
GPT-6.1 Sol에서 xhigh가 high보다 좋은가요?
필요한 작업에서만 그렇습니다. 짧은 작업에서는 두 레벨이 같은 답을 냈고, xhigh가 토큰을 더 많이 썼습니다. xhigh에 비용을 쓰기 전에 자신의 작업으로 둘 다 테스트하세요.
GPT-6.1 Sol에서 추론을 끌 수 있나요?
아니요. GPT-6.1 Sol은 none과 minimal을 지원하지 않습니다. 추론 없는 답변이 필요하다면 GPT-6 Sol은 여전히 none을 지원합니다. GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol 비교를 참고하세요.



