GPT-6.1 Sol の推論強度:low・medium・high・xhigh・max のどれを使う?
GPT-6.1 Sol の推論強度はどれを使うべき?low、medium、high、xhigh、max の実測時間、トークン数、コスト、遅く感じる理由と始め方を解説。
Markdown で読むGPT-6.1 Sol はデフォルトの medium から始め、すぐに回答がほしいときは low を使ってください。推論強度を high、xhigh、max に上げるのは、長いリファクタリング、難しいデバッグ、マルチステップのエージェント作業など、medium で失敗するタスクだけにしましょう。下のテストの短いタスクではどの推論強度でも正解しましたが、max は最初の 1 語が表示されるまでに約 10 倍の時間がかかり、low の 2.5〜5 倍のトークンを使いました。
GPT-6.1 Sol が遅く感じる主な理由もこれです。回答の前に必ず推論するため、最初のテキストが表示されるまでその推論を待つことになります。
GPT-6.1 Sol が対応する推論強度は?
low、medium、high、xhigh、max の 5 つです。デフォルトは medium です。OpenAI の GPT-6.1 Sol のモデルページには「推論強度 none と minimal には対応していません」とあり、GPT-6 Sol と違って推論をオフにする方法はありません。none がないため、temperature や top_p などのサンプリング設定も効果がありません。
推論強度はリクエストごとに設定します。Responses API では reasoning.effort です。
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)Chat Completions ではフィールド名が reasoning_effort です。推論トークンは output_tokens に含まれ、出力として課金され、回答と max_output_tokens の予算を共有します。
5 つの推論強度を実際に比べると?
2026 年 10 月 5 日に、答えがわかっている 3 つのプロンプトを SeedRouter 経由で GPT-6.1 Sol に送信しました。推論強度ごとに 1 回ずつ、5 レベルすべてを同時に実行しています。時間はリクエストから回答完了までの秒数です。コストは OpenAI の公式価格(100万トークンあたり入力 $2、出力 $10、2026 年 10 月 5 日に確認)で計算しています。
数え上げ問題 — 1 から 1000 までの整数のうち、3 または 5 で割り切れ、7 では割り切れないものはいくつか(答え: 401)。
| 推論強度 | 秒 | 推論トークン | 出力トークン | コスト | 正解 |
|---|---|---|---|---|---|
low | 14.0 | 51 | 225 | $0.0023 | はい |
medium | 13.4 | 46 | 187 | $0.0020 | はい |
high | 14.6 | 134 | 272 | $0.0028 | はい |
xhigh | 16.2 | 303 | 362 | $0.0037 | はい |
max | 20.4 | 516 | 574 | $0.0058 | はい |
より難しい数え上げ問題 — 1 から 99,999 までの整数のうち、7 の倍数で、数字 7 を含まないものはいくつか(答え: 8,434)。
| 推論強度 | 秒 | 推論トークン | 出力トークン | コスト | 正解 |
|---|---|---|---|---|---|
low | 17.5 | 473 | 711 | $0.0072 | はい |
medium | 27.6 | 1,031 | 1,273 | $0.0128 | はい |
high | 28.3 | 1,034 | 1,255 | $0.0126 | はい |
xhigh | 31.2 | 1,552 | 1,763 | $0.0177 | はい |
max | 42.6 | 2,070 | 2,259 | $0.0227 | はい |
コードレビュー — 入力をその場でソートしてしまい、偶数長のリストを正しく扱えない 4 行の Python の median 関数からバグを見つける。
| 推論強度 | 秒 | 推論トークン | 出力トークン | コスト | 両方のバグを発見 |
|---|---|---|---|---|---|
low | 14.9 | 76 | 221 | $0.0023 | はい、修正版つき |
medium | 15.4 | 91 | 194 | $0.0020 | はい |
high | 19.5 | 296 | 396 | $0.0040 | はい |
xhigh | 19.5 | 516 | 606 | $0.0061 | はい |
max | 28.4 | 1,034 | 1,114 | $0.0112 | はい |
これらは短いタスクでの 1 回ずつの実行なので、ベンチマークではなく規模感の目安として見てください。推論トークン数は実行ごとに変わり、高い推論強度がコストに見合うのはより難しいタスクです。
GPT-6.1 Sol はなぜ遅い?
待ち時間の大部分は推論で、推論は回答より先に行われます。2 つ目のテストでは、同じ 300 語の説明を 3 つの推論強度でストリーミングし、最初の可視テキストが届くまでの時間を測りました。
| 推論強度 | 最初のテキストまで | 合計時間 | 推論トークン | 回答の速度 |
|---|---|---|---|---|
low | 3.0 秒 | 20.5 秒 | 56 | 25 トークン/秒 |
medium | 13.6 秒 | 24.7 秒 | 824 | 40 トークン/秒 |
max | 30.6 秒 | 43.5 秒 | 2,517 | 34 トークン/秒 |
回答が始まってからのストリーミング速度は、どのレベルでも同程度です。変わるのはその前の無音の時間で、max ではモデルは何かを書き始めるまでに 30 秒ほど推論していました。ユーザーがローディング表示を見て待つなら、ストリーミングと low の組み合わせが最も速く感じられる設定です。
OpenAI は 発表記事で、「Codex での標準速度と比べて最大 8 倍速いトークン生成」を備えた GPT-6.1 Sol Ultrafast も発表しています。
xhigh や max が medium より悪くなることはある?
個々のタスクでは、あります。高い推論強度がより良い回答を保証するわけではありません。上のテストでは、max が正確さで low を上回ったことは一度もなく、コストが増えただけでした。OpenAI 自身の結果も、日常的な作業については同じ方向を示しています。GPT-6.1 Sol は「より低い推論強度で」GPT-6 Sol の DeepSWE 最高スコアを上回り、GPT-6 Sol に対する事実性の最大の改善は推論強度 low で得られました。
OpenAI の数値で高い推論強度が効果を発揮しているのは、長く難しい作業です。GPT-6.1 Sol の OSWorld 2.0 と Terminal-Bench Science の結果は、最大の推論強度で報告されています。実践的なルールは、自分のタスクで測ることです。サンプルを medium とその 1 つ上のレベルで実行し、失敗が解消される場合にだけ高いレベルを使い続けてください。
どの推論強度を使うべき?
low— チャットの返信、分類、抽出、簡単なコード編集など、ユーザーが待っているもの全般。medium— コーディング支援、レビュー、ほとんどのエージェントステップのデフォルト。high— 複数ファイルにまたがる変更や、mediumで失敗するデバッグ。xhigh— 長いリファクタリングや、多数のステップにわたる計画。max— 間違った回答のコストが追加のトークンより大きい、最も難しい問題。
エージェント全体では、レベルを組み合わせてください。計画は高い推論強度で、定型的なツールステップは low か medium で実行します。各レベルの料金は GPT-6.1 Sol のページにあり、推論トークンが請求にどう表れるかは GPT-6.1 Sol の料金ガイドで解説しています。
よくある質問
GPT-6.1 Sol の推論強度のデフォルトは?
medium です。フィールドを省略すると、GPT-6.1 Sol は medium で推論します。
GPT-6.1 Sol は low と medium のどちらを使うべき?
デフォルトは medium にして、深さより速度が重要な場面では low を使ってください。上のテストでは low はすべての質問に正解し、最初のテキストが約 3 秒で表示されました。medium では約 14 秒でした。
GPT-6.1 Sol が遅いのはなぜ?
回答の前に推論し、その推論はテキストとしてストリーミングされないためです。medium 以上では、その無音の時間が待ち時間の大部分を占めます。テキストを早く表示し始めるには、推論強度を下げるか、レスポンスをストリーミングしてください。
GPT-6.1 Sol の xhigh は high より優れている?
それが必要なタスクに限ります。短いタスクでは両レベルの回答は同じで、xhigh のほうが多くのトークンを使いました。xhigh にお金をかける前に、自分の作業で両方を試してください。
GPT-6.1 Sol で推論をオフにできる?
いいえ。GPT-6.1 Sol は none と minimal に対応していません。推論なしの回答が必要なら、GPT-6 Sol は引き続き none に対応しています。GPT-6.1 Sol・GPT-6 Astra・GPT-6 Sol の比較をご覧ください。



