GPT-6.1 Sol 推理強度:low、medium、high、xhigh 還是 max?
GPT-6.1 Sol 該用哪一檔推理強度:low、medium、high、xhigh 與 max 的實測時間、token 數與費用,為什麼感覺慢,以及從哪一檔開始。
以 Markdown 閱讀GPT-6.1 Sol 先用預設的 medium,想快點拿到答案時用 low。只有在 medium 失敗的任務上,才把推理強度調到 high、xhigh 或 max:長時間的重構、棘手的除錯、多步驟的代理工作。在下方測試的短任務中,每一檔推理強度都答對了,但 max 顯示第一個字所需的時間約為 low 的十倍,用掉的 token 是 low 的二點五到五倍。
這也是 GPT-6.1 Sol 讓人覺得慢的主要原因。它在回答前一律會先推理,你得等推理結束,才看得到第一段文字。
GPT-6.1 Sol 支援哪些推理強度?
五檔:low、medium、high、xhigh 與 max。預設是 medium。根據 OpenAI 的 GPT-6.1 Sol 模型頁面,「不支援 none 與 minimal 推理強度」,所以和 GPT-6 Sol 不同,它沒辦法關閉推理。少了 none,temperature 與 top_p 這類取樣設定也不會有作用。
推理強度依請求設定。在 Responses API 中是 reasoning.effort:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)在 Chat Completions 中欄位是 reasoning_effort。推理 token 計入 output_tokens,按輸出計費,並與回答共用 max_output_tokens 的額度。
五檔推理強度實際差多少?
測試於 2026 年 10 月 5 日透過 SeedRouter 對 GPT-6.1 Sol 送出三個有已知答案的提示,每一檔推理強度各送一次,五檔同時進行。時間是從送出請求到收到完整回答的秒數。費用以 OpenAI 每百萬 token 輸入 $2、輸出 $10 的官方定價計算,於 2026 年 10 月 5 日確認。
計數問題:1 到 1000 之間有多少個整數能被 3 或 5 整除,但不能被 7 整除(答案:401)。
| 推理強度 | 秒數 | 推理 token | 輸出 token | 費用 | 正確 |
|---|---|---|---|---|---|
low | 14.0 | 51 | 225 | $0.0023 | 是 |
medium | 13.4 | 46 | 187 | $0.0020 | 是 |
high | 14.6 | 134 | 272 | $0.0028 | 是 |
xhigh | 16.2 | 303 | 362 | $0.0037 | 是 |
max | 20.4 | 516 | 574 | $0.0058 | 是 |
較難的計數問題:1 到 99,999 之間有多少個整數是 7 的倍數,而且不含數字 7(答案:8,434)。
| 推理強度 | 秒數 | 推理 token | 輸出 token | 費用 | 正確 |
|---|---|---|---|---|---|
low | 17.5 | 473 | 711 | $0.0072 | 是 |
medium | 27.6 | 1,031 | 1,273 | $0.0128 | 是 |
high | 28.3 | 1,034 | 1,255 | $0.0126 | 是 |
xhigh | 31.2 | 1,552 | 1,763 | $0.0177 | 是 |
max | 42.6 | 2,070 | 2,259 | $0.0227 | 是 |
程式碼審查:找出一個四行 Python median 函式裡的 bug,它會就地排序輸入,而且處理不好偶數長度的串列。
| 推理強度 | 秒數 | 推理 token | 輸出 token | 費用 | 找出兩個 bug |
|---|---|---|---|---|---|
low | 14.9 | 76 | 221 | $0.0023 | 是,並附上修正版本 |
medium | 15.4 | 91 | 194 | $0.0020 | 是 |
high | 19.5 | 296 | 396 | $0.0040 | 是 |
xhigh | 19.5 | 516 | 606 | $0.0061 | 是 |
max | 28.4 | 1,034 | 1,114 | $0.0112 | 是 |
這些都是短任務上的單次執行,請當作量級參考,而不是基準測試。推理 token 數每次執行都會有些差異,而高推理強度真正值回票價的,是比較難的任務。
為什麼 GPT-6.1 Sol 很慢?
大部分等待時間都花在推理上,而推理發生在最前面。第二個測試以三檔推理強度串流輸出同一段 300 字的說明,並測量第一段可見文字出現的時間:
| 推理強度 | 第一段文字出現 | 總時間 | 推理 token | 回答速度 |
|---|---|---|---|---|
low | 3.0 秒 | 20.5 秒 | 56 | 25 tokens/s |
medium | 13.6 秒 | 24.7 秒 | 824 | 40 tokens/s |
max | 30.6 秒 | 43.5 秒 | 2,517 | 34 tokens/s |
回答一旦開始,每一檔的串流速度都差不多。改變的是之前那段靜默期:在 max 下,模型在寫出任何內容前推理了半分鐘。如果你的使用者盯著載入動畫等待,low 加上串流是感覺最快的設定。
OpenAI 也在發布公告中宣布了 GPT-6.1 Sol Ultrafast,「在 Codex 中的 token 產生速度最高可達標準速度的 8 倍」。
xhigh 或 max 會比 medium 更差嗎?
在某個特定任務上,會的:更高的推理強度不保證更好的答案。在上面的執行中,max 在正確性上從沒贏過 low,只是花得更多。OpenAI 自己的結果在例行工作上也指向同一個方向:GPT-6.1 Sol 超越 GPT-6 Sol 在 DeepSWE 的最佳成績時「使用了較低的推理強度」,而它相較 GPT-6 Sol 在事實性上的最大進步出現在 low 推理強度。
在 OpenAI 的數據裡,高推理強度真正有回報的是又長又難的工作:GPT-6.1 Sol 的 OSWorld 2.0 與 Terminal-Bench Science 成績都是在最高推理強度下回報的。實用的原則是在你自己的任務上量測。用 medium 和高一檔各跑一批樣本,只在高一檔能修正失敗的地方保留它。
該用哪一檔推理強度?
low:聊天回覆、分類、資料擷取、簡單的程式修改,以及任何要讓使用者等待的情境。medium:程式開發協助、程式碼審查與大多數代理步驟的預設選擇。high:多檔案的變更,以及在medium下失敗的除錯。xhigh:長時間的重構與跨多個步驟的規劃。max:最困難的問題,答錯的代價比多出來的 token 更高。
對整個代理來說,可以混合使用:用較高的推理強度做規劃,例行的工具步驟用 low 或 medium。每一檔的價格都在 GPT-6.1 Sol 頁面上,GPT-6.1 Sol 價格指南則說明推理 token 如何出現在帳單上。
常見問題
GPT-6.1 Sol 的預設推理強度是什麼?
medium。如果你不填這個欄位,GPT-6.1 Sol 會以 medium 推理。
GPT-6.1 Sol 該用 low 還是 medium?
預設用 medium,在速度比深度更重要的地方用 low。在上面的測試中,low 每一題都答對,大約三秒就顯示出第一段文字,而 medium 大約要十四秒。
GPT-6.1 Sol 為什麼這麼慢?
它在回答前會先推理,而推理過程不會以文字串流輸出。在 medium 以上,這段靜默期占了大部分等待時間。降低推理強度,或串流輸出回應,就能更早開始顯示文字。
GPT-6.1 Sol 的 xhigh 比 high 更好嗎?
只在需要它的任務上更好。在短任務上,兩檔給出相同的答案,而 xhigh 用了更多 token。在為 xhigh 付費之前,先在你自己的工作上測試兩者。
GPT-6.1 Sol 可以關閉推理嗎?
不行。GPT-6.1 Sol 不支援 none 或 minimal。如果你需要不經推理的回答,GPT-6 Sol 仍然支援 none。請參閱 GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol 比較。



