Claude Opus 5.5 已在 SeedRouter 上線

GPT-6.1 Sol 推理強度:low、medium、high、xhigh 還是 max?

GPT-6.1 Sol 該用哪一檔推理強度:low、medium、high、xhigh 與 max 的實測時間、token 數與費用,為什麼感覺慢,以及從哪一檔開始。

以 Markdown 閱讀

GPT-6.1 Sol 先用預設的 medium,想快點拿到答案時用 low。只有在 medium 失敗的任務上,才把推理強度調到 high、xhigh 或 max:長時間的重構、棘手的除錯、多步驟的代理工作。在下方測試的短任務中,每一檔推理強度都答對了,但 max 顯示第一個字所需的時間約為 low 的十倍,用掉的 token 是 low 的二點五到五倍。

這也是 GPT-6.1 Sol 讓人覺得慢的主要原因。它在回答前一律會先推理,你得等推理結束,才看得到第一段文字。

GPT-6.1 Sol 支援哪些推理強度?

五檔:low、medium、high、xhigh 與 max。預設是 medium。根據 OpenAI 的 GPT-6.1 Sol 模型頁面,「不支援 none 與 minimal 推理強度」,所以和 GPT-6 Sol 不同,它沒辦法關閉推理。少了 none,temperature 與 top_p 這類取樣設定也不會有作用。

推理強度依請求設定。在 Responses API 中是 reasoning.effort:

from openai import OpenAI

client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")

response = client.responses.create(
    model="gpt-6.1-sol",
    input="Find the race condition in this handler and suggest a fix: ...",
    reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)

在 Chat Completions 中欄位是 reasoning_effort。推理 token 計入 output_tokens,按輸出計費,並與回答共用 max_output_tokens 的額度。

五檔推理強度實際差多少?

測試於 2026 年 10 月 5 日透過 SeedRouter 對 GPT-6.1 Sol 送出三個有已知答案的提示,每一檔推理強度各送一次,五檔同時進行。時間是從送出請求到收到完整回答的秒數。費用以 OpenAI 每百萬 token 輸入 $2、輸出 $10 的官方定價計算,於 2026 年 10 月 5 日確認。

計數問題:1 到 1000 之間有多少個整數能被 3 或 5 整除,但不能被 7 整除(答案:401)。

推理強度秒數推理 token輸出 token費用正確
low14.051225$0.0023是
medium13.446187$0.0020是
high14.6134272$0.0028是
xhigh16.2303362$0.0037是
max20.4516574$0.0058是

較難的計數問題:1 到 99,999 之間有多少個整數是 7 的倍數,而且不含數字 7(答案:8,434)。

推理強度秒數推理 token輸出 token費用正確
low17.5473711$0.0072是
medium27.61,0311,273$0.0128是
high28.31,0341,255$0.0126是
xhigh31.21,5521,763$0.0177是
max42.62,0702,259$0.0227是

程式碼審查:找出一個四行 Python median 函式裡的 bug,它會就地排序輸入,而且處理不好偶數長度的串列。

推理強度秒數推理 token輸出 token費用找出兩個 bug
low14.976221$0.0023是,並附上修正版本
medium15.491194$0.0020是
high19.5296396$0.0040是
xhigh19.5516606$0.0061是
max28.41,0341,114$0.0112是

這些都是短任務上的單次執行,請當作量級參考,而不是基準測試。推理 token 數每次執行都會有些差異,而高推理強度真正值回票價的,是比較難的任務。

為什麼 GPT-6.1 Sol 很慢?

大部分等待時間都花在推理上,而推理發生在最前面。第二個測試以三檔推理強度串流輸出同一段 300 字的說明,並測量第一段可見文字出現的時間:

推理強度第一段文字出現總時間推理 token回答速度
low3.0 秒20.5 秒5625 tokens/s
medium13.6 秒24.7 秒82440 tokens/s
max30.6 秒43.5 秒2,51734 tokens/s

回答一旦開始,每一檔的串流速度都差不多。改變的是之前那段靜默期:在 max 下,模型在寫出任何內容前推理了半分鐘。如果你的使用者盯著載入動畫等待,low 加上串流是感覺最快的設定。

OpenAI 也在發布公告中宣布了 GPT-6.1 Sol Ultrafast,「在 Codex 中的 token 產生速度最高可達標準速度的 8 倍」。

xhigh 或 max 會比 medium 更差嗎?

在某個特定任務上,會的:更高的推理強度不保證更好的答案。在上面的執行中,max 在正確性上從沒贏過 low,只是花得更多。OpenAI 自己的結果在例行工作上也指向同一個方向:GPT-6.1 Sol 超越 GPT-6 Sol 在 DeepSWE 的最佳成績時「使用了較低的推理強度」,而它相較 GPT-6 Sol 在事實性上的最大進步出現在 low 推理強度。

在 OpenAI 的數據裡,高推理強度真正有回報的是又長又難的工作:GPT-6.1 Sol 的 OSWorld 2.0 與 Terminal-Bench Science 成績都是在最高推理強度下回報的。實用的原則是在你自己的任務上量測。用 medium 和高一檔各跑一批樣本,只在高一檔能修正失敗的地方保留它。

該用哪一檔推理強度?

  • low:聊天回覆、分類、資料擷取、簡單的程式修改,以及任何要讓使用者等待的情境。
  • medium:程式開發協助、程式碼審查與大多數代理步驟的預設選擇。
  • high:多檔案的變更,以及在 medium 下失敗的除錯。
  • xhigh:長時間的重構與跨多個步驟的規劃。
  • max:最困難的問題,答錯的代價比多出來的 token 更高。

對整個代理來說,可以混合使用:用較高的推理強度做規劃,例行的工具步驟用 low 或 medium。每一檔的價格都在 GPT-6.1 Sol 頁面上,GPT-6.1 Sol 價格指南則說明推理 token 如何出現在帳單上。

常見問題

GPT-6.1 Sol 的預設推理強度是什麼?

medium。如果你不填這個欄位,GPT-6.1 Sol 會以 medium 推理。

GPT-6.1 Sol 該用 low 還是 medium?

預設用 medium,在速度比深度更重要的地方用 low。在上面的測試中,low 每一題都答對,大約三秒就顯示出第一段文字,而 medium 大約要十四秒。

GPT-6.1 Sol 為什麼這麼慢?

它在回答前會先推理,而推理過程不會以文字串流輸出。在 medium 以上,這段靜默期占了大部分等待時間。降低推理強度,或串流輸出回應,就能更早開始顯示文字。

GPT-6.1 Sol 的 xhigh 比 high 更好嗎?

只在需要它的任務上更好。在短任務上,兩檔給出相同的答案,而 xhigh 用了更多 token。在為 xhigh 付費之前,先在你自己的工作上測試兩者。

GPT-6.1 Sol 可以關閉推理嗎?

不行。GPT-6.1 Sol 不支援 none 或 minimal。如果你需要不經推理的回答,GPT-6 Sol 仍然支援 none。請參閱 GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol 比較。

相關指南