GPT-6.1 Sol 推理强度:low、medium、high、xhigh 还是 max?
GPT-6.1 Sol 该用哪档推理强度:low、medium、high、xhigh 和 max 的实测耗时、token 数和费用,为什么感觉慢,以及从哪一档开始。
以 Markdown 阅读GPT-6.1 Sol 先用默认的 medium,想快速拿到答案时用 low。只有在 medium 失败的任务上,才把推理强度提到 high、xhigh 或 max:长时间重构、疑难调试、多步骤的 Agent 工作。在下面测试的短任务中,每一档推理强度都给出了正确答案,但 max 显示第一个字所需的时间约为 low 的十倍,用掉的 token 是 low 的二点五到五倍。
这也是 GPT-6.1 Sol 让人觉得慢的主要原因。它在回答之前总要先推理,你得等推理结束,才能看到第一段可见的文字。
GPT-6.1 Sol 支持哪些推理强度?
五档:low、medium、high、xhigh 和 max。默认是 medium。根据 OpenAI 的 GPT-6.1 Sol 模型页面,“不支持 none 和 minimal 推理强度”,所以与 GPT-6 Sol 不同,它没有办法关闭推理。没有 none,temperature 和 top_p 这类采样设置也不起作用。
推理强度按请求设置。在 Responses API 中是 reasoning.effort:
from openai import OpenAI
client = OpenAI(api_key="YOUR_SEEDROUTER_KEY", base_url="https://api.seedrouter.ai/v1")
response = client.responses.create(
model="gpt-6.1-sol",
input="Find the race condition in this handler and suggest a fix: ...",
reasoning={"effort": "low"},
)
print(response.output_text)
print(response.usage.output_tokens_details.reasoning_tokens)在 Chat Completions 中字段是 reasoning_effort。推理 token 计入 output_tokens,按输出计费,并与回答共用 max_output_tokens 的额度。
五档推理强度在实际中差别多大?
测试于 2026 年 10 月 5 日通过 SeedRouter 向 GPT-6.1 Sol 发送了三个有已知答案的提示,每档推理强度各发一次,五档同时进行。时间是从发出请求到收到完整回答的秒数。费用按 OpenAI 每百万 token 输入 $2、输出 $10 的官方标价计算,于 2026 年 10 月 5 日核实。
计数问题:1 到 1000 之间有多少个整数能被 3 或 5 整除,但不能被 7 整除(答案:401)。
| 推理强度 | 秒数 | 推理 token | 输出 token | 费用 | 正确 |
|---|---|---|---|---|---|
low | 14.0 | 51 | 225 | $0.0023 | 是 |
medium | 13.4 | 46 | 187 | $0.0020 | 是 |
high | 14.6 | 134 | 272 | $0.0028 | 是 |
xhigh | 16.2 | 303 | 362 | $0.0037 | 是 |
max | 20.4 | 516 | 574 | $0.0058 | 是 |
更难的计数问题:1 到 99,999 之间有多少个整数是 7 的倍数,且不含数字 7(答案:8,434)。
| 推理强度 | 秒数 | 推理 token | 输出 token | 费用 | 正确 |
|---|---|---|---|---|---|
low | 17.5 | 473 | 711 | $0.0072 | 是 |
medium | 27.6 | 1,031 | 1,273 | $0.0128 | 是 |
high | 28.3 | 1,034 | 1,255 | $0.0126 | 是 |
xhigh | 31.2 | 1,552 | 1,763 | $0.0177 | 是 |
max | 42.6 | 2,070 | 2,259 | $0.0227 | 是 |
代码审查:找出一个四行 Python median 函数中的 bug,它会原地排序输入,并且处理不好偶数长度的列表。
| 推理强度 | 秒数 | 推理 token | 输出 token | 费用 | 找出两个 bug |
|---|---|---|---|---|---|
low | 14.9 | 76 | 221 | $0.0023 | 是,并给出修复版本 |
medium | 15.4 | 91 | 194 | $0.0020 | 是 |
high | 19.5 | 296 | 396 | $0.0040 | 是 |
xhigh | 19.5 | 516 | 606 | $0.0061 | 是 |
max | 28.4 | 1,034 | 1,114 | $0.0112 | 是 |
这些都是短任务上的单次运行,请把它们当作量级参考,而不是基准测试。推理 token 数在每次运行之间会有变化,而高推理强度真正物有所值的,是更难的任务。
为什么 GPT-6.1 Sol 很慢?
大部分等待时间都花在推理上,而推理发生在最前面。第二个测试以三档推理强度流式输出同一段 300 字的解释,并测量第一段可见文字出现的时间:
| 推理强度 | 首段文字出现 | 总时间 | 推理 token | 回答速度 |
|---|---|---|---|---|
low | 3.0 秒 | 20.5 秒 | 56 | 25 tokens/s |
medium | 13.6 秒 | 24.7 秒 | 824 | 40 tokens/s |
max | 30.6 秒 | 43.5 秒 | 2,517 | 34 tokens/s |
回答一旦开始,每一档的输出速度都差不多。变化的是它之前那段静默期:在 max 下,模型在写出任何内容之前推理了半分钟。如果你的用户盯着加载动画等待,low 加流式输出是感觉最快的设置。
OpenAI 还在发布公告中宣布了 GPT-6.1 Sol Ultrafast,“在 Codex 中的 token 生成速度最高可达标准速度的 8 倍”。
xhigh 或 max 会比 medium 更差吗?
在某个具体任务上,会的:更高的推理强度并不保证更好的答案。在上面的运行中,max 在正确性上从未胜过 low,只是花费更多。OpenAI 自己的结果在常规工作上也指向同一方向:GPT-6.1 Sol 超过 GPT-6 Sol 在 DeepSWE 上的最佳成绩时“使用的推理强度更低”,而它相对 GPT-6 Sol 在事实性上的最大提升出现在 low 推理强度下。
在 OpenAI 的数据里,高推理强度真正有回报的是又长又难的工作:GPT-6.1 Sol 的 OSWorld 2.0 和 Terminal-Bench Science 成绩都是在最高推理强度下报告的。实用的规则是在你自己的任务上测量。用 medium 和高一档各跑一批样本,只在高一档能修复失败的地方保留它。
该用哪一档推理强度?
low:聊天回复、分类、信息抽取、简单的代码修改,以及任何需要用户等待的场景。medium:编程辅助、代码审查和大多数 Agent 步骤的默认选择。high:多文件改动,以及在medium下失败的调试。xhigh:长时间的重构和跨多个步骤的规划。max:最难的问题,答错的代价比多出来的 token 更高。
对于整个 Agent,可以混合使用:用较高的推理强度做规划,常规的工具步骤用 low 或 medium。每一档的价格都在 GPT-6.1 Sol 页面上,GPT-6.1 Sol 价格指南则说明了推理 token 如何体现在账单上。
常见问题
GPT-6.1 Sol 默认的推理强度是什么?
medium。如果你不填这个字段,GPT-6.1 Sol 会以 medium 推理。
GPT-6.1 Sol 用 low 还是 medium?
默认用 medium,在速度比深度更重要的地方用 low。在上面的测试中,low 每道题都答对了,大约三秒就显示出第一段文字,而 medium 大约要十四秒。
GPT-6.1 Sol 为什么这么慢?
它在回答之前先推理,而推理过程不会以文字形式流式输出。在 medium 及以上,这段静默期占了大部分等待时间。降低推理强度,或者流式输出响应,就能更早开始显示文字。
GPT-6.1 Sol 的 xhigh 比 high 更好吗?
只在需要它的任务上更好。在短任务上,两档给出了同样的答案,而 xhigh 用了更多 token。在为 xhigh 付费之前,先在你自己的工作上测试两者。
GPT-6.1 Sol 能关闭推理吗?
不能。GPT-6.1 Sol 不支持 none 或 minimal。如果你需要不经推理的回答,GPT-6 Sol 仍然支持 none。参见 GPT-6.1 Sol vs GPT-6 Astra vs GPT-6 Sol 对比。



