Claude Opus 5.5 已在 SeedRouter 上线

GPT-6 和 Claude Opus 5.5 哪个好:基准测试、价格和选型

GPT-6 Astra、Sol 和 Luna 对比 Claude Opus 5.5:规格参数、token 价格、两家官方公布的基准测试成绩,以及编程、Agent 和成本敏感场景分别该选哪个。

以 Markdown 阅读

没有唯一的赢家。在 Anthropic 公布的基准测试表中,Claude Opus 5.5 在 Agent 编程和知识工作上胜过 GPT-6 Astra,而 GPT-6 Astra 在业务工作流和科学研究上领先。价格方面,Claude Opus 5.5 介于 GPT-6 Sol 和 GPT-6 Astra 之间,GPT-6 Luna 则比它们都便宜得多。没有任何一家公布过 GPT-6 Sol 或 GPT-6 Luna 与 Claude Opus 5.5 的直接对比,所以这两组要靠你自己的测试来决定。

这四个模型都在 SeedRouter 上通过同一个 key 运行,你可以并排测试。

GPT-6 和 Claude Opus 5.5 的规格参数有什么区别?

GPT-6 AstraGPT-6 SolGPT-6 LunaClaude Opus 5.5
模型 IDgpt-6-astragpt-6-solgpt-6-lunaclaude-opus-5-5
发布日期2026 年 9 月 3 日2026 年 9 月 22 日2026 年 9 月 22 日2026 年 9 月 22 日
上下文窗口1,050,000 tokens1,050,000 tokens1,050,000 tokens1M tokens
最大输出128,000 tokens128,000 tokens128,000 tokens128K tokens
推理强度档位low 到 maxnone 到 maxnone 到 maxlow 到 max
默认推理强度未公开mediummediummedium
可关闭推理否可以,设为 none可以,设为 none否,思考始终开启
输入文本、图片文本、图片文本、图片文本、图片、PDF

GPT-6 的数据来自 OpenAI 的模型页面:Astra、Sol 和 Luna;Claude Opus 5.5 的数据来自 Anthropic 的模型页面。

GPT-6 和 Claude Opus 5.5 的价格对比如何?

每 token 官方标价,以同一计费项上 GPT-6 Sol 费率的倍数表示:

模型输入缓存输入缓存写入输出
GPT-6 Astra5×5×5×5×
Claude Opus 5.52×1×2×2×
GPT-6 Sol1×1×1×1×
GPT-6 Luna0.05×0.05×0.05×0.05×

GPT-6 的价格来自 OpenAI 的 价格页面,Claude Opus 5.5 的价格来自 Anthropic 的 发布文章。Claude Opus 5.5 每 token 的价格是 GPT-6 Astra 的 40%,是 GPT-6 Sol 的两倍。GPT-6 输入超过 272K tokens 的提示按更高的长上下文费率计费。你账户实际支付的费率,见 GPT-6 API 价格指南 和 Claude API 价格指南。

Claude Opus 5.5 和 GPT-6 Astra 的跑分对比如何?

Anthropic 的 Claude Opus 5.5 发布公告 在表格中列入了 GPT-6 Astra。除特别注明外,Claude 的结果都是 max 推理强度;GPT-6 Astra 的数据按 Anthropic 的说法是“由 OpenAI 报告”。

基准测试(Anthropic 的表格)Claude Opus 5.5GPT-6 Astra
Terminal-Bench 4.0(Agent 编程)66.4%(xhigh)57.9%(high)
FrontierCode v1.1 Main(Agent 编程)54.4%53.3%
GDPval-AA v2.1(知识工作,Elo)18461542
Humanity's Last Exam(使用工具)67.7%57.2%
AutomationBench(业务工作流)40.0%41.4%
Terminal-Bench-Science 0.1(科学研究)58.7%64.6%

Anthropic 还比较了单任务成本:在 GDPval-AA 上,默认 medium 推理强度的 Claude Opus 5.5“以大约五分之一的单任务成本胜过 max 推理强度的 GPT-6 Astra”;在 FrontierCode 上,它“以大约 20% 的单任务成本”胜过 Astra。

GPT-6 Sol 和 GPT-6 Luna 表现如何?

OpenAI 的 GPT-6 Sol 与 Luna 发布公告 拿它们对比的是 Claude Opus 5 和 Claude Fable 系列,而不是同一天发布的 Claude Opus 5.5。OpenAI 报告的结果举例如下:

  • 在 AutomationBench 上,xhigh 推理强度的 GPT-6 Sol 得分 33.2%,max 推理强度的 Claude Opus 5 为 26.9%,而 Sol 的单任务成本只有 Opus 5 的 9%。
  • 在 DeepSWE v1.1 上,max 推理强度的 GPT-6 Luna 得分 66.6%,“与 medium 推理强度的 Claude Opus 5 和 Fable 5 相当”,单任务成本比 Opus 5 低 93%。

Anthropic 报告 Claude Opus 5.5 在其表格中全面超越 Claude Opus 5,所以这些结果并不能说明 GPT-6 Sol 或 GPT-6 Luna 与 Opus 5.5 相比如何。请在你自己的任务上测试。

两者的 API 有什么不同?

  • 请求格式。 在 SeedRouter 上,两个系列都用同一个 key 响应 OpenAI Responses、OpenAI Chat Completions 和 Anthropic Messages 请求。
  • 推理。 GPT-6 Sol 和 Luna 可以在 none 推理强度下跳过推理,这也是唯一接受 temperature 和 top_p 的设置。Claude Opus 5.5 始终会思考;Anthropic 的 API 会拒绝其他采样参数值和关闭思考的设置。
  • 强制工具调用。 Claude Opus 5.5 会拒绝强制的 tool_choice。在 GPT-6 上,需要推理加工具时用 Responses API。
  • 文档。 Claude Opus 5.5 可以直接读取 PDF;GPT-6 接受文本和图片。

GPT-6 和 Claude Opus 5.5 该选哪个?

如果你需要选原因
中等价位的 Agent 编程Claude Opus 5.5在 Anthropic 的编程项上领先 GPT-6 Astra,token 价格只有其 40%
业务工作流或科学研究GPT-6 Astra在 Anthropic 表格的这几项上领先 Claude Opus 5.5
以最低的中档价格获得强劲的编程和 Agent 能力GPT-6 Soltoken 价格是 Claude Opus 5.5 的一半
大批量分类和信息抽取GPT-6 Luna输入价格是 Claude Opus 5.5 的四十分之一
提示中带 PDFClaude Opus 5.5可以直接读取

常见问题

Claude Opus 5.5 比 GPT-6 Astra 更好吗?

在 Anthropic 公布的六项中有四项是,包括两项编程基准和知识工作。GPT-6 Astra 在业务工作流和科学研究上领先。两组成绩都来自各家实验室自己。

GPT-6 Sol 比 Claude Opus 5.5 更好吗?

没有人公布过这项对比。OpenAI 拿 GPT-6 Sol 对比的是 Claude Opus 5,而 Claude Opus 5.5 是它的替代者。GPT-6 Sol 每 token 价格只有一半,值得在你自己的任务上测一测。

GPT-6 和 Claude Opus 5.5 能用同一套代码调用吗?

可以。在 SeedRouter 上,两者都用同一个 key 接受相同的 OpenAI 或 Anthropic 请求格式;改一下 model,并去掉某个模型会拒绝的字段,比如 Claude Opus 5.5 上的 temperature。

用你自己的提示对比一下

在浏览器里把同一个提示分别发给 GPT-6 Astra、GPT-6 Sol 和 Claude Opus 5.5,对比各自的回答、token 数和费用。

相关指南