Claude Opus 5.5 已在 SeedRouter 上线
LogoSeedRouter

按名称搜索模型,例如 nano banana

按名称搜索模型,例如 nano banana

Grok 4.7 价格:缓存输入、推理与请求费用

了解 Grok 4.7 价格、缓存输入与推理用量。使用当前 Token 费率估算请求费用,避免重复计算缓存 Token。

以 Markdown 阅读

Grok 4.7 价格取决于输入 Token、缓存输入和输出用量。 官方起始费率为每百万输入 Token 2 美元、每百万输出 Token 6 美元。这些基础费率是模型的标价;估算 SeedRouter 请求时,请使用下方的 SeedRouter 当前价格表。[1]

回答的可见长度只是计算的一部分。简短回答可能包含额外的推理 Token,而较长提示词可能包含缓存输入。Grok 4.7 模型页面同时提供 Playground 和当前价格。

Grok 4.7 多少钱?

官方公告将上述输入和输出费率列为 Grok 4.7 的起始价格,也介绍了另一个价格不同的 fast 变体。本指南讨论的是 grok-4.7 模型;名称相似的变体,其价格不能混用。[2]

通过 SeedRouter 发起请求时,请使用以下当前 Token 费率:

价格暂时不可用。请稍后再试。

根据请求的输入长度读取对应档位的费率。在 SeedRouter 上,输入少于 20 万个 Token 时采用标准档;输入达到或超过 20 万个 Token 时,整个请求采用长上下文档。输入、缓存输入和输出均使用对应档位。这个阈值是价格分界,不表示预留同等数量的 Token。

使用 service_tier: "priority" 或 "fast" 时,所选输入长度档位的 Token 费率加倍。该倍率适用于 Token 费用;工具费单独计算。

官方 API 概览列出的上下文窗口为 50 万个 Token。这一能力上限不表示每次请求都会按完整窗口计费。[1]

计算费用需要哪些用量字段?

使用 Responses API 时,保留返回的 usage 中的三个值:

用量字段使用方式
input_tokens输入总量;包含缓存部分
input_tokens_details.cached_tokens输入中按缓存输入费率计费的部分
output_tokens用于 Token 费用计算的输出总量

应用普通输入费率前,先从输入总量中减去缓存 Token。否则,在估算中,同一批缓存 Token 会先按普通输入计算一次,再按缓存输入计算一次。

当费率以每百万 Token 表示时:

uncached input = input_tokens - cached_tokens

token cost = (
  uncached input × input rate
  + cached_tokens × cached-input rate
  + output_tokens × output rate
) / 1,000,000

各项均使用当前价格表中的费率。选择输入长度档位时,使用减去缓存 Token 之前的输入总量。Token 估算不会自动包含单独的工具费;使用付费搜索工具的请求,还需计算相应工具用量。

为什么简短回答也会使用更多输出 Token?

即使最终回答很短,推理也会计入输出用量。例如,2026 年 10 月 10 日验证的一次已完成的 Grok 4.7 Responses 请求返回:

{
  "input_tokens": 3340,
  "input_tokens_details": { "cached_tokens": 1152 },
  "output_tokens": 22,
  "output_tokens_details": { "reasoning_tokens": 21 },
  "total_tokens": 3362
}

这次请求包含 2188 个未缓存输入 Token、1152 个缓存输入 Token 和 22 个输出 Token。其中 21 个推理 Token 是输出总量的明细。再次相加会把 22 算成 43,从而高估输出费用。

这些数字描述的是一次已完成的请求,不是其他提示词的平均值或预测值。为自己的应用制定预算时,应记录有代表性的任务所报告的用量,并检查每个结果是否满足任务要求。

流式输出会改变 Token 价格吗?

流式输出改变的是回答的传输方式。估算仍使用已完成请求的输入、缓存输入和输出用量。请保留最终用量信息,不要把每个文本片段当成单独计费的请求。

在 SeedRouter 的 Grok 4.7 验证中,Chat 和 Responses 的流式与非流式请求均已完成,并计入缓存输入。这验证的是用量计算,并不意味着两次分别生成的回答会消耗完全相同数量的 Token。

如何比较两个提示词的费用?

保持任务和验收标准一致。记录每次尝试的输入总量、缓存输入、输出,以及回答是否可用。比较获得合格结果的总花费,其中也应计入那些虽然生成成功、但因回答不符合要求而需要重试的费用。

对于长对话,先确认缩短历史后仍能正确回答,再删除无关历史。对于重复上下文,检查缓存 Token 计数;仅仅重复文本不能证明命中了缓存。对于推理较多的任务,应比较实际输出用量,而不是只统计回答中显示的字数。

价格常见问题

官方标出的基础费率就是我在 SeedRouter 支付的价格吗?

在 SeedRouter 上,请使用上方实时价格表。官方起始价格可作为参考背景,而服务当前的输入长度档位和 Token 费率决定了估算结果。

需要把 reasoning_tokens 加到 output_tokens 上吗?

不需要。在上方展示的 Responses 用量中,推理已经包含在输出总量内。推理明细用于理解模型完成的工作,不应作为第二笔输出费用。

重复提示词一定能享受缓存输入折扣吗?

不能保证。请使用响应报告的缓存 Token 数量,仅对该部分应用缓存输入费率,其余部分按普通输入费率计算。

在哪里查看最终费用?

用量记录会显示已完成请求的费用。进行新的估算时,请刷新 Grok 4.7 价格区块,并使用该请求报告的用量。返回错误的请求不收费。

来源

  1. SpaceXAI API:Grok 模型与价格,核对于 2026 年 10 月 10 日。
  2. Grok 4.7 发布介绍,2026 年 9 月 21 日。

相关指南