Grok 4.7 价格:缓存输入、推理与请求费用
了解 Grok 4.7 价格、缓存输入与推理用量。使用当前 Token 费率估算请求费用,避免重复计算缓存 Token。
以 Markdown 阅读Grok 4.7 价格取决于输入 Token、缓存输入和输出用量。 官方起始费率为每百万输入 Token 2 美元、每百万输出 Token 6 美元。这些基础费率是模型的标价;估算 SeedRouter 请求时,请使用下方的 SeedRouter 当前价格表。[1]
回答的可见长度只是计算的一部分。简短回答可能包含额外的推理 Token,而较长提示词可能包含缓存输入。Grok 4.7 模型页面同时提供 Playground 和当前价格。
Grok 4.7 多少钱?
官方公告将上述输入和输出费率列为 Grok 4.7 的起始价格,也介绍了另一个价格不同的 fast 变体。本指南讨论的是 grok-4.7 模型;名称相似的变体,其价格不能混用。[2]
通过 SeedRouter 发起请求时,请使用以下当前 Token 费率:
价格暂时不可用。请稍后再试。
根据请求的输入长度读取对应档位的费率。在 SeedRouter 上,输入少于 20 万个 Token 时采用标准档;输入达到或超过 20 万个 Token 时,整个请求采用长上下文档。输入、缓存输入和输出均使用对应档位。这个阈值是价格分界,不表示预留同等数量的 Token。
使用 service_tier: "priority" 或 "fast" 时,所选输入长度档位的 Token 费率加倍。该倍率适用于 Token 费用;工具费单独计算。
官方 API 概览列出的上下文窗口为 50 万个 Token。这一能力上限不表示每次请求都会按完整窗口计费。[1]
计算费用需要哪些用量字段?
使用 Responses API 时,保留返回的 usage 中的三个值:
| 用量字段 | 使用方式 |
|---|---|
input_tokens | 输入总量;包含缓存部分 |
input_tokens_details.cached_tokens | 输入中按缓存输入费率计费的部分 |
output_tokens | 用于 Token 费用计算的输出总量 |
应用普通输入费率前,先从输入总量中减去缓存 Token。否则,在估算中,同一批缓存 Token 会先按普通输入计算一次,再按缓存输入计算一次。
当费率以每百万 Token 表示时:
uncached input = input_tokens - cached_tokens
token cost = (
uncached input × input rate
+ cached_tokens × cached-input rate
+ output_tokens × output rate
) / 1,000,000各项均使用当前价格表中的费率。选择输入长度档位时,使用减去缓存 Token 之前的输入总量。Token 估算不会自动包含单独的工具费;使用付费搜索工具的请求,还需计算相应工具用量。
为什么简短回答也会使用更多输出 Token?
即使最终回答很短,推理也会计入输出用量。例如,2026 年 10 月 10 日验证的一次已完成的 Grok 4.7 Responses 请求返回:
{
"input_tokens": 3340,
"input_tokens_details": { "cached_tokens": 1152 },
"output_tokens": 22,
"output_tokens_details": { "reasoning_tokens": 21 },
"total_tokens": 3362
}这次请求包含 2188 个未缓存输入 Token、1152 个缓存输入 Token 和 22 个输出 Token。其中 21 个推理 Token 是输出总量的明细。再次相加会把 22 算成 43,从而高估输出费用。
这些数字描述的是一次已完成的请求,不是其他提示词的平均值或预测值。为自己的应用制定预算时,应记录有代表性的任务所报告的用量,并检查每个结果是否满足任务要求。
流式输出会改变 Token 价格吗?
流式输出改变的是回答的传输方式。估算仍使用已完成请求的输入、缓存输入和输出用量。请保留最终用量信息,不要把每个文本片段当成单独计费的请求。
在 SeedRouter 的 Grok 4.7 验证中,Chat 和 Responses 的流式与非流式请求均已完成,并计入缓存输入。这验证的是用量计算,并不意味着两次分别生成的回答会消耗完全相同数量的 Token。
如何比较两个提示词的费用?
保持任务和验收标准一致。记录每次尝试的输入总量、缓存输入、输出,以及回答是否可用。比较获得合格结果的总花费,其中也应计入那些虽然生成成功、但因回答不符合要求而需要重试的费用。
对于长对话,先确认缩短历史后仍能正确回答,再删除无关历史。对于重复上下文,检查缓存 Token 计数;仅仅重复文本不能证明命中了缓存。对于推理较多的任务,应比较实际输出用量,而不是只统计回答中显示的字数。
价格常见问题
官方标出的基础费率就是我在 SeedRouter 支付的价格吗?
在 SeedRouter 上,请使用上方实时价格表。官方起始价格可作为参考背景,而服务当前的输入长度档位和 Token 费率决定了估算结果。
需要把 reasoning_tokens 加到 output_tokens 上吗?
不需要。在上方展示的 Responses 用量中,推理已经包含在输出总量内。推理明细用于理解模型完成的工作,不应作为第二笔输出费用。
重复提示词一定能享受缓存输入折扣吗?
不能保证。请使用响应报告的缓存 Token 数量,仅对该部分应用缓存输入费率,其余部分按普通输入费率计算。
在哪里查看最终费用?
用量记录会显示已完成请求的费用。进行新的估算时,请刷新 Grok 4.7 价格区块,并使用该请求报告的用量。返回错误的请求不收费。
来源
- SpaceXAI API:Grok 模型与价格,核对于 2026 年 10 月 10 日。
- Grok 4.7 发布介绍,2026 年 9 月 21 日。



