Grok 4.7 の料金:キャッシュ済み入力、推論、リクエスト費用
Grok 4.7 の料金、キャッシュ済み入力、推論の使用量を解説します。現在のトークン単価で、キャッシュの二重計算を避けてリクエスト費用を見積もれます。
Markdown で読むGrok 4.7 の料金は、入力トークン、キャッシュ済み入力、出力の使用量によって決まります。 公式の開始単価は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。これらはモデルの公表価格です。SeedRouter のリクエスト費用を見積もるときは、以下の SeedRouter の現在の料金表を使用してください。[1]
回答の見える長さは、計算の一部にすぎません。短い回答にも追加の推論トークンが含まれることがあり、長いプロンプトにはキャッシュ済み入力が含まれることがあります。Grok 4.7 のモデルページでは、Playground と現在の料金をまとめて確認できます。
Grok 4.7 の料金はいくらですか?
公式発表では、上記の入力と出力の単価を Grok 4.7 の開始価格として案内しています。また、料金の異なる別の fast バリアントも紹介しています。このガイドの対象は grok-4.7 モデルです。名称が似たバリアントの価格を、そのまま同じ見積もりに使うことはできません。[2]
SeedRouter 経由のリクエストでは、次の現在のトークン単価を使用します。
料金が一時的に利用できません。もう少しお待ちください。
リクエストの入力長に対応する料金帯を確認してください。SeedRouter では、入力が 200,000 トークン未満の場合は標準帯、200,000 トークン以上の場合はリクエスト全体に長コンテキスト帯を適用します。入力、キャッシュ済み入力、出力はそれぞれ該当する料金帯を使います。このしきい値は価格の境界であり、その数のトークンを予約するものではありません。
service_tier: "priority" または "fast" では、選択した入力長の料金帯のトークン単価を2倍にします。この倍率はトークン料金に適用されます。ツール料金は別途計算します。
公式 API 概要には、500,000 トークンのコンテキストウィンドウが記載されています。この能力上限は、すべてのリクエストでウィンドウ全体の料金が請求されることを意味しません。[1]
計算にはどの使用量フィールドを使いますか?
Responses API では、返された usage から次の3つの値を保持してください。
| 使用量フィールド | 使い方 |
|---|---|
input_tokens | 入力の合計です。キャッシュ済み部分を含みます |
input_tokens_details.cached_tokens | キャッシュ済み入力の単価を適用する入力部分です |
output_tokens | トークン料金の計算に使う出力の合計です |
通常の入力単価を適用する前に、入力合計からキャッシュ済みトークンを引きます。そうしないと、同じキャッシュ済みトークンを通常入力として1回、キャッシュ済み入力としてもう1回、見積もりに加算してしまいます。
単価を100万トークンあたりで表す場合は、次のように計算します。
uncached input = input_tokens - cached_tokens
token cost = (
uncached input × input rate
+ cached_tokens × cached-input rate
+ output_tokens × output rate
) / 1,000,000各項には現在の料金表の単価を使います。入力長の料金帯は、キャッシュ済みトークンを引く前の入力合計で選びます。トークンの見積もりに、別途発生するツール料金が自動的に含まれるわけではありません。有料の検索ツールを使うリクエストでは、その使用量も計算する必要があります。
短い回答でも出力トークンが増えるのはなぜですか?
最終的な回答が短くても、推論は出力使用量に含まれます。たとえば、2026年10月10日に検証した、完了済みの Grok 4.7 Responses リクエストの1つは、次の値を返しました。
{
"input_tokens": 3340,
"input_tokens_details": { "cached_tokens": 1152 },
"output_tokens": 22,
"output_tokens_details": { "reasoning_tokens": 21 },
"total_tokens": 3362
}このリクエストには、未キャッシュの入力 2,188 トークン、キャッシュ済み入力 1,152 トークン、出力 22 トークンが含まれています。21 の推論トークンは、出力合計の内訳です。もう一度加算すると 22 が 43 になり、出力料金を過大に見積もってしまいます。
これらの数値は、1つの完了済みリクエストを示すもので、別のプロンプトに対する平均や予測ではありません。自分のアプリケーションの予算を立てるには、代表的なタスクで報告される使用量を記録し、それぞれの結果が要件を満たすかを確認してください。
ストリーミングでトークン料金は変わりますか?
ストリーミングが変えるのは回答の届き方です。見積もりには、完了したリクエストの入力、キャッシュ済み入力、出力の使用量を引き続き使います。最終的な使用量情報を保持し、各テキスト断片を別々の課金対象リクエストとして扱わないでください。
SeedRouter の Grok 4.7 検証では、Chat と Responses のストリーミング、非ストリーミングの両方で、キャッシュ済み入力を計上してリクエストが完了しました。これは使用量の計算を確認したものであり、別々に生成した2つの回答が同じトークン数を消費するという意味ではありません。
2つのプロンプトの費用はどう比較しますか?
タスクと合格基準を同じにします。各試行について、入力合計、キャッシュ済み入力、出力、回答が利用可能だったかを記録してください。要件を満たす結果を得るまでの総費用を比較します。生成自体は成功しても、回答が不十分でやり直した分の費用も含めます。
長い会話では、履歴を短くしても正しく回答できることを確認してから、無関係な履歴を取り除きます。同じコンテキストを繰り返す場合は、キャッシュ済みトークン数を調べてください。テキストが同じというだけでは、キャッシュヒットの証拠にはなりません。推論の多いタスクでは、回答に表示された文字数だけでなく、実際の出力使用量を比較します。
料金に関するよくある質問
公式の基本単価が SeedRouter で支払う価格ですか?
SeedRouter では、上のリアルタイム料金表を使ってください。公式の開始価格は参考になりますが、見積もりはサービスの現在の入力長別料金帯とトークン単価で決まります。
reasoning_tokens を output_tokens に足す必要がありますか?
いいえ。上に示した Responses の使用量では、推論はすでに出力合計に含まれています。推論の内訳は実行された処理を理解するために使い、2回目の出力料金として計上しないでください。
同じプロンプトを繰り返せば、必ずキャッシュ済み入力の割引が適用されますか?
いいえ。レスポンスが報告するキャッシュ済みトークン数を使います。その部分だけにキャッシュ済み入力の単価を適用し、残りには通常の入力単価を適用してください。
最終的な料金はどこで確認できますか?
使用量記録に、完了したリクエストの料金が表示されます。新しく見積もるときは、Grok 4.7 の料金セクションを更新し、そのリクエストで報告された使用量を使ってください。エラーを返したリクエストには課金されません。
出典
- SpaceXAI API:Grok モデルと料金、2026年10月10日確認。
- Grok 4.7 の紹介、2026年9月21日。



