Kimi K3 API の料金:100万トークンあたりの価格、キャッシュ、タスク単価
Kimi K3 API の 100万トークンあたりの料金:入力、出力、キャッシュ入力、5 分または 1 時間のキャッシュ書き込み。課金の計算式とタスク 1 件の費用も解説。
Markdown で読むKimi K3 はトークン単位で課金され、入力、出力、キャッシュ入力、キャッシュ書き込みにそれぞれ別の料金があります。料金はプロンプトの長さで変わりません。90万トークンのプロンプトも 900 トークンのプロンプトも、トークンあたりの料金は同じです。最も高いのは出力で、Kimi K3 は常に推論するため、推論トークンも支払う出力の一部になります。SeedRouter にはサブスクリプションがなく、失敗したリクエストには課金されません。
下の表はあなたのアカウントに課金する料金表から読み込んでいるので、今日のリクエスト 1 件の費用がそのまま表示されます。
Kimi K3 は 100万トークンあたりいくら?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
キャッシュ入力は、繰り返し使うプロンプトの先頭部分をキャッシュから読み込むときの料金です。2 つのキャッシュ書き込みの列は、先頭部分をキャッシュに書き込む料金で、キャッシュに残る時間によって分かれています。
Moonshot の公式価格は?
参考として、Moonshot AI 自身による Kimi K3 の料金体系を料金ページから示します。各項目は入力料金に対する倍率です。
| 項目 | 入力に対する倍率 |
|---|---|
| 入力(キャッシュミス) | 1× |
| キャッシュ入力(キャッシュヒット) | 0.1× |
| キャッシュ書き込み、5 分 TTL | 1× |
| キャッシュ書き込み、1 時間 TTL | 2× |
| 出力 | 5× |
上のリアルタイムの表には SeedRouter の各項目の料金が表示され、Kimi K3 のページではそれらを Moonshot の公式価格と並べて確認できます。
Kimi K3 のリクエストはどう課金される?
すべてのレスポンスは usage でトークン数を報告し、課金はそれに従います。
prompt_tokens:プロンプト全体。キャッシュから読んだ部分とキャッシュに書き込んだ部分を含みます。prompt_tokens_details.cached_tokens:キャッシュから読み込んだ部分。prompt_tokens_details.cache_write_tokens:キャッシュに書き込んだ部分。completion_tokens:回答と推論の合計。
料金は次のとおりです。
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000Kimi K3 のタスク 1 件はいくら?
タスクが読み書きするトークン数によって決まり、推論強度は出力側に大きく影響します。同じ短い質問で試したところ、low の出力トークンは 25、max は 146 で、同じプロンプトでも出力が 6 倍近くになりました。作業規模の例を 3 つ、トークン数で示します。
| タスク | 入力 | 出力 |
|---|---|---|
low の強度で短い質問 1 件 | 約 100 | 約 30 |
high の強度でファイル 1 つのコードレビュー | 約 5,000 | 約 1,500 |
| 大規模リポジトリでのエージェントの 1 ステップ | 約 200,000(大半がキャッシュ) | 約 3,000 |
それぞれに上のリアルタイム料金を掛けてください。出力はトークンあたり入力の 5 倍なので、推論と回答がたいてい請求額を左右します。同じリポジトリを何度も読むエージェントでは、キャッシュヒットで入力側が 10 分の 1 になります。
Kimi K3 の 1,000 トークンはいくら?
1,000 トークンの料金は、100万トークンあたりの料金を 1,000 で割った額です。Moonshot の目安では 1 トークンが英語で 3〜4 文字ほどなので、1,000 トークンは数千文字のテキストに相当します。キャッシュ入力の料金なら、新しい入力の 10 分の 1 です。
5 分と 1 時間、どちらのキャッシュを使うべき?
キャッシュは自動です。デフォルトでは書き込まれた先頭部分が 5 分間残り、ヒットするたびに延長されます。リクエストの間隔が空く場合は、prompt_cache_options.ttl を 1h に設定します。
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)1 時間の書き込みは入力料金の 2 倍、5 分の書き込みは 1 倍です。リクエストの間隔が 5 分を超える場合、1 時間以内に 3 回以上読み込まれる先頭部分は 1 時間 TTL のほうが安くなります。2× の書き込み 1 回と 0.1× のヒット 2 回(2.2×)に対し、5 分の書き込み 3 回(3×)です。
Kimi K3 をもっと安く使う方法は?
出力が請求額の大半を占めるので、推論強度を下げるのが最も効果的です。長く繰り返し使うコンテキストはプロンプトの先頭に置き、キャッシュから読み込まれるようにします。Kimi K3 の重みは公開されていますが、2.8 兆パラメータのモデルを自分で動かすにはデータセンター級のハードウェアが必要で、元が取れるのは非常に大量に使う場合だけです。
よくある質問
Kimi K3 は長いプロンプトほど高くなる?
いいえ。Kimi K3 はトークンあたり一律の料金で、長いコンテキスト向けの料金帯はありません。
Kimi K3 にサブスクリプションはある?
SeedRouter にはありません。残高をチャージし、トークン単位で支払います。Moonshot 自身の API もトークン単位の課金で、初回チャージ後に Kimi K3 が使えるようになります。
失敗したリクエストは課金される?
いいえ。エラーを返した Kimi K3 のリクエストには課金されません。
どうやって始めればいい?
Kimi K3 API ガイドで、キーの取得と最初の呼び出し方を説明しています。



