Claude Opus 5.5 が SeedRouter で利用できます

Kimi K3 のパラメータ数、コンテキストウィンドウ、最大出力トークン

Kimi K3 のスペック:2.8 兆パラメータ、トークンごとに 896 個中 16 個のエキスパートがアクティブ、100万トークンのコンテキスト、最大 1,048,576 トークンの出力。

Markdown で読む

Kimi K3 のパラメータ数は 2.8 兆で、トークンごとに 896 個のエキスパートのうち 16 個を使います。コンテキストウィンドウは 1,048,576 トークンで、1 回の回答は最大 1,048,576 トークンまで書けますが、デフォルトの上限は 131,072 です。Moonshot AI はこのモデルを「3 兆パラメータ級で世界初のオープンソースモデル」と呼び、重みをすべて公開しています。常に推論を行い、テキストと画像を読み込んでテキストを書きます。

Kimi K3 のスペック一覧

項目値
開発元Moonshot AI
総パラメータ数2.8 兆
エキスパート896 個、トークンごとに 16 個がアクティブ
アーキテクチャKimi Delta Attention と Attention Residuals を採用した Mixture of Experts
コンテキストウィンドウ1,048,576 トークン
最大出力1,048,576 トークン、推論を含む
デフォルトの出力上限131,072 トークン
推論常にオン。low、high、max(デフォルトは max)
入力テキストと画像(画像は base64 のみ)
出力テキスト
重みMoonshot AI が公開
SeedRouter でのモデル IDkimi-k3

Kimi K3 のパラメータ数は?

2.8 兆です。Moonshot AI のクイックスタートは Kimi K3 を「これまでで最も高性能なフラッグシップモデルで、2.8 兆パラメータを備える」と紹介し、「2.8 兆パラメータに到達した初のオープンソースモデル」としています。

Kimi K3 のアクティブパラメータ数は?

Moonshot AI のクイックスタートには、アクティブパラメータ数は記載されていません。書かれているのは、Stable LatentMoE フレームワークによってモデルが「896 個のエキスパートのうち 16 個を効率的にアクティブにする」ということです。つまり、各トークンの処理を担うのは 2.8 兆パラメータのごく一部で、トークンあたりの計算量が抑えられます。それでもすべての重みを読み込む必要があるため、Kimi K3 を自分で動かすにはマルチ GPU のデータセンター級ハードウェアが必要です。

Kimi K3 のアーキテクチャは?

2 つのアテンションの改良を土台にした Mixture of Experts モデルです。Moonshot AI の言葉では、「ハイブリッド線形アテンション機構である Kimi Delta Attention(KDA)と Attention Residuals の上に構築されています」。Moonshot AI によると、これらの改良に、よりスパースなエキスパート構成と新しい学習手法を組み合わせることで、Kimi K3 は「K2 の約 2.5 倍の総合的なスケーリング効率」を実現しています。詳細は Kimi K3 のテクニカルレポートで公開される予定です。

Kimi K3 のコンテキストウィンドウは?

1,048,576 トークンで、通常は 100万(1M)と表記されます。プロンプト、画像、会話履歴、回答がすべてこの 1 つのウィンドウを共有します。

Kimi K3 の最大出力は?

リクエストあたり最大 1,048,576 トークンで、max_completion_tokens で設定します。デフォルトは 131,072 です。Moonshot AI のクイックスタートにはこうあります。「max_completion_tokens のデフォルトは 131072 で、最大 1048576 まで設定できます。」

知っておくべき点が 2 つあります。

  • 推論は上限に含まれます。 Kimi K3 は常に推論を行い、推論トークンは回答と同じ予算を使います。
  • max_tokens は同じ上限の非推奨の名前です。 max_completion_tokens を使ってください。

回答が途中で切れる場合は、max_completion_tokens を上げるか、reasoning_effort を下げて思考に回る予算を減らします。各 API 形式で切れた回答を見分ける方法はコンテキストウィンドウと最大出力トークンで説明しています。

Kimi K3 の推論はオフにできる?

できません。Kimi K3 は常に推論を行います。reasoning_effort は low、high、max に設定でき、デフォルトの max は最も遅く、出力トークンも最も多く使います。ほとんどの作業には high、すばやく単純なステップには low が適しています。推論は content と並んで reasoning_content に返され、出力トークンとして課金されます。

固定されている設定は?

Moonshot AI は Kimi K3 のサンプリング設定を固定しています。temperature 1.0、top_p 0.95、n 1、presence_penalty 0、frequency_penalty 0 です。ほかの値を送るとエラーが返るので、これらのフィールドはリクエストに含めないでください。

Kimi K3 は画像を読める?

はい。ただし base64 の data URI のみです。公開画像の URL は受け付けられず、Kimi 自身の API と同様に 400 が返ります。出力は常にテキストです。

Kimi K3 はどう呼び出す?

SeedRouter では、Kimi K3 は同じキーとモデル ID kimi-k3 で、OpenAI Chat Completions、OpenAI Responses、Anthropic Messages の各形式に対応しています。最初のリクエストは Kimi K3 API ガイドで、動作確認済みの設定は Claude Code と Codex のセットアップで紹介しています。すべてのパラメータは Kimi K3 API リファレンスに記載しています。リアルタイムの料金は Kimi K3 のページで確認できます。

よくある質問

Kimi K3 の規模は?

総パラメータ数は 2.8 兆で、トークンごとに 896 個中 16 個のエキスパートがアクティブになります。

Kimi K3 はオープンソース?

Moonshot AI はモデルの重みをすべて公開しています。自分で動かすのに何が必要かは Kimi K3 は無料?で解説しています。

Kimi K3 が 131,072 トークンで止まるのはなぜ?

それがデフォルトの出力上限だからです。より長い回答が必要なら、max_completion_tokens を最大 1048576 まで設定してください。

Kimi K3 を開発しているのは?

Kimi アシスタントを提供する中国企業、Moonshot AI です。

関連ガイド