DeepSeek V4.1 Flash のスペック:コンテキストウィンドウ、最大出力、規模、デフォルト値
DeepSeek V4.1 Flash のスペック:552B パラメータの MoE、100万トークンのコンテキスト、384K の最大出力、画像入力、思考モード、回答を途中で切るデフォルト値。
Markdown で読むDeepSeek V4.1 Flash は 5520 億パラメータの Mixture of Experts(MoE)モデルで、コンテキストウィンドウは 100万トークン、リクエストあたりの最大出力は 393,216 トークン(384K)です。テキストと画像を読み込んでテキストを書き、思考をオフにしない限り回答の前に思考します。DeepSeek は 2026 年 9 月 10 日にリリースしました。多くの人がつまずくのはデフォルトの出力上限で、最大値よりはるかに低く設定されています。
DeepSeek V4.1 Flash のスペック一覧
| 項目 | 値 |
|---|---|
| 開発元 | DeepSeek |
| リリース | 2026 年 9 月 10 日 |
| アーキテクチャ | Mixture of Experts、Causal Encoder–Decoder |
| 総パラメータ数 | 552B |
| アクティブパラメータ | 入力 8B、出力 16B |
| コンテキストウィンドウ | 100万トークン |
| 最大出力 | 393,216 トークン(384K)、推論を含む |
| デフォルトの出力上限 | 思考なしで 8K、思考ありで 64K、max の強度で 128K |
| 入力 | テキストと画像 |
| 出力 | テキスト |
| 思考 | デフォルトでオン(推論強度 high)。none、low、high、max から選択 |
| SeedRouter でのモデル ID | deepseek-v4.1-flash |
| DeepSeek の API でのモデル ID | deepseek-flash |
DeepSeek V4.1 Flash の規模は?
総パラメータ数は 5520 億です。DeepSeek のリリースノートは「新しい Causal Encoder–Decoder アーキテクチャ:入力でアクティブになるのはわずか 8B パラメータ、出力で 16B」と説明しています。トークンごとに動くのはモデルのごく一部なので、規模のわりに高速で、低コストで提供できます。
DeepSeek によると、KV キャッシュに必要な HBM は前世代の「1/4」、SSD ストレージは「1/8」です。キャッシュされた入力がコストの大部分を占める長時間のエージェントセッションでは、これが効いてきます。
DeepSeek V4.1 Flash のコンテキストウィンドウは?
100万トークンです。プロンプト、画像、会話履歴、回答がこのウィンドウを共有します。DeepSeek の API リファレンスはこう述べています。「入力トークンと生成トークンの合計長は、モデルのコンテキスト長によって制限されます。」
コンテキストと出力の上限がモデルごとにどう関係するかは、コンテキストウィンドウと最大出力トークンを参照してください。
DeepSeek V4.1 Flash の最大出力は?
リクエストあたり 393,216 トークンで、DeepSeek は「MAXIMUM: 384K」と記載しています。推論もこれに含まれます。
注意すべきはデフォルト値です。max_tokens を設定しない場合、DeepSeek のリファレンスによると上限は「非思考モードで 8K、思考モードで 64K(reasoning_effort を max にした場合は 128K)」です。長い回答や長い推論は本来の上限よりずっと手前でこのデフォルトに達し、回答は finish_reason: "length" で終わります。
長い回答を得るには、max_tokens を 1〜393216 の範囲で自分で設定します。
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}支払うのはモデルが実際に書いたトークン分だけなので、上限を高くしてもそれだけで費用が増えることはありません。
DeepSeek V4.1 Flash は画像を読める?
はい。DeepSeek はこのモデルを「ネイティブな視覚理解を備えた」モデルと呼んでいます。SeedRouter では、画像は user メッセージ内の image_url パートとして、公開 URL または base64 の data URI で渡します。URL は最大 8,192 文字、画像は最大 32 MiB です。出力は常にテキストです。
思考モードの仕組みは?
思考はデフォルトでオンで、推論強度は high です。次のように変更できます。
"thinking": {"type": "disabled"}または"reasoning_effort": "none"でオフにすると、出力トークンを抑えて素早く回答します。reasoning_effortをlow、high、maxに設定します。
推論は回答と並んで reasoning_content に返され、出力トークンとして課金されます。思考がオンのときは temperature は効かず、0.95 未満の top_p は 0.95 として扱われます。
どの API で呼び出せる?
SeedRouter では、DeepSeek V4.1 Flash は同じキーで 3 つのリクエスト形式に対応しています。
| 形式 | エンドポイント |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
3 つともツール呼び出しに対応しています。Claude Code は Anthropic 形式、Codex は Responses 形式を使います。動作確認済みの設定は Claude Code と Codex のセットアップにあります。すべてのパラメータは DeepSeek V4.1 Flash API リファレンスに記載しています。
料金体系は?
トークン単位で、キャッシュにヒットした入力、キャッシュにヒットしなかった入力、出力にそれぞれ別の料金があります。オフピークは料金が半額になります。ピーク時間は月曜〜金曜の UTC 01:00–04:00 と 06:00–10:00 で、それ以外はすべてオフピークです。リアルタイムの料金は DeepSeek V4.1 Flash のページに、計算例は料金ガイドにあります。
よくある質問
DeepSeek V4.1 Flash はオープンソース?
DeepSeek は重みを Hugging Face で公開しています。それがコストにとって何を意味するかは DeepSeek V4.1 Flash は無料?で解説しています。
deepseek-v4-flash は同じモデル?
DeepSeek 自身の API では、この旧名は現在 V4.1 Flash にルーティングされます。DeepSeek の料金ページには「該当するモデルは提供を終了し、そのリクエストは DeepSeek-V4.1-Flash モデルが処理します」とあります。変更点は V4.1 Flash vs V4 Flash にまとめています。
DeepSeek V4.1 Flash が 8K トークンで止まるのはなぜ?
思考がオフのときのデフォルトの出力上限だからです。max_tokens を最大 393216 まで設定すれば、より長い回答を得られます。
コンテキストウィンドウには出力も含まれる?
はい。入力と出力は 100万トークンのウィンドウを共有します。
DeepSeek V4 Pro と比べると?
DeepSeek のベンチマークでは V4.1 Flash が V4 Pro を上回っており、料金も安くなっています。詳しくは DeepSeek V4.1 Flash vs V4 Pro をご覧ください。



