DeepSeek V4.1 Flash
DeepSeek V4.1 Flash を公式の Chat Completions、Responses、Anthropic Messages API で呼び出せます。100万トークンのコンテキスト、思考のオン・オフ切り替え、画像入力に対応。
DeepSeek V4.1 Flash は、DeepSeek の高速・低コストなモデルです(DeepSeek 自身の API では deepseek-flash と呼ばれます)。デフォルトでは回答の前に思考し、リクエストごとに思考をオフにしたり推論強度を設定したりできます。公式の DeepSeek リクエストを SeedRouter に送信します: ベース URL と API キーを変更し、ボディはそのままにします。
モデル ID
| モデル ID | コンテキストウィンドウ | 最大出力 | 推論強度 | デフォルト |
|---|---|---|---|---|
deepseek-v4.1-flash | 100万トークン | 384Kトークン(393,216) | none、low、high、max | 思考オン、high |
入力: テキストと画像。出力: テキスト。現在の料金はモデルページをご確認ください。
クイックサンプル
curl https://api.seedrouter.ai/v1/chat/completions \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash",
"messages": [{"role": "user", "content": "Give me three names for a coffee shop."}]
}'エンドポイント
| フォーマット | メソッドとパス | 認証 |
|---|---|---|
| Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> または Authorization: Bearer <key>、加えて anthropic-version |
3 つのエンドポイントはいずれも、ストリーミングの有無にかかわらず DeepSeek の公式レスポンスフォーマットを返します。API キーはサーバー側のコードに保管してください。
パラメータ
Chat Completions のフィールド:
| 名前 | 型 | 必須 | デフォルト | 説明 |
|---|---|---|---|---|
model | string | はい | — | deepseek-v4.1-flash。 |
messages | object[] | はい | — | テキストメッセージ。画像は image_url パートとして渡します(画像入力を参照)。 |
thinking.type | enum | いいえ | enabled | enabled または disabled。 |
reasoning_effort | enum | いいえ | high | none(思考オフ)、low、high、max。minimal は low、medium と xhigh は high として実行されます。 |
max_tokens | integer | いいえ | 8K、思考ありの場合は 64K(推論強度 max では 128K) | 1~393216。推論を含みます。 |
stop | string or string[] | いいえ | — | 停止シーケンス。 |
response_format | object | いいえ | {"type": "text"} | text または json_object。json_schema は 400 を返します。 |
tools | object[] | いいえ | — | 関数ツール。strict は受け付けられます。 |
tool_choice | string or object | いいえ | ツールなしでは none、ツールありでは auto | auto と none が適用されます。required と関数の指定は受け付けられますが、呼び出しは強制されません。 |
stream | boolean | いいえ | false | サーバー送信イベントとしてストリーミングします。 |
stream_options.include_usage | boolean | いいえ | false | すべてのチャンクに usage が含まれ、最後以外は null です。 |
temperature | number | いいえ | 1 | 0~2。思考モードでは効果がありません。 |
top_p | number | いいえ | 1 | 0~1。思考モードでは 0.95 未満の値は 0.95 として実行されます。思考なしでは 1 のままです。 |
user_id | string | いいえ | — | エンドユーザーの識別子。 |
logprobs、top_logprobs | — | いいえ | — | 受け付けられます(top_logprobs は 0~20)が、対数確率は返されません。 |
frequency_penalty、presence_penalty | — | いいえ | — | DeepSeek により非推奨: 受け付けられますが効果はありません。 |
思考と推論強度
思考はデフォルトでオンになっており、推論強度は high です。"thinking": {"type": "disabled"} または "reasoning_effort": "none" でオフにできます。その場合、回答はすぐに返され、出力トークンも少なくなります。max は難しい問題に最も多くの推論を費やします。推論は content と並んで reasoning_content に返され、出力トークンとして請求されます。
リクエストに tools が含まれる場合は、それまでの assistant メッセージをすべて reasoning_content とともに送り返してください。これは DeepSeek がツール呼び出しの会話で求めている要件です。
画像入力
画像は、ユーザーメッセージの content に image_url パートとして入れます。公開された http(s) URL または base64 data URI のいずれかを使用できます:
{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}},
{"type": "text", "text": "What does this chart show?"}
]}URL は最大 8192 文字で、最大 32 MiB の画像を指している必要があります。例の URL を、公開アクセス可能な独自の画像に置き換えてください。
請求ディメンション
モデルページの現在のレートをご覧ください。リクエストは使用するトークンで請求されます:
- キャッシュミスした入力トークン(
prompt_cache_miss_tokens)、 - キャッシュヒットした入力トークン(
prompt_cache_hit_tokens)、 - 出力トークン(推論を含む)。
レートはリクエストが実行される時間によって変わります。ピーク時間帯は UTC の月曜日から金曜日の 01:00~04:00 と 06:00~10:00 です。それ以外のすべての時間(週末を含む)はオフピーク時間帯で、ピーク時のレートの半額になります。請求は完成したレスポンスで報告された usage から差し引かれます。失敗したリクエストは請求されません。アカウントの使用記録にすべてのリクエストの正確な請求額が表示されます。
出力
非ストリーミングの Chat Completions リクエストは次を返します:
{
"id": "bc86988e-...",
"object": "chat.completion",
"created": 1790585983,
"model": "deepseek-v4.1-flash",
"choices": [{
"index": 0,
"finish_reason": "stop",
"logprobs": null,
"message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
}],
"usage": {
"prompt_tokens": 36,
"completion_tokens": 39,
"total_tokens": 75,
"prompt_cache_hit_tokens": 0,
"prompt_cache_miss_tokens": 36,
"prompt_tokens_details": {"cached_tokens": 0},
"completion_tokens_details": {"reasoning_tokens": 0}
}
}"stream": true の場合、各チャンクには reasoning_content または content を含む delta が入り、data: [DONE] の前の最後のチャンクで使用量が返されます。
Responses API と Codex
POST /v1/responses は Responses のボディを受け付けます: input、instructions、max_output_tokens、reasoning.effort(値は上記の reasoning_effort と同じ)、text.format(text または json_object。json_schema は受け付けられますが強制されません)、tools(function と apply_patch カスタムツール)、tool_choice、temperature、top_p、top_logprobs、user、stream。推論は reasoning_text コンテンツを持つ reasoning アイテムとして返され、ストリームには response.created から response.completed までの番号付きイベントが流れ、推論は response.reasoning_text.delta イベントに含まれます。この API はステートレスです: previous_response_id、conversation、および web_search などの組み込みツールは無視されるため、会話全体を input で送信してください。
Codex で DeepSeek V4.1 Flash を使うには、~/.codex/config.toml に provider を追加し、SEEDROUTER_API_KEY を設定します:
model = "deepseek-v4.1-flash"
model_provider = "seedrouter"
show_raw_agent_reasoning = true
[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"Anthropic Messages フォーマット
Anthropic Messages API 向けに書かれたコードからも DeepSeek V4.1 Flash を呼び出せます: "model": "deepseek-v4.1-flash" を指定して Messages ボディを /v1/messages に送信します。system、max_tokens、tools、tool_choice(auto、none)、thinking(enabled、disabled)、temperature(0~2)が適用され、output_config.effort と metadata.user_id は受け付けられます。top_k、stop_sequences、tool_choice any は効果がありません。推論は thinking ブロックとして返されます。画像は base64 または url ソースとして渡します。
エラー
エラーは {"error": {"code": ..., "message": "..."}} を使用します(Messages エンドポイントは Anthropic のエラー形式を使用します)。code は共通エラーカタログのコードです。失敗したリクエストは請求されません。
ヒント
- 分類や抽出など、シンプルで高速な処理では思考をオフにし、推論、数学、コードでは思考をオンのままにします。
- 長く再利用されるコンテキストはプロンプトの先頭に置いてください: キャッシュされた入力は入力レートのごく一部で請求されます。
- 大規模なバッチジョブは、すべてのレートが半額になるオフピーク時間帯に実行します。
