Claude Opus 5.5 已在 SeedRouter 上線

DeepSeek V4.1 Flash 規格:上下文視窗、最大輸出、參數量與預設值

DeepSeek V4.1 Flash 規格:552B 參數 MoE、1M token 上下文、384K 最大輸出、圖片輸入、思考模式,以及會讓回應被截斷的預設值。

以 Markdown 閱讀

DeepSeek V4.1 Flash 是一個 5520 億參數的混合專家(MoE)模型,上下文視窗為 1M tokens,每次請求最多輸出 393,216 個 token(384K)。它讀取文字與圖片、輸出文字,而且會先思考再回答,除非你關閉思考。DeepSeek 於 2026 年 9 月 10 日釋出這個模型。最多人踩到的規格是預設輸出上限,它遠低於最大值。

DeepSeek V4.1 Flash 規格一覽

規格數值
開發者DeepSeek
釋出日期2026 年 9 月 10 日
架構混合專家,因果編碼器–解碼器
總參數量552B
啟用參數輸入 8B,輸出 16B
上下文視窗1M tokens
最大輸出393,216 tokens(384K),含推理
預設輸出上限不開思考 8K,開思考 64K,max 強度下 128K
輸入文字與圖片
輸出文字
思考預設開啟,推理強度 high;可選 none、low、high 或 max
SeedRouter 上的模型 IDdeepseek-v4.1-flash
DeepSeek API 上的模型 IDdeepseek-flash

DeepSeek V4.1 Flash 有多大?

總參數量 5520 億。DeepSeek 的釋出說明描述的是「全新的因果編碼器–解碼器架構:輸入只啟用 8B 參數,輸出 16B」。每個 token 只會執行模型的一小部分,所以儘管規模很大,它的推論速度依然很快,服務成本也很低。

DeepSeek 也表示,它的 KV 快取所需的 HBM 只有上一代的「1/4」,SSD 儲存空間只有「1/8」。這對長時間的 Agent 工作階段很重要,因為這類工作階段的費用有很大一部分來自快取輸入。

DeepSeek V4.1 Flash 的上下文視窗是多少?

1M tokens。提示詞、圖片、對話紀錄和回應共用這個視窗。DeepSeek 的 API 參考是這樣說的:「輸入 token 與生成 token 的總長度受模型上下文長度的限制。」

關於各模型的上下文與輸出上限如何互相影響,請見上下文視窗與最大輸出 token。

DeepSeek V4.1 Flash 的最大輸出是多少?

每次請求 393,216 個 token,DeepSeek 標示為「MAXIMUM: 384K」。推理也計入其中。

問題在於預設值。如果不設定 max_tokens,DeepSeek 的參考文件說上限是「非思考模式 8K,思考模式 64K(reasoning_effort 設為 max 時為 128K)」。較長的回答或較長的推理過程,會在遠低於真正上限時就碰到這個預設值,回應會以 finish_reason: "length" 結束。

要取得更長的回應,請自行設定 max_tokens,範圍 1 到 393216:

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

你只為模型實際寫出的 token 付費,所以上限設得高本身並不會多花錢。

DeepSeek V4.1 Flash 能讀取圖片嗎?

可以。DeepSeek 稱它是一個「具備原生視覺理解能力」的模型。在 SeedRouter 上,圖片以 image_url 部分放在 user 訊息中,可以是公開 URL,也可以是 base64 data URI。URL 最長 8,192 個字元,指向的圖片最大 32 MiB。輸出一律是文字。

思考模式怎麼運作?

思考預設為開啟,推理強度為 high。你可以:

  • 用 "thinking": {"type": "disabled"} 或 "reasoning_effort": "none" 關閉它,以更少的輸出 token 快速取得回答;
  • 把 reasoning_effort 設為 low、high 或 max。

推理過程會在 reasoning_content 中回傳,和回答並列,並以輸出 token 計費。開啟思考時,temperature 沒有作用,低於 0.95 的 top_p 會以 0.95 執行。

可以用哪些 API 呼叫?

在 SeedRouter 上,DeepSeek V4.1 Flash 支援三種請求格式,使用同一把金鑰:

格式端點
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

三種格式都支援工具呼叫。Claude Code 使用 Anthropic 格式,Codex 使用 Responses 格式;Claude Code 與 Codex 設定教學中有實測過的設定。所有參數請見 DeepSeek V4.1 Flash API 參考。

如何計費?

按 token 計費,命中快取的輸入、未命中快取的輸入與輸出各有費率。離峰時段費率減半:尖峰時段為週一至週五 UTC 01:00–04:00 與 06:00–10:00,其餘時間都是離峰。DeepSeek V4.1 Flash 頁面顯示即時費率,價格指南有試算範例。

常見問題

DeepSeek V4.1 Flash 是開源的嗎?

DeepSeek 在 Hugging Face 上公開了權重;DeepSeek V4.1 Flash 免費嗎?說明了這對成本代表什麼。

deepseek-v4-flash 是同一個模型嗎?

在 DeepSeek 自家的 API 上,這個舊名稱現在會路由到 V4.1 Flash。DeepSeek 的價格頁寫道:「對應的模型已下架,其請求改由 DeepSeek-V4.1-Flash 模型處理」。V4.1 Flash vs V4 Flash 列出了有哪些改變。

為什麼 DeepSeek V4.1 Flash 在 8K token 就停了?

這是關閉思考時的預設輸出上限。把 max_tokens 設到最高 393216,即可允許更長的回應。

上下文視窗包含輸出嗎?

包含。輸入和輸出共用 1M token 的視窗。

它和 DeepSeek V4 Pro 相比如何?

DeepSeek 公布的基準測試顯示 V4.1 Flash 領先 V4 Pro,而且價格更低。請見 DeepSeek V4.1 Flash vs V4 Pro。

相關指南