DeepSeek V4.1 Flash 規格:上下文視窗、最大輸出、參數量與預設值
DeepSeek V4.1 Flash 規格:552B 參數 MoE、1M token 上下文、384K 最大輸出、圖片輸入、思考模式,以及會讓回應被截斷的預設值。
以 Markdown 閱讀DeepSeek V4.1 Flash 是一個 5520 億參數的混合專家(MoE)模型,上下文視窗為 1M tokens,每次請求最多輸出 393,216 個 token(384K)。它讀取文字與圖片、輸出文字,而且會先思考再回答,除非你關閉思考。DeepSeek 於 2026 年 9 月 10 日釋出這個模型。最多人踩到的規格是預設輸出上限,它遠低於最大值。
DeepSeek V4.1 Flash 規格一覽
| 規格 | 數值 |
|---|---|
| 開發者 | DeepSeek |
| 釋出日期 | 2026 年 9 月 10 日 |
| 架構 | 混合專家,因果編碼器–解碼器 |
| 總參數量 | 552B |
| 啟用參數 | 輸入 8B,輸出 16B |
| 上下文視窗 | 1M tokens |
| 最大輸出 | 393,216 tokens(384K),含推理 |
| 預設輸出上限 | 不開思考 8K,開思考 64K,max 強度下 128K |
| 輸入 | 文字與圖片 |
| 輸出 | 文字 |
| 思考 | 預設開啟,推理強度 high;可選 none、low、high 或 max |
| SeedRouter 上的模型 ID | deepseek-v4.1-flash |
| DeepSeek API 上的模型 ID | deepseek-flash |
DeepSeek V4.1 Flash 有多大?
總參數量 5520 億。DeepSeek 的釋出說明描述的是「全新的因果編碼器–解碼器架構:輸入只啟用 8B 參數,輸出 16B」。每個 token 只會執行模型的一小部分,所以儘管規模很大,它的推論速度依然很快,服務成本也很低。
DeepSeek 也表示,它的 KV 快取所需的 HBM 只有上一代的「1/4」,SSD 儲存空間只有「1/8」。這對長時間的 Agent 工作階段很重要,因為這類工作階段的費用有很大一部分來自快取輸入。
DeepSeek V4.1 Flash 的上下文視窗是多少?
1M tokens。提示詞、圖片、對話紀錄和回應共用這個視窗。DeepSeek 的 API 參考是這樣說的:「輸入 token 與生成 token 的總長度受模型上下文長度的限制。」
關於各模型的上下文與輸出上限如何互相影響,請見上下文視窗與最大輸出 token。
DeepSeek V4.1 Flash 的最大輸出是多少?
每次請求 393,216 個 token,DeepSeek 標示為「MAXIMUM: 384K」。推理也計入其中。
問題在於預設值。如果不設定 max_tokens,DeepSeek 的參考文件說上限是「非思考模式 8K,思考模式 64K(reasoning_effort 設為 max 時為 128K)」。較長的回答或較長的推理過程,會在遠低於真正上限時就碰到這個預設值,回應會以 finish_reason: "length" 結束。
要取得更長的回應,請自行設定 max_tokens,範圍 1 到 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}你只為模型實際寫出的 token 付費,所以上限設得高本身並不會多花錢。
DeepSeek V4.1 Flash 能讀取圖片嗎?
可以。DeepSeek 稱它是一個「具備原生視覺理解能力」的模型。在 SeedRouter 上,圖片以 image_url 部分放在 user 訊息中,可以是公開 URL,也可以是 base64 data URI。URL 最長 8,192 個字元,指向的圖片最大 32 MiB。輸出一律是文字。
思考模式怎麼運作?
思考預設為開啟,推理強度為 high。你可以:
- 用
"thinking": {"type": "disabled"}或"reasoning_effort": "none"關閉它,以更少的輸出 token 快速取得回答; - 把
reasoning_effort設為low、high或max。
推理過程會在 reasoning_content 中回傳,和回答並列,並以輸出 token 計費。開啟思考時,temperature 沒有作用,低於 0.95 的 top_p 會以 0.95 執行。
可以用哪些 API 呼叫?
在 SeedRouter 上,DeepSeek V4.1 Flash 支援三種請求格式,使用同一把金鑰:
| 格式 | 端點 |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
三種格式都支援工具呼叫。Claude Code 使用 Anthropic 格式,Codex 使用 Responses 格式;Claude Code 與 Codex 設定教學中有實測過的設定。所有參數請見 DeepSeek V4.1 Flash API 參考。
如何計費?
按 token 計費,命中快取的輸入、未命中快取的輸入與輸出各有費率。離峰時段費率減半:尖峰時段為週一至週五 UTC 01:00–04:00 與 06:00–10:00,其餘時間都是離峰。DeepSeek V4.1 Flash 頁面顯示即時費率,價格指南有試算範例。
常見問題
DeepSeek V4.1 Flash 是開源的嗎?
DeepSeek 在 Hugging Face 上公開了權重;DeepSeek V4.1 Flash 免費嗎?說明了這對成本代表什麼。
deepseek-v4-flash 是同一個模型嗎?
在 DeepSeek 自家的 API 上,這個舊名稱現在會路由到 V4.1 Flash。DeepSeek 的價格頁寫道:「對應的模型已下架,其請求改由 DeepSeek-V4.1-Flash 模型處理」。V4.1 Flash vs V4 Flash 列出了有哪些改變。
為什麼 DeepSeek V4.1 Flash 在 8K token 就停了?
這是關閉思考時的預設輸出上限。把 max_tokens 設到最高 393216,即可允許更長的回應。
上下文視窗包含輸出嗎?
包含。輸入和輸出共用 1M token 的視窗。
它和 DeepSeek V4 Pro 相比如何?
DeepSeek 公布的基準測試顯示 V4.1 Flash 領先 V4 Pro,而且價格更低。請見 DeepSeek V4.1 Flash vs V4 Pro。



