DeepSeek V4.1 Flash 规格:上下文窗口、最大输出、参数量与默认值
DeepSeek V4.1 Flash 规格:552B 参数 MoE、1M token 上下文、384K 最大输出、图片输入、思考模式,以及会让回复被截断的默认值。
以 Markdown 阅读DeepSeek V4.1 Flash 是一个 5520 亿参数的混合专家(MoE)模型,上下文窗口为 1M tokens,每次请求最多输出 393,216 个 token(384K)。它读取文本和图片、输出文本,并且会先思考再回答,除非你关闭思考。DeepSeek 于 2026 年 9 月 10 日发布了它。最容易让人踩坑的规格是默认输出上限,它远低于最大值。
DeepSeek V4.1 Flash 规格一览
| 规格 | 数值 |
|---|---|
| 开发者 | DeepSeek |
| 发布日期 | 2026 年 9 月 10 日 |
| 架构 | 混合专家,因果编码器–解码器 |
| 总参数量 | 552B |
| 激活参数 | 输入 8B,输出 16B |
| 上下文窗口 | 1M tokens |
| 最大输出 | 393,216 tokens(384K),含推理 |
| 默认输出上限 | 不开思考 8K,开思考 64K,max 强度下 128K |
| 输入 | 文本和图片 |
| 输出 | 文本 |
| 思考 | 默认开启,推理强度 high;可选 none、low、high 或 max |
| SeedRouter 上的模型 ID | deepseek-v4.1-flash |
| DeepSeek API 上的模型 ID | deepseek-flash |
DeepSeek V4.1 Flash 有多大?
总参数量 5520 亿。DeepSeek 的发布说明描述的是“全新的因果编码器–解码器架构:输入只激活 8B 参数,输出 16B”。每个 token 只运行模型的一小部分,所以尽管规模很大,它的推理速度依然很快、服务成本也很低。
DeepSeek 还表示,它的 KV 缓存所需的 HBM 只有上一代的“1/4”,SSD 存储只有“1/8”。这对长时间的 Agent 会话很重要,因为这类会话的费用有很大一部分来自缓存输入。
DeepSeek V4.1 Flash 的上下文窗口是多少?
1M tokens。提示、图片、对话历史和回复共用这个窗口。DeepSeek 的 API 参考是这样说的:“输入 token 与生成 token 的总长度受模型上下文长度的限制。”
关于各模型的上下文与输出上限如何相互影响,见上下文窗口与最大输出 token。
DeepSeek V4.1 Flash 的最大输出是多少?
每次请求 393,216 个 token,DeepSeek 标注为“MAXIMUM: 384K”。推理也计入其中。
问题在于默认值。如果不设置 max_tokens,DeepSeek 的参考文档说上限是“非思考模式 8K,思考模式 64K(reasoning_effort 设为 max 时为 128K)”。较长的回答或较长的推理过程会远在真正的上限之前触到这个默认值,回复会以 finish_reason: "length" 结束。
要得到更长的回复,请自己设置 max_tokens,取值 1 到 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}你只为模型实际写出的 token 付费,所以上限设得高本身并不会多花钱。
DeepSeek V4.1 Flash 能读图片吗?
能。DeepSeek 称它是一个“具备原生视觉理解能力”的模型。在 SeedRouter 上,图片以 image_url 部分放在 user 消息中,可以是公开 URL,也可以是 base64 data URI。URL 最长 8,192 个字符,指向的图片最大 32 MiB。输出始终是文本。
思考模式怎么用?
思考默认开启,推理强度为 high。你可以:
- 用
"thinking": {"type": "disabled"}或"reasoning_effort": "none"关闭它,以更少的输出 token 快速得到回答; - 把
reasoning_effort设为low、high或max。
推理过程在 reasoning_content 中返回,与回答并列,并按输出 token 计费。开启思考时,temperature 不起作用,低于 0.95 的 top_p 按 0.95 执行。
可以用哪些 API 调用?
在 SeedRouter 上,DeepSeek V4.1 Flash 支持三种请求格式,使用同一个 key:
| 格式 | 端点 |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
三种格式都支持工具调用。Claude Code 使用 Anthropic 格式,Codex 使用 Responses 格式;Claude Code 和 Codex 配置教程里有经过测试的配置。全部参数见 DeepSeek V4.1 Flash API 参考。
怎么计费?
按 token 计费,命中缓存的输入、未命中缓存的输入和输出各有费率。非高峰时段费率减半:高峰时段为周一至周五 UTC 01:00–04:00 和 06:00–10:00,其余时间都是非高峰。DeepSeek V4.1 Flash 页面显示实时费率,价格指南有计算示例。
常见问题
DeepSeek V4.1 Flash 开源吗?
DeepSeek 在 Hugging Face 上公开了权重;DeepSeek V4.1 Flash 免费吗?介绍了这对成本意味着什么。
deepseek-v4-flash 是同一个模型吗?
在 DeepSeek 自己的 API 上,这个旧名称现在会路由到 V4.1 Flash。DeepSeek 的价格页写道:“对应的模型已下线,其请求由 DeepSeek-V4.1-Flash 模型处理”。V4.1 Flash vs V4 Flash 列出了有哪些变化。
为什么 DeepSeek V4.1 Flash 在 8K token 处停止?
这是关闭思考时的默认输出上限。把 max_tokens 设到最高 393216,即可允许更长的回复。
上下文窗口包含输出吗?
包含。输入和输出共用 1M token 的窗口。
它和 DeepSeek V4 Pro 相比怎么样?
DeepSeek 公布的基准测试显示 V4.1 Flash 领先 V4 Pro,而且价格更低。见 DeepSeek V4.1 Flash vs V4 Pro。



