DeepSeek V4.1 Flash 스펙: 컨텍스트 윈도우, 최대 출력, 크기와 기본값
DeepSeek V4.1 Flash 스펙: 552B 파라미터 MoE, 1M 토큰 컨텍스트, 384K 최대 출력, 이미지 입력, 사고 모드, 답변을 중간에 끊는 기본값까지 정리했습니다.
Markdown으로 읽기DeepSeek V4.1 Flash는 총 5,520억 개 파라미터의 전문가 혼합(MoE) 모델로, 1M 토큰 컨텍스트 윈도우와 요청당 최대 393,216 토큰(384K)의 출력을 지원합니다. 텍스트와 이미지를 읽고 텍스트를 쓰며, 사고를 끄지 않는 한 답하기 전에 먼저 사고합니다. DeepSeek는 2026년 9월 10일에 이 모델을 출시했습니다. 가장 많은 사람이 걸려 넘어지는 스펙은 기본 출력 한도로, 최대값보다 훨씬 낮습니다.
DeepSeek V4.1 Flash 스펙 한눈에 보기
| 스펙 | 값 |
|---|---|
| 개발사 | DeepSeek |
| 출시일 | 2026년 9월 10일 |
| 아키텍처 | 전문가 혼합(MoE), Causal Encoder–Decoder |
| 총 파라미터 | 552B |
| 활성 파라미터 | 입력 8B, 출력 16B |
| 컨텍스트 윈도우 | 1M 토큰 |
| 최대 출력 | 393,216 토큰(384K), 추론 포함 |
| 기본 출력 한도 | 사고 끔 8K, 사고 켬 64K, max 강도 128K |
| 입력 | 텍스트와 이미지 |
| 출력 | 텍스트 |
| 사고 | 기본으로 high 강도에서 켜짐; none, low, high, max |
| SeedRouter 모델 ID | deepseek-v4.1-flash |
| DeepSeek API 모델 ID | deepseek-flash |
DeepSeek V4.1 Flash의 크기는 얼마나 되나요?
총 5,520억 개 파라미터입니다. DeepSeek의 릴리스 노트는 이를 "새로운 Causal Encoder–Decoder 아키텍처: 활성 파라미터는 입력 8B, 출력 16B에 불과"하다고 설명합니다. 토큰마다 모델의 작은 일부만 실행되므로, 크기에 비해 빠르고 저렴하게 서비스할 수 있습니다.
DeepSeek는 KV 캐시가 이전 세대 대비 "HBM은 1/4", "SSD 저장 공간은 1/8"만 필요하다고도 밝혔습니다. 캐시된 입력이 비용의 큰 부분을 차지하는 긴 에이전트 세션에서 중요한 점입니다.
DeepSeek V4.1 Flash 컨텍스트 윈도우는 얼마인가요?
1M 토큰입니다. 프롬프트, 이미지, 대화 기록, 응답이 모두 이 윈도우를 공유합니다. DeepSeek의 API 레퍼런스는 이렇게 설명합니다. "입력 토큰과 생성된 토큰의 총 길이는 모델의 컨텍스트 길이로 제한됩니다."
여러 모델에서 컨텍스트 한도와 출력 한도가 어떻게 맞물리는지는 컨텍스트 윈도우와 최대 출력 토큰의 차이를 참고하세요.
DeepSeek V4.1 Flash 최대 출력은 얼마인가요?
요청당 393,216 토큰이며, DeepSeek는 이를 "MAXIMUM: 384K"로 표기합니다. 추론도 이 한도에 포함됩니다.
함정은 기본값입니다. max_tokens를 지정하지 않으면 DeepSeek 레퍼런스에 따라 한도는 "비사고 모드에서 8K, 사고 모드에서 64K(reasoning_effort를 max로 설정하면 128K)"입니다. 긴 답변이나 긴 추론 과정은 실제 상한보다 훨씬 앞서 이 기본값에 걸리고, 응답은 finish_reason: "length"로 끝납니다.
더 긴 응답을 받으려면 max_tokens를 1에서 393216 사이로 직접 설정하세요.
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}비용은 모델이 실제로 쓴 토큰에 대해서만 지불하므로, 한도를 높게 잡는 것만으로 비용이 늘지는 않습니다.
DeepSeek V4.1 Flash는 이미지를 읽을 수 있나요?
네. DeepSeek는 이 모델을 "네이티브 시각 이해 능력을 갖춘" 모델이라고 부릅니다. SeedRouter에서는 이미지를 사용자 메시지 안의 image_url 파트로 보내며, 공개 URL이나 base64 data URI 모두 쓸 수 있습니다. URL은 최대 8,192자까지, 가리키는 이미지는 최대 32 MiB까지 가능합니다. 출력은 항상 텍스트입니다.
사고 모드는 어떻게 작동하나요?
사고는 기본으로 high 강도에서 켜져 있습니다. 다음과 같이 조정할 수 있습니다.
"thinking": {"type": "disabled"}또는"reasoning_effort": "none"으로 끄면 출력 토큰이 줄고 답이 빨라집니다.reasoning_effort를low,high,max중 하나로 설정합니다.
추론은 답변과 함께 reasoning_content에 반환되며 출력 토큰으로 과금됩니다. 사고가 켜져 있으면 temperature는 효과가 없고, 0.95 미만의 top_p 값은 0.95로 실행됩니다.
어떤 API로 호출할 수 있나요?
SeedRouter에서 DeepSeek V4.1 Flash는 같은 키로 세 가지 요청 형식을 받습니다.
| 형식 | 엔드포인트 |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
세 형식 모두 도구 호출을 지원합니다. Claude Code는 Anthropic 형식을, Codex는 Responses 형식을 사용합니다. 테스트를 거친 설정은 Claude Code와 Codex 설정 가이드에 있습니다. 모든 파라미터는 DeepSeek V4.1 Flash API 레퍼런스에 정리되어 있습니다.
요금은 어떻게 책정되나요?
토큰당 과금이며, 캐시 히트 입력, 캐시 미스 입력, 출력에 각각 다른 요금이 적용됩니다. 오프피크 시간대에는 요금이 절반입니다. 피크 시간대는 월요일부터 금요일까지 UTC 01:00–04:00과 06:00–10:00이고, 나머지 시간은 모두 오프피크입니다. 실시간 요금은 DeepSeek V4.1 Flash 페이지에서, 계산 예시는 요금 가이드에서 확인할 수 있습니다.
자주 묻는 질문
DeepSeek V4.1 Flash는 오픈소스인가요?
DeepSeek는 가중치를 Hugging Face에 공개합니다. 이것이 비용 면에서 무엇을 뜻하는지는 DeepSeek V4.1 Flash는 무료인가요?에서 다룹니다.
deepseek-v4-flash는 같은 모델인가요?
DeepSeek 자체 API에서는 이 기존 이름이 이제 V4.1 Flash로 연결됩니다. DeepSeek 요금 페이지에는 "해당 모델은 지원이 종료되었으며, 요청은 DeepSeek-V4.1-Flash 모델이 처리합니다"라고 적혀 있습니다. 달라진 점은 V4.1 Flash vs V4 Flash에 정리했습니다.
DeepSeek V4.1 Flash가 8K 토큰에서 멈추는 이유는 무엇인가요?
사고를 끈 상태의 기본 출력 한도이기 때문입니다. 더 긴 응답이 필요하면 max_tokens를 최대 393216까지 설정하세요.
컨텍스트 윈도우에 출력도 포함되나요?
네. 입력과 출력이 1M 토큰 윈도우를 함께 사용합니다.
DeepSeek V4 Pro와 비교하면 어떤가요?
DeepSeek는 자체 벤치마크에서 V4.1 Flash가 V4 Pro를 앞선다고 보고하며, 가격도 더 저렴합니다. DeepSeek V4.1 Flash vs V4 Pro를 참고하세요.



