DeepSeek V4.1 Flash: характеристики, контекстное окно, максимальный вывод, размер и значения по умолчанию
Характеристики DeepSeek V4.1 Flash: MoE на 552B параметров, контекст 1M токенов, вывод до 384K, изображения, режимы рассуждения и умолчания, обрезающие ответы.
Читать в MarkdownDeepSeek V4.1 Flash — модель со смесью экспертов (mixture of experts) на 552 миллиарда параметров с контекстным окном 1M токенов и максимальным выводом 393 216 токенов (384K) на запрос. Она читает текст и изображения, пишет текст и рассуждает перед ответом, если вы не отключите рассуждение. DeepSeek выпустила её 10 сентября 2026 года. Характеристика, на которой спотыкается большинство, — лимит вывода по умолчанию: он намного ниже максимума.
Характеристики DeepSeek V4.1 Flash кратко
| Характеристика | Значение |
|---|---|
| Разработчик | DeepSeek |
| Выпуск | 10 сентября 2026 года |
| Архитектура | Смесь экспертов, Causal Encoder–Decoder |
| Всего параметров | 552B |
| Активные параметры | 8B на входе, 16B на выходе |
| Контекстное окно | 1M токенов |
| Максимальный вывод | 393 216 токенов (384K), включая рассуждение |
| Лимит вывода по умолчанию | 8K без рассуждения, 64K с рассуждением, 128K на уровне max |
| Вход | Текст и изображения |
| Выход | Текст |
| Рассуждение | Включено по умолчанию на уровне high; none, low, high или max |
| ID модели в SeedRouter | deepseek-v4.1-flash |
| ID модели в API DeepSeek | deepseek-flash |
Насколько велика DeepSeek V4.1 Flash?
Всего 552 миллиарда параметров. В заметке о выпуске DeepSeek описывает «новую архитектуру Causal Encoder–Decoder: всего 8B активных параметров на входе и 16B на выходе». На каждый токен работает лишь небольшая часть модели, поэтому, несмотря на размер, её быстро и дёшево обслуживать.
DeepSeek также сообщает, что её KV-кэшу нужно «1/4 объёма HBM» и «1/8 хранилища SSD» по сравнению с предыдущим поколением. Это важно для долгих агентных сессий, где кэшированный вход составляет большую часть стоимости.
Какое контекстное окно у DeepSeek V4.1 Flash?
1M токенов. Промпт, изображения, история диалога и ответ делят его между собой. Справочник API DeepSeek формулирует это так: «Общая длина входных и сгенерированных токенов ограничена длиной контекста модели».
О том, как лимиты контекста и вывода соотносятся у разных моделей, читайте в статье контекстное окно и максимальное число выходных токенов.
Какой максимальный вывод у DeepSeek V4.1 Flash?
393 216 токенов на запрос; DeepSeek указывает это как «MAXIMUM: 384K» (максимум: 384K). Рассуждение входит в этот лимит.
Подвох — в значении по умолчанию. Если вы не задаёте max_tokens, справочник DeepSeek говорит, что лимит составляет «8K в режиме без рассуждения, 64K в режиме рассуждения (128K, если reasoning_effort равен max)». Длинный ответ или длинная цепочка рассуждений упирается в это значение задолго до настоящего потолка, и ответ заканчивается с finish_reason: "length".
Чтобы получать более длинные ответы, задайте max_tokens сами, в диапазоне от 1 до 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}Вы платите только за токены, которые пишет модель, поэтому высокий лимит сам по себе не стоит дороже.
Читает ли DeepSeek V4.1 Flash изображения?
Да. DeepSeek называет её моделью «с нативным визуальным пониманием». В SeedRouter изображения передаются в сообщении пользователя как части image_url: публичный URL или data URI в base64. URL может быть длиной до 8 192 символов и указывать на изображение размером до 32 МиБ. Выход всегда текстовый.
Как работают режимы рассуждения?
Рассуждение включено по умолчанию на уровне high. Вы можете:
- отключить его с помощью
"thinking": {"type": "disabled"}или"reasoning_effort": "none", чтобы получать быстрые ответы с меньшим числом выходных токенов; - задать
reasoning_effortравнымlow,highилиmax.
Рассуждение возвращается в reasoning_content рядом с ответом и тарифицируется как выходные токены. При включённом рассуждении temperature ни на что не влияет, а значения top_p ниже 0.95 работают как 0.95.
Через какие API её можно вызвать?
В SeedRouter DeepSeek V4.1 Flash принимает три формата запросов с одним и тем же ключом:
| Формат | Конечная точка |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
Вызовы инструментов работают во всех трёх. Формат Anthropic использует Claude Code, а формат Responses — Codex; в настройке Claude Code и Codex есть проверенные конфигурации. Все параметры перечислены в справочнике API DeepSeek V4.1 Flash.
Сколько она стоит?
Она тарифицируется по токенам, с отдельными ставками для входа, попадающего в кэш, входа, не попадающего в него, и выхода. Вне пиковых часов ставки вдвое ниже: пиковые часы — 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу, все остальные часы — непиковые. На странице DeepSeek V4.1 Flash показаны актуальные ставки, а в руководстве по ценам разобраны примеры.
Часто задаваемые вопросы
DeepSeek V4.1 Flash — это open source?
DeepSeek публикует веса на Hugging Face; в статье DeepSeek V4.1 Flash бесплатна? разобрано, что это означает для стоимости.
deepseek-v4-flash — это та же модель?
В собственном API DeepSeek старое имя теперь ведёт на V4.1 Flash. На странице цен DeepSeek сказано: «соответствующие модели выведены из эксплуатации, их запросы обслуживает модель DeepSeek-V4.1-Flash». В статье V4.1 Flash против V4 Flash перечислено, что изменилось.
Почему DeepSeek V4.1 Flash обрывает ответ на 8K токенов?
Это лимит вывода по умолчанию с отключённым рассуждением. Задайте max_tokens до 393216, чтобы разрешить более длинные ответы.
Входит ли вывод в контекстное окно?
Да. Вход и выход делят окно в 1M токенов.
Как она соотносится с DeepSeek V4 Pro?
По данным DeepSeek, V4.1 Flash опережает V4 Pro в её бенчмарках и стоит меньше. См. DeepSeek V4.1 Flash против V4 Pro.



