Claude Opus 5.5 ya está disponible en SeedRouter

Especificaciones de DeepSeek V4.1 Flash: ventana de contexto, salida máxima, tamaño y valores por defecto

Especificaciones de DeepSeek V4.1 Flash: MoE de 552B parámetros, contexto de 1M tokens, salida máxima de 384K, imágenes, razonamiento y límites por defecto.

Leer en Markdown

DeepSeek V4.1 Flash es un modelo mixture-of-experts de 552.000 millones de parámetros con una ventana de contexto de 1M tokens y una salida máxima de 393.216 tokens (384K) por solicitud. Lee texto e imágenes, escribe texto y razona antes de responder, salvo que desactives el razonamiento. DeepSeek lo lanzó el 10 de septiembre de 2026. La especificación con la que más gente tropieza es el límite de salida por defecto, muy por debajo del máximo.

Especificaciones de DeepSeek V4.1 Flash de un vistazo

EspecificaciónValor
DesarrolladorDeepSeek
Lanzamiento10 de septiembre de 2026
ArquitecturaMixture of experts, Causal Encoder–Decoder
Parámetros totales552B
Parámetros activos8B para la entrada, 16B para la salida
Ventana de contexto1M tokens
Salida máxima393.216 tokens (384K), razonamiento incluido
Límite de salida por defecto8K sin razonamiento, 64K con razonamiento, 128K con esfuerzo max
EntradaTexto e imágenes
SalidaTexto
RazonamientoActivado por defecto con esfuerzo high; none, low, high o max
ID del modelo en SeedRouterdeepseek-v4.1-flash
ID del modelo en la API de DeepSeekdeepseek-flash

¿Qué tamaño tiene DeepSeek V4.1 Flash?

552.000 millones de parámetros en total. La nota de lanzamiento de DeepSeek describe una "nueva arquitectura Causal Encoder–Decoder: solo 8B parámetros activos para la entrada y 16B para la salida". Solo una pequeña parte del modelo se ejecuta en cada token, y por eso es rápido y barato de servir pese a su tamaño.

DeepSeek también dice que su caché KV necesita "1/4 de la HBM" y "1/8 del almacenamiento SSD" de la generación anterior. Eso importa en sesiones largas de agentes, donde la entrada en caché supone buena parte del coste.

¿Cuál es la ventana de contexto de DeepSeek V4.1 Flash?

1M tokens. El prompt, las imágenes, el historial de la conversación y la respuesta la comparten. La referencia de la API de DeepSeek lo dice así: "La longitud total de los tokens de entrada y de los tokens generados está limitada por la longitud de contexto del modelo".

Para ver cómo interactúan los límites de contexto y de salida en distintos modelos, consulta ventana de contexto vs tokens máximos de salida.

¿Cuál es la salida máxima de DeepSeek V4.1 Flash?

393.216 tokens por solicitud, que DeepSeek indica como "MAXIMUM: 384K". El razonamiento cuenta para ese límite.

El problema está en el valor por defecto. Si no fijas max_tokens, la referencia de DeepSeek dice que el límite es "8K en modo sin razonamiento, 64K en modo de razonamiento (128K con reasoning_effort en max)". Una respuesta larga o un razonamiento largo llegan a ese valor por defecto mucho antes que al techo real, y la respuesta termina con finish_reason: "length".

Para obtener respuestas más largas, fija tú mismo max_tokens, con cualquier valor de 1 a 393216:

{
  "model": "deepseek-v4.1-flash",
  "max_tokens": 200000,
  "messages": [{"role": "user", "content": "Write the full migration plan."}]
}

Solo pagas por los tokens que el modelo escribe, así que un límite alto no cuesta más por sí solo.

¿DeepSeek V4.1 Flash lee imágenes?

Sí. DeepSeek lo describe como un modelo "con comprensión visual nativa". En SeedRouter, las imágenes van en un mensaje de usuario como partes image_url, ya sea una URL pública o un data URI en base64. Una URL puede tener hasta 8.192 caracteres y apuntar a una imagen de hasta 32 MiB. La salida siempre es texto.

¿Cómo funcionan los modos de razonamiento?

El razonamiento está activado por defecto con esfuerzo high. Puedes:

  • desactivarlo con "thinking": {"type": "disabled"} o "reasoning_effort": "none", para respuestas rápidas con menos tokens de salida;
  • fijar reasoning_effort en low, high o max.

El razonamiento vuelve en reasoning_content, junto a la respuesta, y se factura como tokens de salida. Con el razonamiento activado, temperature no tiene efecto y los valores de top_p por debajo de 0.95 se ejecutan como 0.95.

¿Con qué API se puede llamar?

En SeedRouter, DeepSeek V4.1 Flash acepta tres formatos de solicitud con la misma clave:

FormatoEndpoint
OpenAI Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completions
OpenAI ResponsesPOST https://api.seedrouter.ai/v1/responses
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messages

Las llamadas a herramientas funcionan en los tres. El formato de Anthropic es el que usa Claude Code, y el formato Responses es el que usa Codex; la configuración para Claude Code y Codex tiene configuraciones probadas. Todos los parámetros están en la referencia de la API de DeepSeek V4.1 Flash.

¿Cuánto cuesta?

Por token, con tarifas distintas para la entrada que acierta en caché, la entrada que no acierta y la salida. Las tarifas se reducen a la mitad en horas valle: las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, y el resto de horas son horas valle. La página de DeepSeek V4.1 Flash muestra las tarifas actuales, y la guía de precios incluye ejemplos calculados.

Preguntas frecuentes

¿DeepSeek V4.1 Flash es de código abierto?

DeepSeek publica los pesos en Hugging Face; ¿DeepSeek V4.1 Flash es gratis? explica qué significa eso para el coste.

¿deepseek-v4-flash es el mismo modelo?

En la API de DeepSeek, el nombre antiguo ahora apunta a V4.1 Flash. La página de precios de DeepSeek dice que "los modelos correspondientes se han retirado y sus solicitudes las atiende el modelo DeepSeek-V4.1-Flash". V4.1 Flash vs V4 Flash resume qué cambió.

¿Por qué DeepSeek V4.1 Flash se detiene en 8K tokens?

Es el límite de salida por defecto con el razonamiento desactivado. Fija max_tokens hasta 393216 para permitir respuestas más largas.

¿La ventana de contexto incluye la salida?

Sí. La entrada y la salida comparten la ventana de 1M tokens.

¿Cómo se compara con DeepSeek V4 Pro?

DeepSeek indica que V4.1 Flash supera a V4 Pro en sus benchmarks, y cuesta menos. Consulta DeepSeek V4.1 Flash vs V4 Pro.

Guías relacionadas