Precio de la API de DeepSeek V4.1 Flash: horas pico, horas valle y caché
Precio de la API de DeepSeek V4.1 Flash por millón de tokens: horas pico y valle, aciertos de caché, horarios, fórmula de facturación y coste por solicitud.
Leer en MarkdownDeepSeek V4.1 Flash se factura por token, y la tarifa depende de la hora. Las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes; cualquier otra hora, fines de semana incluidos, es horas valle a la mitad de la tarifa de horas pico. La entrada que acierta en la caché cuesta una pequeña fracción de la entrada nueva, y escribir en la caché no se cobra. En SeedRouter no hay suscripción, y una solicitud que falla no se cobra.
La tabla de abajo se lee de la tabla de tarifas que factura tu cuenta, así que muestra lo que cuesta una solicitud hoy.
¿Cuánto cuesta DeepSeek V4.1 Flash por millón de tokens?
DeepSeek V4.1 Flash
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
Las horas valle cubren 133 de las 168 horas de la semana: todo el sábado y el domingo, y cada hora de los días laborables fuera de las dos franjas de horas pico.
¿Cuáles son los precios de lista de DeepSeek?
Como referencia, esta es la estructura de los precios propios de DeepSeek para el modelo, según su página Models & Pricing. Cada línea es un múltiplo de la tarifa de entrada en horas pico:
| Línea | Horas pico | Horas valle |
|---|---|---|
| Entrada, fallo de caché | 1× | 0.5× |
| Entrada, acierto de caché | 0.02× | 0.01× |
| Salida | 4× | 2× |
La tabla en vivo de arriba muestra la tarifa de SeedRouter para cada línea, y la página de DeepSeek V4.1 Flash las muestra junto al precio de lista de DeepSeek. La tabla de DeepSeek también marca los festivos chinos como horas valle; SeedRouter aplica el horario de días laborables todas las semanas.
¿Cómo se factura una solicitud de DeepSeek V4.1 Flash?
Cada respuesta informa de sus recuentos de tokens en usage, y el cobro se basa en ellos:
prompt_cache_miss_tokens: tokens del prompt leídos de nuevo.prompt_cache_hit_tokens: tokens del prompt servidos desde la caché.completion_tokens: la respuesta más el razonamiento, cuando el pensamiento está activado.
El coste, a las tarifas de la hora en que se ejecuta la solicitud:
cost = ( cache-miss input × input rate
+ cache-hit input × cache-hit rate
+ completion × output rate ) / 1,000,000¿Cuánto cuesta una tarea de DeepSeek V4.1 Flash?
El pensamiento cambia sobre todo el lado de la salida. En nuestra prueba con la misma pregunta de conteo de números primos, el pensamiento desactivado usó 2 tokens de salida, el nivel low 258 y max 319. Tres perfiles de trabajo ilustrativos, en tokens:
| Tarea | Entrada | Salida |
|---|---|---|
| Una clasificación con el pensamiento desactivado | unos 150 | unos 10 |
Una revisión de código con nivel high | unos 5.000 | unos 1.500 |
| Un paso de agente sobre un repositorio grande | unos 200.000, casi todos aciertos de caché | unos 3.000 |
Multiplica cada uno por las tarifas en vivo de arriba, y divídelo entre dos en horas valle. La salida cuesta cuatro veces más que la entrada por token, así que el razonamiento y las respuestas suelen decidir la factura. Para un agente que vuelve a leer los mismos archivos, los aciertos de caché reducen el lado de la entrada a cerca del 2 % de la entrada nueva.
¿Cambió el precio de DeepSeek V4 Flash?
Dos veces en 2026. El 16 de agosto, DeepSeek pasó sus modelos V4 a precios de horas pico y horas valle, con las horas valle a la mitad de la tarifa de horas pico. El 10 de septiembre, cuando V4.1 Flash sustituyó a V4 Flash, su registro de cambios dice «API prices have been reduced accordingly». El cambio más reciente fue una bajada, y los nombres de modelo antiguos ahora se ejecutan en V4.1 Flash al precio de V4.1 Flash.
¿Cómo pagar menos por DeepSeek V4.1 Flash?
- Ejecuta el trabajo flexible en horas valle. Los procesos por lotes, las evaluaciones y los backfills cuestan la mitad fuera de las franjas de horas pico.
- Desactiva el pensamiento en los pasos sencillos. La clasificación y la extracción rara vez necesitan razonamiento, y el razonamiento es salida.
- Pon el contexto reutilizado al principio del prompt. La caché es automática y no requiere configuración; los prefijos repetidos se facturan a la tarifa de acierto de caché.
- Define
max_tokenspara que una respuesta larga no supere lo que pensabas pagar.
Preguntas frecuentes
¿Cuándo son las horas pico de DeepSeek V4.1 Flash?
De 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. Todo lo demás es horas valle.
¿Se cobra por escribir en la caché?
No. DeepSeek V4.1 Flash factura los fallos y los aciertos de caché; escribir en la caché no se factura aparte.
¿Hay una suscripción de DeepSeek V4.1 Flash?
No en SeedRouter. Recargas un saldo y pagas por token, sin plan ni cuota mensual.
¿Cómo empiezo?
La guía de la API de DeepSeek V4.1 Flash muestra cómo conseguir una clave y hacer la primera llamada.



