Precio de la API de Kimi K3: coste por millón de tokens, caché y por tarea
Precios de la API de Kimi K3 por millón de tokens: entrada, salida, entrada en caché y escrituras en caché de 5 min o 1 h, con la fórmula y el coste por tarea.
Leer en MarkdownKimi K3 se factura por token, con tarifas separadas para entrada, salida, entrada en caché y escrituras en caché. El precio no cambia con la longitud del prompt: un prompt de 900K tokens paga la misma tarifa por token que uno de 900 tokens. La salida es lo más caro, y Kimi K3 siempre razona, así que los tokens de razonamiento forman parte de la salida que pagas. En SeedRouter no hay suscripción, y una solicitud que falla no se cobra.
La tabla de abajo se lee de la tabla de tarifas que factura a tu cuenta, así que muestra lo que cuesta hoy una solicitud.
¿Cuánto cuesta Kimi K3 por millón de tokens?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
La entrada en caché es lo que cuesta un prefijo de prompt repetido cuando se lee desde la caché. Las dos columnas de escritura en caché son lo que cuesta escribir un prefijo en la caché, según cuánto tiempo permanece allí.
¿Cuáles son los precios de lista de Moonshot?
Como referencia, esta es la estructura de los precios de Moonshot AI para Kimi K3, según su página de precios. Cada línea es un múltiplo de la tarifa de entrada:
| Línea | Múltiplo de la entrada |
|---|---|
| Entrada (fallo de caché) | 1× |
| Entrada en caché (acierto de caché) | 0,1× |
| Escritura en caché, TTL de 5 minutos | 1× |
| Escritura en caché, TTL de 1 hora | 2× |
| Salida | 5× |
La tabla en vivo de arriba muestra la tarifa de SeedRouter para cada línea, y la página de Kimi K3 las muestra junto al precio de lista de Moonshot.
¿Cómo se factura una solicitud a Kimi K3?
Cada respuesta informa de sus tokens en usage, y el cobro sigue esas cifras:
prompt_tokens: el prompt completo, incluida cualquier parte leída desde la caché o escrita en ella.prompt_tokens_details.cached_tokens: la parte leída desde la caché.prompt_tokens_details.cache_write_tokens: la parte escrita en la caché.completion_tokens: la respuesta más el razonamiento.
El coste es:
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000¿Cuánto cuesta una tarea con Kimi K3?
Depende de cuántos tokens lea y escriba la tarea, y el esfuerzo cambia mucho el lado de la salida. En nuestra prueba con la misma pregunta corta, el esfuerzo low usó 25 tokens de salida y max usó 146, casi seis veces más salida para el mismo prompt. Tres tamaños de trabajo ilustrativos, en tokens:
| Tarea | Entrada | Salida |
|---|---|---|
Una pregunta corta con esfuerzo low | unos 100 | unos 30 |
Una revisión de código de un archivo con esfuerzo high | unos 5.000 | unos 1.500 |
| Un paso de agente sobre un repositorio grande | unos 200.000, casi todo en caché | unos 3.000 |
Multiplica cada una por las tarifas en vivo de arriba. La salida pesa cinco veces más que la entrada por token, así que el razonamiento y la respuesta suelen decidir la factura. Para un agente que relee el mismo repositorio, los aciertos de caché reducen el lado de la entrada a una décima parte.
¿Cuánto cuestan 1.000 tokens de Kimi K3?
Mil tokens cuestan la tarifa por millón dividida entre 1.000. Moonshot calcula unos 3 a 4 caracteres en inglés por token, así que 1.000 tokens son unos pocos miles de caracteres de texto. A la tarifa de entrada en caché cuestan una décima parte de una entrada nueva.
¿Uso la caché de 5 minutos o la de 1 hora?
El almacenamiento en caché es automático. Por defecto, un prefijo escrito permanece 5 minutos y cada acierto lo renueva. Fija prompt_cache_options.ttl en 1h cuando tus solicitudes estén espaciadas:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)La escritura de 1 hora cuesta el doble de la tarifa de entrada, frente a una vez para la escritura de 5 minutos. Si tus solicitudes llegan con más de cinco minutos de diferencia, un prefijo leído tres o más veces dentro de la hora sale más barato con el TTL de 1 hora: una escritura a 2× y dos aciertos a 0,1× (2,2×) frente a tres escrituras de 5 minutos (3×).
¿Hay una forma más barata de usar Kimi K3?
Bajar el esfuerzo es la palanca más grande, ya que la salida domina la factura. Pon el contexto largo y reutilizado al inicio del prompt para que se lea desde la caché. Los pesos de Kimi K3 son abiertos, pero con 2,8 billones de parámetros ejecutarlo por tu cuenta requiere hardware de centro de datos, que solo compensa con un volumen muy alto.
Preguntas frecuentes
¿Kimi K3 cobra más por los prompts largos?
No. Kimi K3 usa un precio fijo por token: no hay un tramo de contexto largo.
¿Hay una suscripción a Kimi K3?
En SeedRouter no. Recargas un saldo y pagas por token. La propia API de Moonshot también factura por token y solo desbloquea Kimi K3 tras una primera recarga.
¿Se cobran las solicitudes fallidas?
No. Una solicitud a Kimi K3 que devuelve un error no se cobra.
¿Cómo empiezo?
La guía de la API de Kimi K3 explica cómo conseguir una clave y hacer la primera llamada.



