Precios de Claude Haiku 5.5: tokens, caché y umbral de 100K
Conoce los precios de tokens de Claude Haiku 5.5, el umbral de entrada de 100K, las lecturas y escrituras de caché y cómo estimar una solicitud completada.
Leer en MarkdownLos precios de Claude Haiku 5.5 dependen de dónde lo uses y de cuánto contexto contenga la solicitud. Anthropic publica tarifas distintas para prompts de hasta 100.000 tokens y para los que superan ese umbral. En SeedRouter, usa la tabla actual que aparece abajo para estimar una solicitud; no sustituyas la tarifa que muestra tu aplicación por la tabla del fabricante.[1]
Esta guía separa la estructura oficial de precios, la contabilidad de caché y los datos de uso necesarios para una estimación. La página de Claude Haiku 5.5 incluye Playground y precios actuales. Si estás eligiendo entre modelos, empieza por la guía de Haiku 5.5 frente a Sonnet 5.5.
¿Cuánto cobra Anthropic por Claude Haiku 5.5?
Estos son los precios publicados por Anthropic, revisados el 9 de octubre de 2026. Todos los importes son por millón de tokens. Describen sus precios estándar de tokens, no las tarifas actuales cobradas por SeedRouter.[1]
| Categoría de tokens | Prompt de hasta 100K tokens | Prompt de más de 100K tokens |
|---|---|---|
| Entrada | $0,10 | $0,50 |
| Salida | $0,50 | $2,50 |
| Escritura de caché de cinco minutos | $0,125 | $0,625 |
| Escritura de caché de una hora | $0,20 | $1,00 |
| Lectura de caché | $0,01 | $0,05 |
La tarifa de tokens de salida por sí sola no describe toda la solicitud. Una respuesta breve puede seguir a un documento largo, y un documento repetido puede generar uso de lectura de caché en lugar de entrada totalmente nueva. Mantén esas categorías separadas al comparar facturas.
¿Qué cambia en el umbral de 100K?
La descripción oficial asigna tarifas distintas de entrada, salida y caché a los dos intervalos de tamaño del prompt. Por tanto, superar el umbral afecta a más que el coste de la entrada adicional. Comprueba las reglas de precios del servicio que realmente usas y conserva el uso que declare, especialmente si una solicitud combina entrada nueva y contexto en caché.[1]
El umbral no es el límite de la ventana de contexto. Haiku 5.5 tiene una ventana de 1M tokens y una salida máxima estándar de 128.000 tokens. Son máximos de capacidad; no significan que cada llamada reserve o facture toda la ventana. Un valor grande de max_tokens es un presupuesto de salida, mientras que el uso devuelto describe lo que consumió el modelo.[1]
Una comprobación útil consiste en comparar dos trabajos reales: uno con solo los fragmentos relevantes y otro con el documento fuente completo. Registra si la entrada más corta sigue produciendo un resultado aceptable antes de considerar que menos tokens suponen un ahorro.
¿Cómo afectan las escrituras y lecturas de caché a la factura?
Una escritura de caché crea un prefijo de prompt reutilizable; una lectura lo reutiliza. El prompt mínimo de Haiku 5.5 que se puede guardar en caché es de 512 tokens. Añadir control de caché a uno más corto no demuestra que se haya almacenado: examina cache_creation_input_tokens y cache_read_input_tokens en la respuesta.[2]
Las duraciones de cinco minutos y una hora tienen tarifas de escritura distintas. Mantén el prefijo de mayor duración antes del de menor duración y usa como máximo cuatro puntos de corte de caché. Las instrucciones repetidas y el material de referencia son candidatos útiles si permanecen intactos entre solicitudes. Cambiar a menudo el texto al principio del prefijo reduce las oportunidades de reutilizarlo.[2]
Para cada solicitud, separa en columnas la entrada sin caché, la creación de caché, las lecturas y la salida. No cuentes dos veces los mismos tokens de creación sumando tanto el total como su desglose de cinco minutos/una hora. Usa el desglose para repartir el total entre las categorías correspondientes.
¿Cuáles son las tarifas actuales de SeedRouter?
Esta tabla consulta las tarifas actuales. Es la fuente de precios para una solicitud hecha mediante SeedRouter; los niveles oficiales de contexto anteriores son una referencia distinta.
Claude Haiku 5.5
Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.
| Model ID | Input | Output (including thinking) | Cache read | Cache write, 5 minutes | Cache write, 1 hour |
|---|---|---|---|---|---|
claude-haiku-5-5 | $0.35 | $1.75 | $0.035 | $0.4375 | unavailable |
Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.
La sección de precios del modelo usa las mismas tarifas actuales en sus ejemplos. Actualiza la tabla antes de estimar una nueva carga de trabajo. Que falte una línea de precio no demuestra que ese uso sea gratis.
¿Cómo puedo estimar una solicitud completada?
Para tarifas de tokens expresadas por millón, multiplica cada categoría de uso por su tarifa y divide entre un millón. Suma los resultados:
estimated cost = (
uncached input tokens × input rate
+ output tokens × output rate
+ cache-read tokens × cache-read rate
+ five-minute cache-write tokens × five-minute write rate
+ one-hour cache-write tokens × one-hour write rate
) / 1,000,000Los tokens de pensamiento forman parte del uso de salida. Si una respuesta incluye un desglose de pensamiento, no lo sumes al total de tokens de salida declarado. El esfuerzo de pensamiento predeterminado es medium; cambiarlo puede cambiar la cantidad de razonamiento generado, así que compara tareas completadas en lugar de asumir el mismo número de tokens en cada ajuste.[3]
Para prever una carga de trabajo, conserva un conjunto representativo de solicitudes, su uso y si el resultado superó tus comprobaciones. Incluye los reintentos por respuestas insuficientes. Una respuesta barata que requiere un segundo intento tiene un coste total distinto al de una primera respuesta aceptable. La referencia API explica los campos, motivos de parada y límites que debes registrar.
Preguntas sobre precios
¿El precio oficial de contexto corto es lo que pago en SeedRouter?
Usa la tabla actual para SeedRouter. La tabla de Anthropic describe sus propios precios; que los nombres de modelo coincidan no demuestra que los cargos coincidan.
¿Configurar max_tokens en 128000 cobra todos esos tokens?
Establece el presupuesto máximo de salida. Estima una solicitud completada a partir del uso declarado, incluido el pensamiento, y examina el motivo de parada para ver si la salida alcanzó el límite.[1]
¿Un campo de control de caché garantiza un acierto de caché?
No. El prompt debe cumplir la longitud mínima y coincidir con un prefijo utilizable en caché. El conteo de lectura de caché de la respuesta demuestra que hubo reutilización.[2]
¿Se cobran las solicitudes fallidas?
Las solicitudes que devuelven un error no se cobran. Una respuesta completada sin errores que se detiene en el límite de salida sigue siendo una generación completada; examina su uso y motivo de parada.



