Claude Opus 5.5 ya está disponible en SeedRouter
LogoSeedRouter

Busca modelos por nombre, p. ej. 'nano banana'

Busca modelos por nombre, p. ej. 'nano banana'

Precios de Grok 4.7: entrada en caché, razonamiento y coste por solicitud

Entiende los precios de Grok 4.7, la entrada en caché y el razonamiento. Estima el coste con tarifas actuales sin contar dos veces los tokens en caché.

Leer en Markdown

Los precios de Grok 4.7 dependen de los tokens de entrada, la entrada en caché y el consumo de salida. Las tarifas iniciales oficiales son de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. Esas tarifas de referencia describen el precio de lista del modelo; para estimar una solicitud de SeedRouter, utiliza la tabla de precios actuales de SeedRouter que aparece a continuación.[1]

La longitud visible de la respuesta es solo una parte del cálculo. Una respuesta breve puede incluir tokens de razonamiento adicionales, mientras que un prompt largo puede contener entrada en caché. La página del modelo Grok 4.7 reúne el Playground y los precios actuales.

¿Cuánto cuesta Grok 4.7?

El anuncio oficial presenta las tarifas de entrada y salida anteriores como los precios iniciales de Grok 4.7. También describe una variante fast independiente con un precio distinto. Esta guía trata sobre el modelo grok-4.7; el precio de una variante con un nombre parecido no es intercambiable con el suyo.[2]

Para una solicitud realizada a través de SeedRouter, utiliza estas tarifas actuales de tokens:

Los precios no están disponibles temporalmente. Por favor vuelve a consultar pronto.

Consulta las tarifas del tramo correspondiente a la longitud de entrada de la solicitud. En SeedRouter, las entradas inferiores a 200.000 tokens usan el tramo estándar; las de 200.000 tokens o más usan el tramo de contexto largo para toda la solicitud. La entrada, la entrada en caché y la salida aplican cada una el tramo correspondiente. El umbral es un límite de precios, no una reserva de esa cantidad de tokens.

Con service_tier: "priority" o "fast", duplica las tarifas de tokens del tramo de longitud de entrada elegido. Este multiplicador se aplica a los cargos de tokens; los cargos de herramientas se calculan por separado.

La descripción oficial de la API indica una ventana de contexto de 500.000 tokens. Ese límite de capacidad no significa que todas las solicitudes se facturen por la ventana completa.[1]

¿Qué campos de uso se incluyen en el cálculo?

Para la API Responses, conserva tres valores del usage devuelto:

Campo de usoCómo utilizarlo
input_tokensEntrada total; incluye la parte en caché
input_tokens_details.cached_tokensParte de la entrada que se cobra a la tarifa de entrada en caché
output_tokensSalida total utilizada en el cálculo de tokens

Resta los tokens en caché de la entrada total antes de aplicar la tarifa de entrada normal. De lo contrario, en tu estimación cobrarías los mismos tokens en caché una vez como entrada normal y otra como entrada en caché.

Con las tarifas expresadas por millón de tokens:

uncached input = input_tokens - cached_tokens

token cost = (
  uncached input × input rate
  + cached_tokens × cached-input rate
  + output_tokens × output rate
) / 1,000,000

Usa las tarifas de la tabla actual para cada término. Elige el tramo de longitud de entrada según la entrada total antes de restar los tokens en caché. Una estimación de tokens no incluye automáticamente los cargos de herramientas separados; si una solicitud utiliza una herramienta de búsqueda de pago, también debes contabilizar ese uso.

¿Por qué una respuesta breve puede usar más tokens de salida?

El razonamiento contribuye al consumo de salida incluso cuando la respuesta final es breve. Por ejemplo, una solicitud Responses de Grok 4.7 completada y verificada el 10 de octubre de 2026 devolvió:

{
  "input_tokens": 3340,
  "input_tokens_details": { "cached_tokens": 1152 },
  "output_tokens": 22,
  "output_tokens_details": { "reasoning_tokens": 21 },
  "total_tokens": 3362
}

Esta solicitud contiene 2.188 tokens de entrada sin caché, 1.152 tokens de entrada en caché y 22 tokens de salida. Sus 21 tokens de razonamiento son un desglose del total de salida. Volver a sumarlos convertiría 22 en 43 y sobreestimaría el cargo de salida.

Estas cifras describen una solicitud completada, no un promedio ni una previsión para otros prompts. Para presupuestar tu propia aplicación, registra el uso informado en tareas representativas y comprueba si cada resultado cumple los requisitos de la tarea.

¿El streaming cambia el precio de los tokens?

El streaming cambia la forma en que llega la respuesta. La estimación sigue utilizando la entrada, la entrada en caché y la salida de la solicitud completada. Conserva la información final de uso en lugar de tratar cada fragmento de texto como una solicitud facturable independiente.

En la verificación de Grok 4.7 de SeedRouter, las solicitudes Chat y Responses, con y sin streaming, se completaron contabilizando la entrada en caché. Esto comprueba el cálculo del uso; no significa que dos respuestas generadas por separado consuman exactamente la misma cantidad de tokens.

¿Cómo comparo el coste de dos prompts?

Mantén la misma tarea y los mismos criterios de aceptación. Registra la entrada total, la entrada en caché, la salida y si la respuesta fue útil en cada intento. Compara el gasto total necesario para obtener un resultado aceptable, incluidas las generaciones completadas con éxito que tuviste que repetir porque sus respuestas eran insuficientes.

En una conversación larga, elimina el historial irrelevante solo después de comprobar que la versión más corta sigue respondiendo correctamente. Para contextos repetidos, revisa el número de tokens en caché; repetir texto no demuestra por sí solo un acierto de caché. En tareas con mucho razonamiento, compara el consumo real de salida en lugar de contar solo las palabras visibles en la respuesta.

Preguntas sobre precios

¿La tarifa oficial de referencia es el precio que pago en SeedRouter?

Para SeedRouter, usa la tabla actualizada de arriba. El precio inicial oficial es una referencia útil, pero los tramos actuales de longitud de entrada y las tarifas de tokens del servicio determinan la estimación.

¿Debo sumar reasoning_tokens a output_tokens?

No. En el uso de Responses mostrado arriba, el razonamiento ya está incluido en la salida total. Utiliza el desglose del razonamiento para entender el trabajo realizado, no como un segundo cargo de salida.

¿Repetir un prompt garantiza un descuento por entrada en caché?

No. Utiliza el número de tokens en caché indicado en la respuesta. Aplica la tarifa de entrada en caché solo a esa parte y la tarifa de entrada normal al resto.

¿Dónde puedo consultar el cargo final?

Tus registros de uso muestran el cargo de la solicitud completada. Para una nueva estimación, actualiza la sección de precios de Grok 4.7 y utiliza el uso informado para esa solicitud. Las solicitudes que devuelven un error no se cobran.

Fuentes

  1. SpaceXAI API: modelos Grok y precios, consultado el 10 de octubre de 2026.
  2. Presentación de Grok 4.7, 21 de septiembre de 2026.

Guías relacionadas