Claude Opus 5.5 já está disponível no SeedRouter
LogoSeedRouter

Busque modelos pelo nome, ex.: 'nano banana'

Busque modelos pelo nome, ex.: 'nano banana'

Preços do Grok 4.7: entrada em cache, raciocínio e custo por requisição

Entenda os preços do Grok 4.7, a entrada em cache e o raciocínio. Estime custos com as tarifas atuais sem contar os tokens em cache duas vezes.

Ler em Markdown

Os preços do Grok 4.7 dependem dos tokens de entrada, da entrada em cache e do consumo de saída. As tarifas iniciais oficiais são de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. Essas tarifas de referência descrevem o preço de tabela do modelo; para estimar uma requisição SeedRouter, use a tabela de preços atuais da SeedRouter abaixo.[1]

O tamanho visível da resposta é apenas uma parte do cálculo. Uma resposta curta pode incluir tokens adicionais de raciocínio, enquanto um prompt longo pode conter entrada em cache. A página do modelo Grok 4.7 reúne o Playground e os preços atuais.

Quanto custa o Grok 4.7?

O anúncio oficial apresenta as tarifas de entrada e saída acima como preços iniciais do Grok 4.7. Também descreve uma variante fast separada, com preço diferente. Este guia aborda o modelo grok-4.7; o preço de uma variante com nome parecido não é intercambiável com o dele.[2]

Para uma requisição feita pela SeedRouter, use estas tarifas atuais de tokens:

Os preços estão temporariamente indisponíveis. Tente novamente em breve.

Consulte as tarifas da faixa correspondente ao tamanho da entrada da requisição. Na SeedRouter, entradas abaixo de 200.000 tokens usam a faixa padrão; entradas de 200.000 tokens ou mais usam a faixa de contexto longo para toda a requisição. Entrada, entrada em cache e saída usam, cada uma, a faixa correspondente. Esse limite é uma divisão de preços, não uma reserva dessa quantidade de tokens.

Com service_tier: "priority" ou "fast", dobre as tarifas de tokens da faixa de tamanho de entrada selecionada. Esse multiplicador vale para a cobrança de tokens; as cobranças de ferramentas são calculadas separadamente.

A visão geral oficial da API informa uma janela de contexto de 500.000 tokens. Esse limite de capacidade não significa que toda requisição seja cobrada pela janela inteira.[1]

Quais campos de uso entram no cálculo?

Para a API Responses, guarde três valores do usage retornado:

Campo de usoComo utilizar
input_tokensEntrada total, incluindo a parte em cache
input_tokens_details.cached_tokensParte da entrada cobrada pela tarifa de entrada em cache
output_tokensSaída total usada no cálculo de tokens

Subtraia os tokens em cache da entrada total antes de aplicar a tarifa de entrada comum. Caso contrário, os mesmos tokens em cache serão contados uma vez como entrada comum e outra como entrada em cache na sua estimativa.

Com tarifas expressas por milhão de tokens:

uncached input = input_tokens - cached_tokens

token cost = (
  uncached input × input rate
  + cached_tokens × cached-input rate
  + output_tokens × output rate
) / 1,000,000

Use as tarifas da tabela atual em cada termo. Selecione a faixa de tamanho da entrada pelo total de entrada, antes de subtrair os tokens em cache. Uma estimativa de tokens não inclui automaticamente cobranças separadas de ferramentas; uma requisição que usa uma ferramenta de busca paga precisa considerar esse uso também.

Por que uma resposta curta pode usar mais tokens de saída?

O raciocínio contribui para o consumo de saída mesmo quando a resposta final é breve. Por exemplo, uma requisição Responses do Grok 4.7 concluída e verificada em 10 de outubro de 2026 retornou:

{
  "input_tokens": 3340,
  "input_tokens_details": { "cached_tokens": 1152 },
  "output_tokens": 22,
  "output_tokens_details": { "reasoning_tokens": 21 },
  "total_tokens": 3362
}

Essa requisição contém 2.188 tokens de entrada sem cache, 1.152 tokens de entrada em cache e 22 tokens de saída. Seus 21 tokens de raciocínio são um detalhamento do total de saída. Somá-los novamente transformaria 22 em 43 e superestimaria a cobrança de saída.

Esses números descrevem uma requisição concluída, não uma média ou previsão para outros prompts. Para planejar o orçamento da sua aplicação, registre o uso informado em tarefas representativas e verifique se cada resultado atende aos requisitos da tarefa.

O streaming muda o preço dos tokens?

O streaming muda a forma como a resposta chega. A estimativa continua usando a entrada, a entrada em cache e a saída da requisição concluída. Preserve as informações finais de uso em vez de tratar cada fragmento de texto como uma requisição cobrável separada.

Na verificação do Grok 4.7 feita pela SeedRouter, requisições Chat e Responses, com e sem streaming, foram concluídas com contabilização da entrada em cache. Isso verifica o cálculo de uso; não significa que duas respostas geradas separadamente consumam exatamente o mesmo número de tokens.

Como comparar o custo de dois prompts?

Mantenha a tarefa e os critérios de aceitação iguais. Registre a entrada total, a entrada em cache, a saída e se a resposta foi útil em cada tentativa. Compare o gasto total para obter um resultado aceitável, incluindo gerações bem-sucedidas que você precisou repetir porque as respostas eram inadequadas.

Em uma conversa longa, remova o histórico irrelevante apenas depois de confirmar que a versão mais curta continua respondendo corretamente. Para contextos repetidos, confira a contagem de tokens em cache; repetir texto, por si só, não comprova um acerto de cache. Para tarefas com muito raciocínio, compare o consumo real de saída em vez de contar apenas as palavras exibidas na resposta.

Dúvidas sobre preços

A tarifa oficial de referência é o preço que pago na SeedRouter?

Para a SeedRouter, use a tabela atualizada acima. O preço inicial oficial é uma referência útil, mas as faixas atuais de tamanho de entrada e as tarifas de tokens do serviço determinam a estimativa.

Devo somar reasoning_tokens a output_tokens?

Não. No uso de Responses mostrado acima, o raciocínio já está incluído na saída total. Use o detalhamento do raciocínio para entender o trabalho realizado, não como uma segunda cobrança de saída.

Repetir um prompt garante desconto na entrada em cache?

Não. Use a contagem de tokens em cache informada pela resposta. Aplique a tarifa de entrada em cache apenas a essa parte e a tarifa de entrada comum ao restante.

Onde posso conferir a cobrança final?

Seus registros de uso mostram a cobrança da requisição concluída. Para uma nova estimativa, atualize a seção de preços do Grok 4.7 e use o consumo informado para essa requisição. Requisições que retornam erro não são cobradas.

Fontes

  1. SpaceXAI API: modelos Grok e preços, verificado em 10 de outubro de 2026.
  2. Apresentação do Grok 4.7, 21 de setembro de 2026.

Guias relacionados