Claude Opus 5.5 já está disponível no SeedRouter
LogoSeedRouter

Busque modelos pelo nome, ex.: 'nano banana'

Busque modelos pelo nome, ex.: 'nano banana'

Preços do Claude Haiku 5.5: tokens, cache e o limiar de 100K

Entenda os preços por token do Claude Haiku 5.5, o limiar de entrada de 100K, escritas e leituras de cache e como estimar uma solicitação concluída.

Ler em Markdown

Os preços do Claude Haiku 5.5 dependem de onde você o chama e de quanto contexto a solicitação contém. A Anthropic publica tarifas distintas para prompts de até 100.000 tokens e prompts acima desse limiar. No SeedRouter, use a tabela atual abaixo para estimar uma solicitação; não substitua a tarifa exibida no seu aplicativo pela tabela de preços do fabricante.[1]

Este guia separa a estrutura oficial de preços, a contabilização de cache e os números de uso necessários para uma estimativa. A página do modelo Claude Haiku 5.5 inclui Playground e preços atuais. Se você está escolhendo entre modelos, comece pelo guia Haiku 5.5 versus Sonnet 5.5.

Quanto a Anthropic cobra pelo Claude Haiku 5.5?

A seguir estão os preços publicados pela Anthropic, consultados em 9 de outubro de 2026. Todos os valores são por milhão de tokens. Descrevem seu preço padrão por token, não as tarifas atuais cobradas pelo SeedRouter.[1]

Categoria de tokensPrompt de até 100K tokensPrompt acima de 100K tokens
Entrada$0,10$0,50
Saída$0,50$2,50
Escrita de cache de cinco minutos$0,125$0,625
Escrita de cache de uma hora$0,20$1,00
Leitura de cache$0,01$0,05

A tarifa de tokens de saída sozinha não descreve toda a solicitação. Uma resposta curta pode vir após um documento longo, e um documento repetido pode gerar uso de leitura de cache em vez de entrada inteiramente nova. Mantenha essas categorias separadas ao comparar cobranças.

O que muda no limiar de 100K?

A visão geral oficial atribui tarifas diferentes de entrada, saída e cache às duas faixas de tamanho de prompt. Ultrapassar o limiar, portanto, afeta mais do que o custo da entrada extra. Confira as regras de preços do serviço que você realmente usa e guarde o uso informado, especialmente quando a solicitação combina entrada nova e contexto em cache.[1]

O limiar não é o limite da janela de contexto. Haiku 5.5 tem janela de contexto de 1M tokens e saída máxima padrão de 128.000 tokens. Esses são limites de capacidade; não significam que cada chamada reserva ou cobra pela janela inteira. Um valor alto de max_tokens é um orçamento de saída, enquanto o uso retornado descreve o que o modelo consumiu.[1]

Uma verificação útil no aplicativo é comparar dois trabalhos reais: um apenas com os trechos relevantes e outro com o documento-fonte completo. Registre se a entrada mais curta ainda produz um resultado aceitável antes de tratar menos tokens como economia.

Como escritas e leituras de cache afetam a cobrança?

Uma escrita de cache cria um prefixo de prompt reutilizável; uma leitura reutiliza um prefixo. Haiku 5.5 exige um prompt mínimo de 512 tokens para cache. Adicionar controle de cache a um prompt mais curto não comprova que ele foi armazenado: confira cache_creation_input_tokens e cache_read_input_tokens na resposta.[2]

As durações de cinco minutos e uma hora têm tarifas de escrita diferentes. Mantenha o prefixo de maior duração antes de um de menor duração e use no máximo quatro pontos de cache. Instruções repetidas e materiais de referência são bons candidatos quando permanecem inalterados entre solicitações. Texto que muda frequentemente perto do início do prefixo reduz a oportunidade de reutilizá-lo.[2]

Para cada solicitação, mantenha entrada sem cache, criação de cache, leituras de cache e saída em colunas separadas. Não cobre os mesmos tokens de criação de cache duas vezes somando a contagem agregada de criação ao detalhamento de cinco minutos/uma hora. Use o detalhamento para dividir o total nas categorias apropriadas.

Quais são as tarifas atuais do SeedRouter?

Esta tabela lê as tarifas atuais. É a fonte de preços para uma solicitação feita pelo SeedRouter; as faixas oficiais de contexto acima são uma referência separada.

Claude Haiku 5.5

Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-haiku-5-5$0.35$1.75$0.035$0.4375unavailable

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.

A seção de preços da página do modelo usa as mesmas tarifas atuais em seus exemplos. Atualize a tabela antes de estimar uma nova carga de trabalho. Uma linha de preço ausente não comprova que o uso correspondente seja gratuito.

Como estimar uma solicitação concluída?

Para tarifas por milhão de tokens, multiplique cada categoria de uso pela tarifa correspondente e divida por um milhão. Some os resultados:

estimated cost = (
  uncached input tokens × input rate
  + output tokens × output rate
  + cache-read tokens × cache-read rate
  + five-minute cache-write tokens × five-minute write rate
  + one-hour cache-write tokens × one-hour write rate
) / 1,000,000

Tokens de pensamento fazem parte do uso de saída. Se uma resposta inclui um detalhamento de tokens de pensamento, não o some ao total de tokens de saída informado. O esforço de pensamento padrão é medium; mudar o esforço pode mudar a quantidade de raciocínio gerado, então compare tarefas concluídas em vez de presumir uma contagem idêntica em cada configuração.[3]

Para prever uma carga de trabalho, guarde um conjunto representativo de solicitações, seu uso e se o resultado passou nas suas verificações. Inclua novas tentativas causadas por respostas inadequadas. Uma resposta barata que exige uma segunda tentativa tem custo total diferente de uma primeira resposta aceitável. A referência da API explica os campos, motivos de parada e limites a registrar.

Perguntas sobre preços

O preço oficial de contexto curto é o que pago no SeedRouter?

Use a tabela atual do SeedRouter. A tabela publicada pela Anthropic descreve os preços dela; nomes de modelo iguais não comprovam cobranças iguais.

Definir max_tokens como 128000 cobra por todos esses tokens?

Isso define o orçamento máximo de saída. Estime uma solicitação concluída a partir do uso informado, incluindo pensamento, e confira o motivo de parada para saber se a saída atingiu esse limite.[1]

Um campo de controle de cache garante um acerto de cache?

Não. O prompt deve atender ao comprimento mínimo e corresponder a um prefixo em cache utilizável. A contagem de leitura de cache na resposta comprova que houve reutilização.[2]

Solicitações com falha são cobradas?

Solicitações que retornam erro não são cobradas. Uma resposta concluída sem erro que para no limite de saída ainda é uma geração concluída; confira seu uso e motivo de parada.

Fontes

  1. Anthropic: visão geral e preços do Claude Haiku 5.5.
  2. Anthropic: cache de prompts.
  3. Anthropic: novidades do Haiku 5.5.

Guias relacionados