Claude Opus 5.5 ist auf SeedRouter verfügbar
LogoSeedRouter

Modelle nach Namen suchen, z. B. „nano banana“

Modelle nach Namen suchen, z. B. „nano banana“

Claude Haiku 5.5 Preise: Token, Caching und die 100K-Schwelle

Verstehen Sie Claude Haiku 5.5 Tokenpreise, die 100K-Eingabeschwelle, Cache-Schreib- und Lesevorgänge sowie die Kostenschätzung abgeschlossener Anfragen.

Als Markdown lesen

Die Preise für Claude Haiku 5.5 hängen davon ab, wo Sie das Modell aufrufen und wie viel Kontext die Anfrage enthält. Anthropic veröffentlicht getrennte Tarife für Prompts mit bis zu 100.000 Token und Prompts oberhalb dieser Schwelle. Nutzen Sie auf SeedRouter die aktuelle Tabelle unten zur Kostenschätzung einer Anfrage; ersetzen Sie den in Ihrer Anwendung angezeigten Tarif nicht durch eine Preistabelle des Herstellers.[1]

Dieser Leitfaden unterscheidet zwischen offizieller Preisstruktur, Cache-Abrechnung und den für eine Schätzung benötigten Nutzungszahlen. Die Modellseite zu Claude Haiku 5.5 enthält einen Playground und aktuelle Preise. Beginnen Sie bei der Modellwahl mit dem Vergleich von Haiku 5.5 und Sonnet 5.5.

Was berechnet Anthropic für Claude Haiku 5.5?

Die folgenden Angaben sind Anthropics veröffentlichte Preise, geprüft am 9. Oktober 2026. Alle Beträge gelten pro Million Token. Sie beschreiben dessen Standard-Tokenpreise, nicht die aktuellen Tarife von SeedRouter.[1]

TokenkategoriePrompt bis 100K TokenPrompt über 100K Token
Eingabe$0,10$0,50
Ausgabe$0,50$2,50
Cache schreiben, fünf Minuten$0,125$0,625
Cache schreiben, eine Stunde$0,20$1,00
Cache lesen$0,01$0,05

Ein Ausgabe-Tokenpreis allein beschreibt nicht die gesamte Anfrage. Auf ein langes Dokument kann eine kurze Antwort folgen, und ein wiederholtes Dokument kann Cache-Lesen statt vollständig neuer Eingaben verursachen. Halten Sie diese Kategorien beim Rechnungsvergleich getrennt.

Was ändert sich an der 100K-Schwelle?

Die offizielle Übersicht ordnet den beiden Prompt-Größenbereichen unterschiedliche Eingabe-, Ausgabe- und Cache-Tarife zu. Das Überschreiten der Schwelle beeinflusst deshalb mehr als nur die Kosten der zusätzlichen Eingabe. Prüfen Sie die Preisregeln des tatsächlich verwendeten Dienstes und bewahren Sie dessen gemeldete Nutzung auf, insbesondere wenn eine Anfrage neue Eingabe mit gecachtem Kontext kombiniert.[1]

Die Schwelle ist nicht das Kontextfensterlimit. Haiku 5.5 hat ein Kontextfenster von 1 Mio. Token und eine reguläre maximale Ausgabe von 128.000 Token. Das sind Funktionsobergrenzen; sie bedeuten nicht, dass jeder Aufruf das gesamte Fenster reserviert oder abrechnet. Ein hoher max_tokens-Wert ist ein Ausgabebudget, während die zurückgegebenen Nutzungswerte den tatsächlichen Verbrauch beschreiben.[1]

Eine sinnvolle Anwendungsprüfung vergleicht zwei reale Aufträge: einen nur mit den relevanten Auszügen und einen mit dem vollständigen Quelldokument. Prüfen Sie, ob die kürzere Eingabe weiterhin ein akzeptables Ergebnis liefert, bevor Sie weniger Token als Ersparnis betrachten.

Wie wirken sich Cache-Schreiben und -Lesen auf die Rechnung aus?

Ein Cache-Schreibvorgang erstellt ein wiederverwendbares Prompt-Präfix; ein Cache-Lesevorgang verwendet es erneut. Haiku 5.5 benötigt für cachefähige Prompts mindestens 512 Token. Cache-Steuerung bei einem kürzeren Prompt beweist nicht, dass er gecacht wurde: Prüfen Sie cache_creation_input_tokens und cache_read_input_tokens in der Antwort.[2]

Für fünf Minuten und eine Stunde Gültigkeit gelten unterschiedliche Schreibpreise. Platzieren Sie das länger gültige Präfix vor dem kürzer gültigen und nutzen Sie höchstens vier Cache-Trennpunkte. Wiederholte Anweisungen und Referenzmaterial eignen sich, wenn sie über mehrere Anfragen unverändert bleiben. Häufige Textänderungen am Anfang des Präfixes verringern die Wiederverwendungsmöglichkeiten.[2]

Erfassen Sie für jede Anfrage ungecachte Eingabe, Cache-Erstellung, Cache-Lesen und Ausgabe in getrennten Spalten. Berechnen Sie dieselben Cache-Erstellungs-Token nicht zweimal, indem Sie sowohl die Gesamterstellungszahl als auch deren Fünf-Minuten-/Ein-Stunden-Aufteilung addieren. Verwenden Sie die Aufteilung, um die Gesamtsumme den passenden Kategorien zuzuordnen.

Wie hoch sind die aktuellen SeedRouter-Tarife?

Diese Tabelle liest aktuelle Tarife aus. Sie ist die Preisquelle für Anfragen über SeedRouter; die offiziellen Kontextstufen oben dienen als separate Referenz.

Claude Haiku 5.5

Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-haiku-5-5$0.35$1.75$0.035$0.4375unavailable

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.

Der Preisbereich der Modellseite nutzt dieselben aktuellen Tarife für seine Beispiele. Aktualisieren Sie die Tabelle vor der Schätzung einer neuen Arbeitslast. Eine fehlende Preiszeile belegt nicht, dass die entsprechende Nutzung kostenlos ist.

Wie schätze ich die Kosten einer abgeschlossenen Anfrage?

Bei Tokenpreisen pro Million multiplizieren Sie jede Nutzungskategorie mit dem passenden Tarif und teilen durch eine Million. Addieren Sie die Ergebnisse:

estimated cost = (
  uncached input tokens × input rate
  + output tokens × output rate
  + cache-read tokens × cache-read rate
  + five-minute cache-write tokens × five-minute write rate
  + one-hour cache-write tokens × one-hour write rate
) / 1,000,000

Denktoken sind Teil der Ausgabenutzung. Enthält eine Antwort eine Denktoken-Aufteilung, addieren Sie diese nicht zusätzlich zur gemeldeten Gesamtausgabe. Der Standard-Denkaufwand ist medium; eine Änderung kann den Umfang des erzeugten Reasonings verändern. Vergleichen Sie daher abgeschlossene Aufgaben, statt bei jeder Einstellung dieselbe Tokenzahl anzunehmen.[3]

Bewahren Sie für eine Arbeitslastprognose einen repräsentativen Satz von Anfragen auf, samt Nutzung und Angabe, ob das Ergebnis Ihre Prüfungen bestanden hat. Berücksichtigen Sie Wiederholungen aufgrund unzureichender Antworten. Eine günstige Antwort, die einen zweiten Versuch benötigt, hat andere Gesamtkosten als eine akzeptable erste Antwort. Die API-Referenz erklärt die zu erfassenden Felder, Stoppgründe und Grenzen.

Fragen zu den Preisen

Zahle ich auf SeedRouter den offiziellen Preis für kurzen Kontext?

Nutzen Sie die aktuelle Tabelle für SeedRouter. Anthropics veröffentlichte Tabelle beschreibt dessen eigene Preise; identische Modellnamen belegen keine identischen Gebühren.

Werden bei max_tokens auf 128000 alle diese Token berechnet?

Der Wert legt das maximale Ausgabebudget fest. Schätzen Sie abgeschlossene Anfragen anhand der gemeldeten Nutzung einschließlich Denktoken und prüfen Sie den Stoppgrund, um festzustellen, ob die Ausgabe dieses Limit erreicht hat.[1]

Garantiert ein Cache-Control-Feld einen Cache-Treffer?

Nein. Der Prompt muss die Mindestlänge erfüllen und einem nutzbaren gecachten Präfix entsprechen. Die Anzahl gelesener Cache-Token in der Antwort belegt die Wiederverwendung.[2]

Werden fehlgeschlagene Anfragen berechnet?

Anfragen mit Fehlerrückgabe werden nicht berechnet. Eine erfolgreiche Antwort, die am Ausgabelimit stoppt, ist weiterhin eine abgeschlossene Generierung; prüfen Sie ihre Nutzung und ihren Stoppgrund.

Quellen

  1. Anthropic: Claude Haiku 5.5 Übersicht und Preise.
  2. Anthropic: Prompt-Caching.
  3. Anthropic: Neuerungen in Haiku 5.5.

Verwandte Leitfäden