Claude Opus 5.5 ist auf SeedRouter verfügbar

Kontextfenster vs. maximale Ausgabe-Token: Limits für GPT-6, Claude, DeepSeek und Kimi

Was Kontextfenster und maximale Ausgabe-Token bedeuten, Limits für GPT-6, Claude, DeepSeek V4.1 Flash und Kimi K3 und wie Sie zu früh endende Antworten beheben.

Als Markdown lesen

Das Kontextfenster ist die Gesamtzahl an Token, die ein Modell in einer Anfrage verarbeiten kann: Ihr Prompt, der bisherige Gesprächsverlauf, Bilder und die Antwort, die es schreibt. Das Limit für maximale Ausgabe-Token ist das Höchstmaß dessen, was das Modell in dieser Antwort schreiben darf, und bei Reasoning-Modellen zählen die Token für das Nachdenken mit. Die Antwort muss ins Kontextfenster passen, ein langer Prompt lässt also weniger Platz für die Ausgabe.

Was ist der Unterschied zwischen Kontextfenster und maximalen Ausgabe-Token?

Das Kontextfenster ist ein gemeinsamer Raum. Alles, was Sie senden, und alles, was das Modell in einer Anfrage schreibt, muss hineinpassen.

Maximale Ausgabe-Token sind eine separate, kleinere Obergrenze nur für die Antwort. Jedes Modell hat ein Maximum, und jede API hat einen Parameter, mit dem Sie pro Anfrage ein niedrigeres Limit setzen.

Daraus folgt zweierlei:

  • Eingabe und Ausgabe teilen sich dasselbe Fenster. DeepSeeks API-Referenz sagt es klar: „Die Gesamtlänge aus Eingabe-Token und generierten Token ist durch die Kontextlänge des Modells begrenzt.“
  • Reasoning zählt als Ausgabe. Bei GPT-6, Claude, DeepSeek V4.1 Flash und Kimi K3 zählen die Token, die ein Modell für das Nachdenken verbraucht, zum Ausgabelimit und werden als Ausgabe abgerechnet. Eine Antwort kann früh enden, obwohl der sichtbare Teil kurz ist.

Welche Limits gelten für die einzelnen Modelle?

ModellModell-IDKontextfensterMaximale AusgabeAusgabeparameterStandard, wenn Sie ihn weglassen
GPT-6 Astra, Sol, Lunagpt-6-astra, gpt-6-sol, gpt-6-luna1,05M Token (922K Eingabe)128Kmax_output_tokens (Responses), max_completion_tokens (Chat Completions)Modellmaximum
Claude Opus 5.5, Fable 5.1, Fable 5claude-opus-5-5, claude-fable-5-1, claude-fable-51M Token128Kmax_tokensKeiner: das Feld ist Pflicht
DeepSeek V4.1 Flashdeepseek-v4.1-flash1M Token393.216max_tokens8K ohne Thinking, 64K mit Thinking, 128K bei Aufwand max
Kimi K3kimi-k31.048.576 Token1.048.576max_completion_tokens131.072

Die letzte Spalte erklärt die meisten abgeschnittenen Antworten. DeepSeek V4.1 Flash kann 393.216 Token schreiben, stoppt aber bei 8K oder mit Thinking bei 64K, wenn Sie max_tokens nicht setzen. Kimi K3 kann bis zu 1.048.576 Token schreiben, der Standard liegt aber bei 131.072.

Die API-Referenz jedes Modells enthält die vollständige Parameterliste: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash und Kimi K3.

max_tokens, max_completion_tokens oder max_output_tokens?

Alle begrenzen die Antwort. Welchen Sie senden, hängt vom API-Format und vom Modell ab:

API-FormatParameterHinweise
OpenAI Responses (/v1/responses)max_output_tokensOpenAI: „Eine Obergrenze für die Zahl der Token, die für eine Antwort generiert werden können, einschließlich sichtbarer Ausgabe-Token und Reasoning-Token.“
OpenAI Chat Completions (/v1/chat/completions)max_completion_tokensOpenAI markiert max_tokens als „zugunsten von max_completion_tokens veraltet“ und „nicht kompatibel mit Modellen der o-Serie“. Verwenden Sie für GPT-6 max_completion_tokens.
Anthropic Messages (/v1/messages)max_tokensBei jeder Anfrage Pflicht.
DeepSeek Chat Completionsmax_tokens1 bis 393216.
Kimi Chat Completionsmax_completion_tokensmax_tokens ist der veraltete Name für dasselbe Limit.

Wenn eine API mit „max_tokens is not supported with this model“ antwortet, wechseln Sie zum Parameter aus dieser Tabelle.

Warum hat mein Modell aufgehört, bevor es fertig war?

Es hat das Ausgabelimit erreicht. Jede API meldet das in der Antwort, nicht als Fehler:

APIFeldWert, wenn das Ausgabelimit erreicht wurde
OpenAI Responsesincomplete_details.reason"max_output_tokens"
OpenAI Chat Completionschoices[].finish_reason"length"
Anthropic Messagesstop_reason"max_tokens"
DeepSeekchoices[].finish_reason"length"

Anthropic hat einen zweiten Stoppgrund, model_context_window_exceeded, für eine Antwort, die das gesamte Kontextfenster gefüllt hat. DeepSeeks length deckt beide Fälle ab: Die Antwort hat max_tokens überschritten oder das Gespräch die Kontextlänge.

So beheben Sie es:

  1. Erhöhen Sie das Ausgabelimit bis zum Maximum des Modells aus der Tabelle oben.
  2. Senken Sie den Reasoning-Aufwand. Weniger Nachdenken lässt mehr vom Budget für die Antwort übrig und kostet weniger.
  3. Fortsetzen statt neu anfragen. Schicken Sie die unvollständige Antwort zurück und bitten Sie das Modell weiterzuschreiben. Anthropics Leitfaden zu Stoppgründen beschreibt das für max_tokens.

Was bedeutet „context window exceeded“?

Ihre Anfrage passt nicht in das Fenster des Modells. Wo genau sie scheitert, hängt von der API ab:

  • Claude. Ist schon die Eingabe allein größer als das Fenster, gibt die API einen 400-Fehler invalid_request_error („prompt is too long“) zurück. Ist nur Eingabe plus max_tokens größer, nehmen laut Anthropics Dokumentation Claude 4.5 und neuere Modelle, einschließlich der Modelle in diesem Leitfaden, die Anfrage an und stoppen mit stop_reason: "model_context_window_exceeded", wenn ihnen der Platz ausgeht.
  • DeepSeek. Die Antwort endet mit finish_reason: "length", wenn das Gespräch die Kontextlänge überschreitet.

Drei Lösungen, in dieser Reihenfolge:

  1. Alte Gesprächsrunden entfernen oder zusammenfassen. Das ist die einzige Lösung, wenn schon die Eingabe allein zu lang ist.
  2. Das Ausgabelimit senken, damit Eingabe plus Ausgabe passen.
  3. Zu einem Modell mit größerem Fenster wechseln. Alle vier Modellfamilien in der Tabelle oben lesen rund 1M Token.

Wie gehen Coding-Agenten mit diesen Limits um?

Coding-Agenten setzen das Ausgabelimit für Sie, und ihre Standardwerte können niedriger sein, als das Modell erlaubt.

Claude Code nutzt CLAUDE_CODE_MAX_OUTPUT_TOKENS. Laut Dokumentation ist der Wert „standardmäßig 32000 für Modell-IDs, die es nicht erkennt, etwa gateway-spezifische Namen, und senkt Werte über der Obergrenze eines Modells auf diese Obergrenze“. Wenn Sie DeepSeek V4.1 Flash oder Kimi K3 in Claude Code nutzen, setzen Sie die Variable, falls Sie längere Antworten brauchen. Dieselbe Dokumentation warnt, dass ein höherer Wert „das effektive Kontextfenster verkleinert, das vor der automatischen Komprimierung zur Verfügung steht“.

Codex liest model_context_window aus der config.toml, beschrieben als die „für das aktive Modell verfügbaren Kontextfenster-Token“. Setzen Sie den Wert für Modelle, die Codex nicht kennt, wie in unserer Kimi K3 Einrichtung und der DeepSeek V4.1 Flash Einrichtung. Für einen Modellnamen, den es nicht erkennt, gibt Codex außerdem aus: „Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues.“ Die Sitzung läuft trotzdem.

Häufig gestellte Fragen

Umfasst das Kontextfenster auch die Ausgabe-Token?

Ja. Eingabe, Verlauf, Bilder und Antwort teilen sich ein Kontextfenster. Das maximale Ausgabelimit ist eine separate Obergrenze für die Antwort innerhalb dieses Fensters.

Zählen Reasoning-Token zu den maximalen Ausgabe-Token?

Ja, bei allen vier Modellfamilien hier. Thinking-Token zählen zum Ausgabelimit und werden als Ausgabe-Token abgerechnet.

Welches Modell schreibt die längsten Antworten?

Kimi K3 akzeptiert max_completion_tokens bis 1.048.576, DeepSeek V4.1 Flash akzeptiert max_tokens bis 393.216. GPT-6 und Claude enden bei 128K pro Anfrage.

Kostet ein höheres Ausgabelimit mehr?

Nein. Sie zahlen für die Token, die das Modell tatsächlich schreibt, nicht für das gesetzte Limit. Ein höheres Limit spielt nur eine Rolle, wenn das Modell den Platz braucht.

Wo sehe ich aktuelle Preise für diese Modelle?

Auf der jeweiligen Modellseite: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash und Kimi K3.

Verwandte Leitfäden