Kontextfenster vs. maximale Ausgabe-Token: Limits für GPT-6, Claude, DeepSeek und Kimi
Was Kontextfenster und maximale Ausgabe-Token bedeuten, Limits für GPT-6, Claude, DeepSeek V4.1 Flash und Kimi K3 und wie Sie zu früh endende Antworten beheben.
Als Markdown lesenDas Kontextfenster ist die Gesamtzahl an Token, die ein Modell in einer Anfrage verarbeiten kann: Ihr Prompt, der bisherige Gesprächsverlauf, Bilder und die Antwort, die es schreibt. Das Limit für maximale Ausgabe-Token ist das Höchstmaß dessen, was das Modell in dieser Antwort schreiben darf, und bei Reasoning-Modellen zählen die Token für das Nachdenken mit. Die Antwort muss ins Kontextfenster passen, ein langer Prompt lässt also weniger Platz für die Ausgabe.
Was ist der Unterschied zwischen Kontextfenster und maximalen Ausgabe-Token?
Das Kontextfenster ist ein gemeinsamer Raum. Alles, was Sie senden, und alles, was das Modell in einer Anfrage schreibt, muss hineinpassen.
Maximale Ausgabe-Token sind eine separate, kleinere Obergrenze nur für die Antwort. Jedes Modell hat ein Maximum, und jede API hat einen Parameter, mit dem Sie pro Anfrage ein niedrigeres Limit setzen.
Daraus folgt zweierlei:
- Eingabe und Ausgabe teilen sich dasselbe Fenster. DeepSeeks API-Referenz sagt es klar: „Die Gesamtlänge aus Eingabe-Token und generierten Token ist durch die Kontextlänge des Modells begrenzt.“
- Reasoning zählt als Ausgabe. Bei GPT-6, Claude, DeepSeek V4.1 Flash und Kimi K3 zählen die Token, die ein Modell für das Nachdenken verbraucht, zum Ausgabelimit und werden als Ausgabe abgerechnet. Eine Antwort kann früh enden, obwohl der sichtbare Teil kurz ist.
Welche Limits gelten für die einzelnen Modelle?
| Modell | Modell-ID | Kontextfenster | Maximale Ausgabe | Ausgabeparameter | Standard, wenn Sie ihn weglassen |
|---|---|---|---|---|---|
| GPT-6 Astra, Sol, Luna | gpt-6-astra, gpt-6-sol, gpt-6-luna | 1,05M Token (922K Eingabe) | 128K | max_output_tokens (Responses), max_completion_tokens (Chat Completions) | Modellmaximum |
| Claude Opus 5.5, Fable 5.1, Fable 5 | claude-opus-5-5, claude-fable-5-1, claude-fable-5 | 1M Token | 128K | max_tokens | Keiner: das Feld ist Pflicht |
| DeepSeek V4.1 Flash | deepseek-v4.1-flash | 1M Token | 393.216 | max_tokens | 8K ohne Thinking, 64K mit Thinking, 128K bei Aufwand max |
| Kimi K3 | kimi-k3 | 1.048.576 Token | 1.048.576 | max_completion_tokens | 131.072 |
Die letzte Spalte erklärt die meisten abgeschnittenen Antworten. DeepSeek V4.1 Flash kann 393.216 Token schreiben, stoppt aber bei 8K oder mit Thinking bei 64K, wenn Sie max_tokens nicht setzen. Kimi K3 kann bis zu 1.048.576 Token schreiben, der Standard liegt aber bei 131.072.
Die API-Referenz jedes Modells enthält die vollständige Parameterliste: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash und Kimi K3.
max_tokens, max_completion_tokens oder max_output_tokens?
Alle begrenzen die Antwort. Welchen Sie senden, hängt vom API-Format und vom Modell ab:
| API-Format | Parameter | Hinweise |
|---|---|---|
OpenAI Responses (/v1/responses) | max_output_tokens | OpenAI: „Eine Obergrenze für die Zahl der Token, die für eine Antwort generiert werden können, einschließlich sichtbarer Ausgabe-Token und Reasoning-Token.“ |
OpenAI Chat Completions (/v1/chat/completions) | max_completion_tokens | OpenAI markiert max_tokens als „zugunsten von max_completion_tokens veraltet“ und „nicht kompatibel mit Modellen der o-Serie“. Verwenden Sie für GPT-6 max_completion_tokens. |
Anthropic Messages (/v1/messages) | max_tokens | Bei jeder Anfrage Pflicht. |
| DeepSeek Chat Completions | max_tokens | 1 bis 393216. |
| Kimi Chat Completions | max_completion_tokens | max_tokens ist der veraltete Name für dasselbe Limit. |
Wenn eine API mit „max_tokens is not supported with this model“ antwortet, wechseln Sie zum Parameter aus dieser Tabelle.
Warum hat mein Modell aufgehört, bevor es fertig war?
Es hat das Ausgabelimit erreicht. Jede API meldet das in der Antwort, nicht als Fehler:
| API | Feld | Wert, wenn das Ausgabelimit erreicht wurde |
|---|---|---|
| OpenAI Responses | incomplete_details.reason | "max_output_tokens" |
| OpenAI Chat Completions | choices[].finish_reason | "length" |
| Anthropic Messages | stop_reason | "max_tokens" |
| DeepSeek | choices[].finish_reason | "length" |
Anthropic hat einen zweiten Stoppgrund, model_context_window_exceeded, für eine Antwort, die das gesamte Kontextfenster gefüllt hat. DeepSeeks length deckt beide Fälle ab: Die Antwort hat max_tokens überschritten oder das Gespräch die Kontextlänge.
So beheben Sie es:
- Erhöhen Sie das Ausgabelimit bis zum Maximum des Modells aus der Tabelle oben.
- Senken Sie den Reasoning-Aufwand. Weniger Nachdenken lässt mehr vom Budget für die Antwort übrig und kostet weniger.
- Fortsetzen statt neu anfragen. Schicken Sie die unvollständige Antwort zurück und bitten Sie das Modell weiterzuschreiben. Anthropics Leitfaden zu Stoppgründen beschreibt das für
max_tokens.
Was bedeutet „context window exceeded“?
Ihre Anfrage passt nicht in das Fenster des Modells. Wo genau sie scheitert, hängt von der API ab:
- Claude. Ist schon die Eingabe allein größer als das Fenster, gibt die API einen 400-Fehler
invalid_request_error(„prompt is too long“) zurück. Ist nur Eingabe plusmax_tokensgrößer, nehmen laut Anthropics Dokumentation Claude 4.5 und neuere Modelle, einschließlich der Modelle in diesem Leitfaden, die Anfrage an und stoppen mitstop_reason: "model_context_window_exceeded", wenn ihnen der Platz ausgeht. - DeepSeek. Die Antwort endet mit
finish_reason: "length", wenn das Gespräch die Kontextlänge überschreitet.
Drei Lösungen, in dieser Reihenfolge:
- Alte Gesprächsrunden entfernen oder zusammenfassen. Das ist die einzige Lösung, wenn schon die Eingabe allein zu lang ist.
- Das Ausgabelimit senken, damit Eingabe plus Ausgabe passen.
- Zu einem Modell mit größerem Fenster wechseln. Alle vier Modellfamilien in der Tabelle oben lesen rund 1M Token.
Wie gehen Coding-Agenten mit diesen Limits um?
Coding-Agenten setzen das Ausgabelimit für Sie, und ihre Standardwerte können niedriger sein, als das Modell erlaubt.
Claude Code nutzt CLAUDE_CODE_MAX_OUTPUT_TOKENS. Laut Dokumentation ist der Wert „standardmäßig 32000 für Modell-IDs, die es nicht erkennt, etwa gateway-spezifische Namen, und senkt Werte über der Obergrenze eines Modells auf diese Obergrenze“. Wenn Sie DeepSeek V4.1 Flash oder Kimi K3 in Claude Code nutzen, setzen Sie die Variable, falls Sie längere Antworten brauchen. Dieselbe Dokumentation warnt, dass ein höherer Wert „das effektive Kontextfenster verkleinert, das vor der automatischen Komprimierung zur Verfügung steht“.
Codex liest model_context_window aus der config.toml, beschrieben als die „für das aktive Modell verfügbaren Kontextfenster-Token“. Setzen Sie den Wert für Modelle, die Codex nicht kennt, wie in unserer Kimi K3 Einrichtung und der DeepSeek V4.1 Flash Einrichtung. Für einen Modellnamen, den es nicht erkennt, gibt Codex außerdem aus: „Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues.“ Die Sitzung läuft trotzdem.
Häufig gestellte Fragen
Umfasst das Kontextfenster auch die Ausgabe-Token?
Ja. Eingabe, Verlauf, Bilder und Antwort teilen sich ein Kontextfenster. Das maximale Ausgabelimit ist eine separate Obergrenze für die Antwort innerhalb dieses Fensters.
Zählen Reasoning-Token zu den maximalen Ausgabe-Token?
Ja, bei allen vier Modellfamilien hier. Thinking-Token zählen zum Ausgabelimit und werden als Ausgabe-Token abgerechnet.
Welches Modell schreibt die längsten Antworten?
Kimi K3 akzeptiert max_completion_tokens bis 1.048.576, DeepSeek V4.1 Flash akzeptiert max_tokens bis 393.216. GPT-6 und Claude enden bei 128K pro Anfrage.
Kostet ein höheres Ausgabelimit mehr?
Nein. Sie zahlen für die Token, die das Modell tatsächlich schreibt, nicht für das gesetzte Limit. Ein höheres Limit spielt nur eine Rolle, wenn das Modell den Platz braucht.
Wo sehe ich aktuelle Preise für diese Modelle?
Auf der jeweiligen Modellseite: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash und Kimi K3.



