Claude Opus 5.5 è disponibile su SeedRouter

Finestra di contesto e token di output massimi: i limiti di GPT-6, Claude, DeepSeek e Kimi

Cosa significano finestra di contesto e token di output massimi, i limiti di GPT-6, Claude, DeepSeek V4.1 Flash e Kimi K3, e come correggere risposte tronche.

Leggi in Markdown

La finestra di contesto è il numero totale di token che un modello può contenere in una richiesta: il tuo prompt, la cronologia della conversazione, le immagini e la risposta che scrive. Il limite di token di output massimi è il massimo che il modello può scrivere in quella risposta e, nei modelli di ragionamento, include i token spesi per pensare. La risposta deve stare dentro la finestra di contesto, quindi un prompt lungo lascia meno spazio all'output.

Qual è la differenza tra finestra di contesto e token di output massimi?

La finestra di contesto è uno spazio condiviso. Tutto ciò che invii e tutto ciò che il modello scrive in una richiesta deve starci dentro.

I token di output massimi sono un tetto separato e più piccolo che riguarda solo la risposta. Ogni modello ha un tetto massimo, e ogni API ha un parametro che ti permette di impostare un limite più basso per ogni richiesta.

Ne derivano due conseguenze:

  • Input e output si contendono la stessa finestra. Il riferimento API di DeepSeek lo dice chiaramente: "La lunghezza totale dei token di input e dei token generati è limitata dalla lunghezza del contesto del modello."
  • Il ragionamento conta come output. In GPT-6, Claude, DeepSeek V4.1 Flash e Kimi K3, i token che un modello spende per pensare contano nel limite di output e vengono fatturati come output. Una risposta può fermarsi presto anche se la risposta visibile è breve.

Quali sono i limiti di ciascun modello?

ModelloID modelloFinestra di contestoOutput massimoParametro di outputPredefinito se lo ometti
GPT-6 Astra, Sol, Lunagpt-6-astra, gpt-6-sol, gpt-6-luna1,05M token (922K di input)128Kmax_output_tokens (Responses), max_completion_tokens (Chat Completions)Massimo del modello
Claude Opus 5.5, Fable 5.1, Fable 5claude-opus-5-5, claude-fable-5-1, claude-fable-51M token128Kmax_tokensNessuno: il campo è obbligatorio
DeepSeek V4.1 Flashdeepseek-v4.1-flash1M token393.216max_tokens8K senza thinking, 64K con thinking, 128K con sforzo max
Kimi K3kimi-k31.048.576 token1.048.576max_completion_tokens131.072

L'ultima colonna è l'origine della maggior parte delle risposte troncate. DeepSeek V4.1 Flash può scrivere 393.216 token, ma se non imposti max_tokens si ferma a 8K, o a 64K con il thinking attivo. Kimi K3 può scrivere fino a 1.048.576 token, ma il suo predefinito è 131.072.

Il riferimento API di ciascun modello contiene l'elenco completo dei parametri: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash e Kimi K3.

max_tokens, max_completion_tokens o max_output_tokens?

Limitano tutti la risposta. Quale inviare dipende dal formato dell'API e dal modello:

Formato APIParametroNote
OpenAI Responses (/v1/responses)max_output_tokensOpenAI: "Un limite superiore al numero di token che possono essere generati per una risposta, inclusi i token di output visibili e i token di ragionamento."
OpenAI Chat Completions (/v1/chat/completions)max_completion_tokensOpenAI indica max_tokens come "deprecato a favore di max_completion_tokens" e "non compatibile con i modelli della serie o". Usa max_completion_tokens per GPT-6.
Anthropic Messages (/v1/messages)max_tokensObbligatorio in ogni richiesta.
DeepSeek Chat Completionsmax_tokensDa 1 a 393216.
Kimi Chat Completionsmax_completion_tokensmax_tokens è il nome deprecato dello stesso limite.

Se un'API risponde "max_tokens is not supported with this model", passa al parametro indicato in questa tabella.

Perché il mio modello si è fermato prima di finire?

Ha raggiunto il limite di output. Ogni API lo segnala nella risposta, non come errore:

APICampoValore quando è stato raggiunto il limite di output
OpenAI Responsesincomplete_details.reason"max_output_tokens"
OpenAI Chat Completionschoices[].finish_reason"length"
Anthropic Messagesstop_reason"max_tokens"
DeepSeekchoices[].finish_reason"length"

Anthropic ha un secondo motivo di arresto, model_context_window_exceeded, per una risposta che ha riempito l'intera finestra di contesto. Il length di DeepSeek copre entrambi i casi: la risposta ha superato max_tokens oppure la conversazione ha superato la lunghezza del contesto.

Per correggere:

  1. Alza il limite di output fino al massimo del modello nella tabella sopra.
  2. Abbassa lo sforzo di ragionamento. Meno ragionamento lascia più budget alla risposta, e costa meno.
  3. Continua invece di riprovare. Rimanda la risposta parziale e chiedi al modello di proseguire. La guida di Anthropic sui motivi di arresto descrive questo approccio per max_tokens.

Cosa significa "context window exceeded"?

La tua richiesta non sta nella finestra del modello. Il punto esatto in cui fallisce dipende dall'API:

  • Claude. Se il solo input è più grande della finestra, l'API restituisce un errore 400 invalid_request_error ("prompt is too long"). Se è più grande solo l'input sommato a max_tokens, la documentazione di Anthropic dice che Claude 4.5 e i modelli successivi, compresi quelli di questa guida, accettano la richiesta e si fermano con stop_reason: "model_context_window_exceeded" se esauriscono lo spazio.
  • DeepSeek. La risposta termina con finish_reason: "length" quando la conversazione supera la lunghezza del contesto.

Tre soluzioni, in ordine:

  1. Elimina o riassumi i turni vecchi della conversazione. È l'unica soluzione quando il solo input è troppo lungo.
  2. Abbassa il limite di output in modo che input e output ci stiano.
  3. Passa a un modello con una finestra più grande. Tutte e quattro le famiglie nella tabella sopra leggono circa 1M di token.

Come gestiscono questi limiti gli agenti di programmazione?

Gli agenti di programmazione impostano il limite di output per te, e i loro predefiniti possono essere più bassi di quanto consente il modello.

Claude Code usa CLAUDE_CODE_MAX_OUTPUT_TOKENS. La sua documentazione dice che "è impostato di default a 32000 per gli ID modello che non riconosce, come i nomi specifici dei gateway, e riduce al tetto i valori che superano il tetto di un modello". Quando esegui DeepSeek V4.1 Flash o Kimi K3 in Claude Code, imposta la variabile se ti servono risposte più lunghe. La stessa documentazione avverte che un valore più alto "riduce la finestra di contesto effettiva disponibile prima che si attivi la compattazione automatica".

Codex legge model_context_window da config.toml, descritto come "i token della finestra di contesto disponibili per il modello attivo". Impostalo per i modelli che Codex non conosce, come nel nostro setup di Kimi K3 e nel setup di DeepSeek V4.1 Flash. Per un nome di modello che non riconosce, Codex stampa anche: "Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues." (metadati del modello non trovati, verranno usati metadati di riserva che possono peggiorare le prestazioni). La sessione continua comunque a funzionare.

Domande frequenti

La finestra di contesto include i token di output?

Sì. Input, cronologia, immagini e risposta condividono un'unica finestra di contesto. Il limite di output massimo è un tetto separato sulla risposta all'interno di quella finestra.

I token di ragionamento contano nei token di output massimi?

Sì, in tutte e quattro le famiglie di modelli qui. I token di thinking contano nel limite di output e vengono fatturati come token di output.

Quale modello scrive le risposte più lunghe?

Kimi K3 accetta max_completion_tokens fino a 1.048.576, e DeepSeek V4.1 Flash accetta max_tokens fino a 393.216. GPT-6 e Claude si fermano a 128K per richiesta.

Un limite di output massimo più alto costa di più?

No. Paghi i token che il modello scrive davvero, non il limite che imposti. Un limite più alto conta solo quando il modello ha bisogno dello spazio.

Dove posso vedere i prezzi aggiornati di questi modelli?

Nella pagina di ciascun modello: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash e Kimi K3.

Guide correlate