חלון הקשר מול מקסימום טוקני פלט: המגבלות של GPT-6, Claude, DeepSeek ו-Kimi
מה המשמעות של חלון הקשר ושל מקסימום טוקני פלט, המגבלות של GPT-6, Claude, DeepSeek V4.1 Flash ו-Kimi K3, ואיך לתקן תשובות שנעצרות מוקדם מדי.
קריאה כ-Markdownחלון ההקשר הוא המספר הכולל של הטוקנים שמודל יכול להכיל בבקשה אחת: הפרומפט שלכם, היסטוריית השיחה, תמונות והתשובה שהוא כותב. מגבלת מקסימום טוקני הפלט היא הכמות המרבית שהמודל רשאי לכתוב בתשובה הזו, ובמודלי הסקה היא כוללת את הטוקנים שהוצאו על חשיבה. התשובה חייבת להיכנס לתוך חלון ההקשר, ולכן פרומפט ארוך משאיר פחות מקום לפלט.
מה ההבדל בין חלון הקשר לבין מקסימום טוקני פלט?
חלון ההקשר הוא מרחב משותף. כל מה שאתם שולחים וכל מה שהמודל כותב בבקשה אחת צריך להיכנס לתוכו.
מקסימום טוקני הפלט הוא תקרה נפרדת וקטנה יותר, רק על התשובה. לכל מודל יש תקרה, ולכל API יש פרמטר שמאפשר לקבוע מגבלה נמוכה יותר לכל בקשה.
מכאן נובעות שתי השלכות:
- הקלט והפלט מתחרים על אותו חלון. מדריך ה-API של DeepSeek אומר זאת במפורש: "האורך הכולל של טוקני הקלט והטוקנים שנוצרו מוגבל על ידי אורך ההקשר של המודל."
- ההסקה נספרת כפלט. ב-GPT-6, Claude, DeepSeek V4.1 Flash ו-Kimi K3, הטוקנים שהמודל מוציא על חשיבה נספרים במסגרת מגבלת הפלט ומחויבים כפלט. תשובה יכולה להיעצר מוקדם גם כשהתשובה הגלויה קצרה.
מה המגבלות של כל מודל?
| מודל | מזהה מודל | חלון הקשר | פלט מקסימלי | פרמטר הפלט | ברירת מחדל אם לא מציינים |
|---|---|---|---|---|---|
| GPT-6 Astra, Sol, Luna | gpt-6-astra, gpt-6-sol, gpt-6-luna | 1.05M טוקנים (922K קלט) | 128K | max_output_tokens (Responses), max_completion_tokens (Chat Completions) | המקסימום של המודל |
| Claude Opus 5.5, Fable 5.1, Fable 5 | claude-opus-5-5, claude-fable-5-1, claude-fable-5 | 1M טוקנים | 128K | max_tokens | אין: השדה חובה |
| DeepSeek V4.1 Flash | deepseek-v4.1-flash | 1M טוקנים | 393,216 | max_tokens | 8K בלי חשיבה, 64K עם חשיבה, 128K ברמה max |
| Kimi K3 | kimi-k3 | 1,048,576 טוקנים | 1,048,576 | max_completion_tokens | 131,072 |
העמודה האחרונה היא המקור לרוב התשובות הקטועות. DeepSeek V4.1 Flash יכול לכתוב 393,216 טוקנים, אבל אם לא מגדירים max_tokens הוא נעצר ב-8K, או ב-64K כשהחשיבה פעילה. Kimi K3 יכול לכתוב עד 1,048,576 טוקנים, אבל ברירת המחדל שלו היא 131,072.
במדריך ה-API של כל מודל יש את רשימת הפרמטרים המלאה: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash ו-Kimi K3.
max_tokens, max_completion_tokens או max_output_tokens?
כולם מגבילים את התשובה. איזה מהם לשלוח תלוי בפורמט ה-API ובמודל:
| פורמט API | פרמטר | הערות |
|---|---|---|
OpenAI Responses (/v1/responses) | max_output_tokens | OpenAI: "גבול עליון למספר הטוקנים שאפשר לייצר עבור תשובה, כולל טוקני פלט גלויים וטוקני הסקה." |
OpenAI Chat Completions (/v1/chat/completions) | max_completion_tokens | OpenAI מסמנת את max_tokens כ-"הוצא משימוש לטובת max_completion_tokens" וכ-"לא תואם למודלי o-series". השתמשו ב-max_completion_tokens עבור GPT-6. |
Anthropic Messages (/v1/messages) | max_tokens | חובה בכל בקשה. |
| DeepSeek Chat Completions | max_tokens | מ-1 עד 393216. |
| Kimi Chat Completions | max_completion_tokens | max_tokens הוא השם שהוצא משימוש של אותה מגבלה. |
אם API עונה "max_tokens is not supported with this model", עברו לפרמטר שבטבלה הזו.
למה המודל שלי נעצר לפני שסיים?
הוא הגיע למגבלת הפלט. כל API מדווח על כך בתשובה, לא כשגיאה:
| API | שדה | הערך כשמגבלת הפלט הושגה |
|---|---|---|
| OpenAI Responses | incomplete_details.reason | "max_output_tokens" |
| OpenAI Chat Completions | choices[].finish_reason | "length" |
| Anthropic Messages | stop_reason | "max_tokens" |
| DeepSeek | choices[].finish_reason | "length" |
ל-Anthropic יש סיבת עצירה נוספת, model_context_window_exceeded, לתשובה שמילאה את כל חלון ההקשר. ה-length של DeepSeek מכסה את שני המקרים: התשובה חרגה מ-max_tokens או שהשיחה חרגה מאורך ההקשר.
כדי לתקן:
- העלו את מגבלת הפלט עד המקסימום של המודל בטבלה שלמעלה.
- הורידו את רמת ההסקה. פחות חשיבה משאירה יותר מהתקציב לתשובה, וגם עולה פחות.
- המשיכו במקום לנסות שוב. שלחו את התשובה החלקית בחזרה ובקשו מהמודל להמשיך. מדריך סיבות העצירה של Anthropic מתאר זאת עבור
max_tokens.
מה המשמעות של "context window exceeded"?
הבקשה שלכם לא נכנסת לחלון של המודל. היכן בדיוק היא נכשלת תלוי ב-API:
- Claude. אם הקלט לבדו גדול מהחלון, ה-API מחזיר שגיאת 400 מסוג
invalid_request_error("prompt is too long"). אם רק הקלט יחד עםmax_tokensגדול ממנו, התיעוד של Anthropic אומר שמודלי Claude 4.5 ואילך, כולל אלה שבמדריך הזה, מקבלים את הבקשה ונעצרים עםstop_reason: "model_context_window_exceeded"אם נגמר להם המקום. - DeepSeek. התשובה מסתיימת ב-
finish_reason: "length"כשהשיחה חורגת מאורך ההקשר.
שלושה תיקונים, לפי הסדר:
- מחקו או סכמו תורות ישנים בשיחה. זה התיקון היחיד כשהקלט לבדו ארוך מדי.
- הורידו את מגבלת הפלט כך שקלט ועוד פלט ייכנסו.
- עברו למודל עם חלון גדול יותר. כל ארבע המשפחות בטבלה שלמעלה קוראות כ-1M טוקנים.
איך סוכני קוד מתמודדים עם המגבלות האלה?
סוכני קוד קובעים את מגבלת הפלט בשבילכם, וברירות המחדל שלהם יכולות להיות נמוכות ממה שהמודל מאפשר.
Claude Code משתמש ב-CLAUDE_CODE_MAX_OUTPUT_TOKENS. התיעוד שלו אומר שהוא "מוגדר כברירת מחדל ל-32000 עבור מזהי מודלים שהוא לא מזהה, כמו שמות ייעודיים לגייטוויי, ומוריד ערכים שמעל התקרה של מודל אל התקרה". כשמריצים את DeepSeek V4.1 Flash או Kimi K3 ב-Claude Code, הגדירו את המשתנה אם אתם צריכים תשובות ארוכות יותר. אותו תיעוד מזהיר שערך גבוה יותר "מקטין את חלון ההקשר האפקטיבי שזמין לפני שדחיסה אוטומטית מופעלת".
Codex קורא את model_context_window מתוך config.toml, שמתואר כ-"טוקני חלון ההקשר הזמינים למודל הפעיל". הגדירו אותו עבור מודלים ש-Codex לא מכיר, כמו בהגדרת Kimi K3 ובהגדרת DeepSeek V4.1 Flash. עבור שם מודל שהוא לא מזהה, Codex גם מדפיס: "Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues." (לא נמצאו נתוני מודל, ייעשה שימוש בנתוני גיבוי שעלולים לפגוע בביצועים). הסשן עדיין רץ.
שאלות נפוצות
האם חלון ההקשר כולל את טוקני הפלט?
כן. קלט, היסטוריה, תמונות והתשובה חולקים חלון הקשר אחד. מגבלת הפלט המקסימלי היא תקרה נפרדת על התשובה בתוך החלון הזה.
האם טוקני הסקה נספרים במסגרת מקסימום טוקני הפלט?
כן, בכל ארבע משפחות המודלים כאן. טוקני חשיבה נספרים במסגרת מגבלת הפלט ומחויבים כטוקני פלט.
איזה מודל כותב את התשובות הארוכות ביותר?
Kimi K3 מקבל max_completion_tokens עד 1,048,576, ו-DeepSeek V4.1 Flash מקבל max_tokens עד 393,216. GPT-6 ו-Claude נעצרים ב-128K לבקשה.
האם מגבלת פלט מקסימלי גבוהה יותר עולה יותר?
לא. משלמים על הטוקנים שהמודל באמת כותב, לא על המגבלה שקבעתם. מגבלה גבוהה יותר משנה רק כשהמודל צריך את המקום.
איפה אפשר לראות מחירים חיים של המודלים האלה?
בעמוד של כל מודל: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash ו-Kimi K3.



