Claude Opus 5.5 כבר זמין ב-SeedRouter

חלון הקשר מול מקסימום טוקני פלט: המגבלות של GPT-6, Claude, DeepSeek ו-Kimi

מה המשמעות של חלון הקשר ושל מקסימום טוקני פלט, המגבלות של GPT-6, Claude, DeepSeek V4.1 Flash ו-Kimi K3, ואיך לתקן תשובות שנעצרות מוקדם מדי.

קריאה כ-Markdown

חלון ההקשר הוא המספר הכולל של הטוקנים שמודל יכול להכיל בבקשה אחת: הפרומפט שלכם, היסטוריית השיחה, תמונות והתשובה שהוא כותב. מגבלת מקסימום טוקני הפלט היא הכמות המרבית שהמודל רשאי לכתוב בתשובה הזו, ובמודלי הסקה היא כוללת את הטוקנים שהוצאו על חשיבה. התשובה חייבת להיכנס לתוך חלון ההקשר, ולכן פרומפט ארוך משאיר פחות מקום לפלט.

מה ההבדל בין חלון הקשר לבין מקסימום טוקני פלט?

חלון ההקשר הוא מרחב משותף. כל מה שאתם שולחים וכל מה שהמודל כותב בבקשה אחת צריך להיכנס לתוכו.

מקסימום טוקני הפלט הוא תקרה נפרדת וקטנה יותר, רק על התשובה. לכל מודל יש תקרה, ולכל API יש פרמטר שמאפשר לקבוע מגבלה נמוכה יותר לכל בקשה.

מכאן נובעות שתי השלכות:

  • הקלט והפלט מתחרים על אותו חלון. מדריך ה-API של DeepSeek אומר זאת במפורש: "האורך הכולל של טוקני הקלט והטוקנים שנוצרו מוגבל על ידי אורך ההקשר של המודל."
  • ההסקה נספרת כפלט. ב-GPT-6, Claude, DeepSeek V4.1 Flash ו-Kimi K3, הטוקנים שהמודל מוציא על חשיבה נספרים במסגרת מגבלת הפלט ומחויבים כפלט. תשובה יכולה להיעצר מוקדם גם כשהתשובה הגלויה קצרה.

מה המגבלות של כל מודל?

מודלמזהה מודלחלון הקשרפלט מקסימליפרמטר הפלטברירת מחדל אם לא מציינים
GPT-6 Astra, Sol, Lunagpt-6-astra, gpt-6-sol, gpt-6-luna1.05M טוקנים (922K קלט)128Kmax_output_tokens (Responses), max_completion_tokens (Chat Completions)המקסימום של המודל
Claude Opus 5.5, Fable 5.1, Fable 5claude-opus-5-5, claude-fable-5-1, claude-fable-51M טוקנים128Kmax_tokensאין: השדה חובה
DeepSeek V4.1 Flashdeepseek-v4.1-flash1M טוקנים393,216max_tokens8K בלי חשיבה, 64K עם חשיבה, 128K ברמה max
Kimi K3kimi-k31,048,576 טוקנים1,048,576max_completion_tokens131,072

העמודה האחרונה היא המקור לרוב התשובות הקטועות. DeepSeek V4.1 Flash יכול לכתוב 393,216 טוקנים, אבל אם לא מגדירים max_tokens הוא נעצר ב-8K, או ב-64K כשהחשיבה פעילה. Kimi K3 יכול לכתוב עד 1,048,576 טוקנים, אבל ברירת המחדל שלו היא 131,072.

במדריך ה-API של כל מודל יש את רשימת הפרמטרים המלאה: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash ו-Kimi K3.

max_tokens, max_completion_tokens או max_output_tokens?

כולם מגבילים את התשובה. איזה מהם לשלוח תלוי בפורמט ה-API ובמודל:

פורמט APIפרמטרהערות
OpenAI Responses (/v1/responses)max_output_tokensOpenAI: "גבול עליון למספר הטוקנים שאפשר לייצר עבור תשובה, כולל טוקני פלט גלויים וטוקני הסקה."
OpenAI Chat Completions (/v1/chat/completions)max_completion_tokensOpenAI מסמנת את max_tokens כ-"הוצא משימוש לטובת max_completion_tokens" וכ-"לא תואם למודלי o-series". השתמשו ב-max_completion_tokens עבור GPT-6.
Anthropic Messages (/v1/messages)max_tokensחובה בכל בקשה.
DeepSeek Chat Completionsmax_tokensמ-1 עד 393216.
Kimi Chat Completionsmax_completion_tokensmax_tokens הוא השם שהוצא משימוש של אותה מגבלה.

אם API עונה "max_tokens is not supported with this model", עברו לפרמטר שבטבלה הזו.

למה המודל שלי נעצר לפני שסיים?

הוא הגיע למגבלת הפלט. כל API מדווח על כך בתשובה, לא כשגיאה:

APIשדההערך כשמגבלת הפלט הושגה
OpenAI Responsesincomplete_details.reason"max_output_tokens"
OpenAI Chat Completionschoices[].finish_reason"length"
Anthropic Messagesstop_reason"max_tokens"
DeepSeekchoices[].finish_reason"length"

ל-Anthropic יש סיבת עצירה נוספת, model_context_window_exceeded, לתשובה שמילאה את כל חלון ההקשר. ה-length של DeepSeek מכסה את שני המקרים: התשובה חרגה מ-max_tokens או שהשיחה חרגה מאורך ההקשר.

כדי לתקן:

  1. העלו את מגבלת הפלט עד המקסימום של המודל בטבלה שלמעלה.
  2. הורידו את רמת ההסקה. פחות חשיבה משאירה יותר מהתקציב לתשובה, וגם עולה פחות.
  3. המשיכו במקום לנסות שוב. שלחו את התשובה החלקית בחזרה ובקשו מהמודל להמשיך. מדריך סיבות העצירה של Anthropic מתאר זאת עבור max_tokens.

מה המשמעות של "context window exceeded"?

הבקשה שלכם לא נכנסת לחלון של המודל. היכן בדיוק היא נכשלת תלוי ב-API:

  • Claude. אם הקלט לבדו גדול מהחלון, ה-API מחזיר שגיאת 400 מסוג invalid_request_error ("prompt is too long"). אם רק הקלט יחד עם max_tokens גדול ממנו, התיעוד של Anthropic אומר שמודלי Claude 4.5 ואילך, כולל אלה שבמדריך הזה, מקבלים את הבקשה ונעצרים עם stop_reason: "model_context_window_exceeded" אם נגמר להם המקום.
  • DeepSeek. התשובה מסתיימת ב-finish_reason: "length" כשהשיחה חורגת מאורך ההקשר.

שלושה תיקונים, לפי הסדר:

  1. מחקו או סכמו תורות ישנים בשיחה. זה התיקון היחיד כשהקלט לבדו ארוך מדי.
  2. הורידו את מגבלת הפלט כך שקלט ועוד פלט ייכנסו.
  3. עברו למודל עם חלון גדול יותר. כל ארבע המשפחות בטבלה שלמעלה קוראות כ-1M טוקנים.

איך סוכני קוד מתמודדים עם המגבלות האלה?

סוכני קוד קובעים את מגבלת הפלט בשבילכם, וברירות המחדל שלהם יכולות להיות נמוכות ממה שהמודל מאפשר.

Claude Code משתמש ב-CLAUDE_CODE_MAX_OUTPUT_TOKENS. התיעוד שלו אומר שהוא "מוגדר כברירת מחדל ל-32000 עבור מזהי מודלים שהוא לא מזהה, כמו שמות ייעודיים לגייטוויי, ומוריד ערכים שמעל התקרה של מודל אל התקרה". כשמריצים את DeepSeek V4.1 Flash או Kimi K3 ב-Claude Code, הגדירו את המשתנה אם אתם צריכים תשובות ארוכות יותר. אותו תיעוד מזהיר שערך גבוה יותר "מקטין את חלון ההקשר האפקטיבי שזמין לפני שדחיסה אוטומטית מופעלת".

Codex קורא את model_context_window מתוך config.toml, שמתואר כ-"טוקני חלון ההקשר הזמינים למודל הפעיל". הגדירו אותו עבור מודלים ש-Codex לא מכיר, כמו בהגדרת Kimi K3 ובהגדרת DeepSeek V4.1 Flash. עבור שם מודל שהוא לא מזהה, Codex גם מדפיס: "Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues." (לא נמצאו נתוני מודל, ייעשה שימוש בנתוני גיבוי שעלולים לפגוע בביצועים). הסשן עדיין רץ.

שאלות נפוצות

האם חלון ההקשר כולל את טוקני הפלט?

כן. קלט, היסטוריה, תמונות והתשובה חולקים חלון הקשר אחד. מגבלת הפלט המקסימלי היא תקרה נפרדת על התשובה בתוך החלון הזה.

האם טוקני הסקה נספרים במסגרת מקסימום טוקני הפלט?

כן, בכל ארבע משפחות המודלים כאן. טוקני חשיבה נספרים במסגרת מגבלת הפלט ומחויבים כטוקני פלט.

איזה מודל כותב את התשובות הארוכות ביותר?

Kimi K3 מקבל max_completion_tokens עד 1,048,576, ו-DeepSeek V4.1 Flash מקבל max_tokens עד 393,216. GPT-6 ו-Claude נעצרים ב-128K לבקשה.

האם מגבלת פלט מקסימלי גבוהה יותר עולה יותר?

לא. משלמים על הטוקנים שהמודל באמת כותב, לא על המגבלה שקבעתם. מגבלה גבוהה יותר משנה רק כשהמודל צריך את המקום.

איפה אפשר לראות מחירים חיים של המודלים האלה?

בעמוד של כל מודל: GPT-6 Astra, Claude Opus 5.5, DeepSeek V4.1 Flash ו-Kimi K3.

מדריכים קשורים