Claude Opus 5.5 متاح الآن على SeedRouter

نافذة السياق مقابل الحد الأقصى لتوكنات الإخراج: الحدود في GPT-6 و Claude و DeepSeek و Kimi

ما معنى نافذة السياق والحد الأقصى لتوكنات الإخراج، وحدود GPT-6 و Claude و DeepSeek V4.1 Flash و Kimi K3، وكيف تعالج الردود التي تتوقف مبكرًا.

اقرأ بصيغة Markdown

نافذة السياق هي العدد الإجمالي للتوكنات التي يستطيع النموذج استيعابها في طلب واحد: الموجّه، وسجل المحادثة، والصور، والرد الذي يكتبه. أما الحد الأقصى لتوكنات الإخراج فهو أكبر عدد من التوكنات يمكن للنموذج كتابته في ذلك الرد، وفي نماذج الاستدلال يشمل التوكنات المستهلكة في التفكير. يجب أن يتسع الرد داخل نافذة السياق، لذا فإن الموجّه الطويل يترك مساحة أقل للإخراج.

ما الفرق بين نافذة السياق والحد الأقصى لتوكنات الإخراج؟

نافذة السياق مساحة مشتركة. كل ما ترسله وكل ما يكتبه النموذج في طلب واحد يجب أن يتسع فيها.

أما الحد الأقصى لتوكنات الإخراج فهو سقف منفصل وأصغر يخص الرد وحده. لكل نموذج سقف أعلى، ولكل API معامل يتيح لك تحديد حد أدنى منه في كل طلب.

ويترتّب على ذلك أمران:

  • الإدخال والإخراج يتنافسان على النافذة نفسها. يقولها مرجع API الخاص بـ DeepSeek بوضوح: «يقتصر الطول الإجمالي لتوكنات الإدخال والتوكنات المولَّدة على طول سياق النموذج».
  • الاستدلال يُحسب ضمن الإخراج. في GPT-6 و Claude و DeepSeek V4.1 Flash و Kimi K3، تُحسب التوكنات التي يستهلكها النموذج في التفكير ضمن حد الإخراج وتُحتسب كتوكنات إخراج. لذا قد يتوقف الرد مبكرًا رغم أن الإجابة الظاهرة قصيرة.

ما حدود كل نموذج؟

النموذجمعرّف النموذجنافذة السياقالحد الأقصى للإخراجمعامل الإخراجالقيمة الافتراضية إن لم تحدّده
GPT-6 Astra و Sol و Lunagpt-6-astra, gpt-6-sol, gpt-6-luna1.05M توكن (922K إدخال)128Kmax_output_tokens (Responses)، max_completion_tokens (Chat Completions)الحد الأقصى للنموذج
Claude Opus 5.5 و Fable 5.1 و Fable 5claude-opus-5-5, claude-fable-5-1, claude-fable-51M توكن128Kmax_tokensلا يوجد: الحقل إلزامي
DeepSeek V4.1 Flashdeepseek-v4.1-flash1M توكن393,216max_tokens8K دون تفكير، و64K مع التفكير، و128K بمستوى max
Kimi K3kimi-k31,048,576 توكن1,048,576max_completion_tokens131,072

العمود الأخير هو مصدر معظم الردود المقطوعة. يستطيع DeepSeek V4.1 Flash كتابة 393,216 توكن، لكن إن لم تضبط max_tokens فإنه يتوقف عند 8K، أو 64K عند تشغيل التفكير. ويستطيع Kimi K3 كتابة ما يصل إلى 1,048,576 توكن، لكن قيمته الافتراضية 131,072.

يحتوي مرجع API لكل نموذج على قائمة المعاملات كاملة: GPT-6 Astra وClaude Opus 5.5 وDeepSeek V4.1 Flash وKimi K3.

max_tokens أم max_completion_tokens أم max_output_tokens؟

كلها تضع سقفًا للرد. أيّها ترسل يعتمد على صيغة API وعلى النموذج:

صيغة APIالمعاململاحظات
OpenAI Responses (/v1/responses)max_output_tokensتقول OpenAI: «حد أعلى لعدد التوكنات التي يمكن توليدها للرد، بما في ذلك توكنات الإخراج الظاهرة وتوكنات الاستدلال».
OpenAI Chat Completions (/v1/chat/completions)max_completion_tokensتصف OpenAI المعامل max_tokens بأنه «مهمل لصالح max_completion_tokens» و«غير متوافق مع نماذج o-series». استخدم max_completion_tokens مع GPT-6.
Anthropic Messages (/v1/messages)max_tokensإلزامي في كل طلب.
DeepSeek Chat Completionsmax_tokensمن 1 إلى 393216.
Kimi Chat Completionsmax_completion_tokensmax_tokens هو الاسم المهمل للحد نفسه.

إذا ردّت API بعبارة "max_tokens is not supported with this model"، فانتقل إلى المعامل المذكور في هذا الجدول.

لماذا توقف النموذج قبل أن ينتهي؟

لقد وصل إلى حد الإخراج. وكل API تُبلغ عن ذلك في الرد، لا كخطأ:

APIالحقلالقيمة عند بلوغ حد الإخراج
OpenAI Responsesincomplete_details.reason"max_output_tokens"
OpenAI Chat Completionschoices[].finish_reason"length"
Anthropic Messagesstop_reason"max_tokens"
DeepSeekchoices[].finish_reason"length"

لدى Anthropic سبب توقف ثانٍ هو model_context_window_exceeded، للرد الذي ملأ نافذة السياق بأكملها. أما length في DeepSeek فيغطي الحالتين: تجاوز الرد max_tokens أو تجاوز المحادثة طول السياق.

للحل:

  1. ارفع حد الإخراج حتى الحد الأقصى للنموذج في الجدول أعلاه.
  2. اخفض مستوى الاستدلال. التفكير الأقل يترك جزءًا أكبر من الميزانية للإجابة، ويكلّف أقل.
  3. تابع بدل إعادة المحاولة. أرسل الرد الجزئي مرة أخرى واطلب من النموذج أن يكمل. يصف دليل أسباب التوقف لدى Anthropic هذا الأسلوب مع max_tokens.

ماذا يعني "context window exceeded"؟

طلبك لا يتسع في نافذة النموذج. وموضع الفشل بالتحديد يعتمد على API:

  • Claude. إذا كان الإدخال وحده أكبر من النافذة، تُعيد API خطأ 400 من نوع invalid_request_error ("prompt is too long"). وإذا كان مجموع الإدخال وmax_tokens هو الأكبر فقط، فإن وثائق Anthropic تقول إن نماذج Claude 4.5 وما بعدها، ومنها النماذج المذكورة في هذا الدليل، تقبل الطلب وتتوقف بـ stop_reason: "model_context_window_exceeded" إذا نفدت المساحة.
  • DeepSeek. ينتهي الرد بـ finish_reason: "length" عندما تتجاوز المحادثة طول السياق.

ثلاثة حلول بالترتيب:

  1. احذف الأدوار القديمة من المحادثة أو لخّصها. هذا هو الحل الوحيد عندما يكون الإدخال وحده أطول من اللازم.
  2. اخفض حد الإخراج حتى يتسع مجموع الإدخال والإخراج.
  3. انتقل إلى نموذج بنافذة أكبر. كل العائلات الأربع في الجدول أعلاه تقرأ نحو 1M توكن.

كيف تتعامل وكلاء البرمجة مع هذه الحدود؟

تضبط وكلاء البرمجة حد الإخراج نيابة عنك، وقد تكون قيمها الافتراضية أقل مما يسمح به النموذج.

Claude Code يستخدم CLAUDE_CODE_MAX_OUTPUT_TOKENS. تقول وثائقه إنه «يفترض القيمة 32000 لمعرّفات النماذج التي لا يتعرّف عليها، مثل الأسماء الخاصة بالبوابات، ويخفض القيم التي تتجاوز سقف النموذج إلى ذلك السقف». عند تشغيل DeepSeek V4.1 Flash أو Kimi K3 في Claude Code، اضبط هذا المتغيّر إذا كنت تحتاج إلى ردود أطول. وتحذّر الوثائق نفسها من أن القيمة الأعلى «تقلّل نافذة السياق الفعلية المتاحة قبل أن يبدأ الضغط التلقائي».

Codex يقرأ model_context_window من config.toml، ويصفه بأنه «توكنات نافذة السياق المتاحة للنموذج النشط». اضبطه للنماذج التي لا يعرفها Codex، كما في إعداد Kimi K3 وإعداد DeepSeek V4.1 Flash. ومع اسم نموذج لا يتعرّف عليه، يطبع Codex أيضًا: "Model metadata for <model> not found. Defaulting to fallback metadata; this can degrade performance and cause issues." (لم يُعثر على بيانات النموذج، وسيُستخدم إعداد احتياطي قد يُضعف الأداء). وتستمر الجلسة في العمل.

الأسئلة الشائعة

هل تشمل نافذة السياق توكنات الإخراج؟

نعم. الإدخال والسجل والصور والرد كلها تتشارك نافذة سياق واحدة. أما حد الإخراج الأقصى فهو سقف منفصل للرد داخل تلك النافذة.

هل تُحسب توكنات الاستدلال ضمن الحد الأقصى لتوكنات الإخراج؟

نعم، في عائلات النماذج الأربع هنا جميعها. تُحسب توكنات التفكير ضمن حد الإخراج وتُحتسب كتوكنات إخراج.

أي نموذج يكتب أطول الردود؟

يقبل Kimi K3 قيمة max_completion_tokens حتى 1,048,576، ويقبل DeepSeek V4.1 Flash قيمة max_tokens حتى 393,216. أما GPT-6 و Claude فيتوقفان عند 128K لكل طلب.

هل يكلّف الحد الأقصى الأكبر للإخراج أكثر؟

لا. أنت تدفع مقابل التوكنات التي يكتبها النموذج فعلًا، لا مقابل الحد الذي تضعه. الحد الأعلى لا يهم إلا عندما يحتاج النموذج إلى المساحة.

أين أرى الأسعار المباشرة لهذه النماذج؟

في صفحة كل نموذج: GPT-6 Astra وClaude Opus 5.5 وDeepSeek V4.1 Flash وKimi K3.

أدلة ذات صلة