מפרט DeepSeek V4.1 Flash: חלון הקשר, פלט מקסימלי, גודל וברירות מחדל
מפרט DeepSeek V4.1 Flash: מודל MoE עם 552B פרמטרים, הקשר של 1M טוקנים, פלט מקסימלי של 384K, קלט תמונות, מצבי חשיבה וברירות המחדל שקוטעות תשובות.
קריאה כ-MarkdownDeepSeek V4.1 Flash הוא מודל mixture-of-experts עם 552 מיליארד פרמטרים, חלון הקשר של 1M טוקנים ופלט מקסימלי של 393,216 טוקנים (384K) לבקשה. הוא קורא טקסט ותמונות, כותב טקסט וחושב לפני שהוא עונה, אלא אם מכבים את החשיבה. DeepSeek שחררה אותו ב-10 בספטמבר 2026. המפרט שרוב האנשים נתקלים בו הוא מגבלת הפלט המוגדרת כברירת מחדל, שנמוכה בהרבה מהמקסימום.
המפרט של DeepSeek V4.1 Flash במבט אחד
| מפרט | ערך |
|---|---|
| מפתח | DeepSeek |
| תאריך יציאה | 10 בספטמבר 2026 |
| ארכיטקטורה | Mixture of experts, Causal Encoder–Decoder |
| סך הפרמטרים | 552B |
| פרמטרים פעילים | 8B לקלט, 16B לפלט |
| חלון הקשר | 1M טוקנים |
| פלט מקסימלי | 393,216 טוקנים (384K), כולל הסקה |
| מגבלת פלט ברירת מחדל | 8K בלי חשיבה, 64K עם חשיבה, 128K ברמה max |
| קלט | טקסט ותמונות |
| פלט | טקסט |
| חשיבה | פעילה כברירת מחדל ברמה high; none, low, high או max |
| מזהה מודל ב-SeedRouter | deepseek-v4.1-flash |
| מזהה מודל ב-API של DeepSeek | deepseek-flash |
מה הגודל של DeepSeek V4.1 Flash?
552 מיליארד פרמטרים בסך הכול. הודעת השחרור של DeepSeek מתארת "ארכיטקטורת Causal Encoder–Decoder חדשה: רק 8B פרמטרים פעילים לקלט, ו-16B לפלט." רק חלק קטן מהמודל רץ עבור כל טוקן, ולכן הוא מהיר וזול להגשה למרות גודלו.
DeepSeek אומרת גם שה-KV cache שלו צריך "רבע מה-HBM" ו"שמינית מאחסון ה-SSD" לעומת הדור הקודם. זה חשוב בסשנים ארוכים של סוכנים, שבהם קלט שמור במטמון מהווה חלק גדול מהעלות.
מה חלון ההקשר של DeepSeek V4.1 Flash?
1M טוקנים. הפרומפט, התמונות, היסטוריית השיחה והתשובה חולקים אותו. מדריך ה-API של DeepSeek מנסח זאת כך: "האורך הכולל של טוקני הקלט והטוקנים שנוצרו מוגבל על ידי אורך ההקשר של המודל."
כדי להבין איך מגבלות ההקשר והפלט משתלבות במודלים שונים, ראו חלון הקשר מול מקסימום טוקני פלט.
מה הפלט המקסימלי של DeepSeek V4.1 Flash?
393,216 טוקנים לבקשה, ש-DeepSeek מציגה כ-"MAXIMUM: 384K". ההסקה נספרת בתוכם.
הבעיה היא ברירת המחדל. אם לא מגדירים max_tokens, המדריך של DeepSeek אומר שהמגבלה היא "8K במצב ללא חשיבה, 64K במצב חשיבה (128K כש-reasoning_effort מוגדר ל-max)". תשובה ארוכה או שרשרת הסקה ארוכה פוגעות בברירת המחדל הזו הרבה לפני התקרה האמיתית, והתשובה מסתיימת ב-finish_reason: "length".
כדי לקבל תשובות ארוכות יותר, הגדירו את max_tokens בעצמכם, בכל ערך מ-1 עד 393216:
{
"model": "deepseek-v4.1-flash",
"max_tokens": 200000,
"messages": [{"role": "user", "content": "Write the full migration plan."}]
}משלמים רק על הטוקנים שהמודל כותב, כך שמגבלה גבוהה לא עולה יותר כשלעצמה.
האם DeepSeek V4.1 Flash קורא תמונות?
כן. DeepSeek מתארת אותו כמודל "עם הבנה חזותית מובנית". ב-SeedRouter, תמונות נכנסות להודעת משתמש כחלקי image_url, כ-URL ציבורי או כ-data URI בקידוד base64. URL יכול להיות באורך של עד 8,192 תווים ולהצביע על תמונה של עד 32 MiB. הפלט הוא תמיד טקסט.
איך עובדים מצבי החשיבה?
החשיבה פעילה כברירת מחדל ברמה high. אפשר:
- לכבות אותה עם
"thinking": {"type": "disabled"}או"reasoning_effort": "none", לתשובות מהירות עם פחות טוקני פלט; - להגדיר את
reasoning_effortל-low,highאוmax.
ההסקה חוזרת ב-reasoning_content, לצד התשובה, ומחויבת כטוקני פלט. כשהחשיבה פעילה, ל-temperature אין השפעה, וערכי top_p נמוכים מ-0.95 רצים כ-0.95.
אילו ממשקי API יכולים לקרוא לו?
ב-SeedRouter, DeepSeek V4.1 Flash מקבל שלושה פורמטים של בקשות עם אותו מפתח:
| פורמט | נקודת קצה |
|---|---|
| OpenAI Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions |
| OpenAI Responses | POST https://api.seedrouter.ai/v1/responses |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages |
קריאות לכלים עובדות בשלושתם. פורמט Anthropic הוא מה ש-Claude Code משתמש בו, ופורמט Responses הוא מה ש-Codex משתמש בו; בהגדרת Claude Code ו-Codex יש תצורות שנבדקו. כל פרמטר מופיע במדריך ה-API של DeepSeek V4.1 Flash.
איך הוא מתומחר?
לפי טוקן, עם תעריפים נפרדים לקלט שפוגע במטמון, לקלט שלא פוגע בו ולפלט. התעריפים יורדים בחצי מחוץ לשעות השיא: שעות השיא הן 01:00–04:00 ו-06:00–10:00 UTC, שני עד שישי, וכל שעה אחרת היא מחוץ לשעות השיא. עמוד DeepSeek V4.1 Flash מציג את התעריפים החיים, ומדריך המחירים עובר על דוגמאות.
שאלות נפוצות
האם DeepSeek V4.1 Flash הוא קוד פתוח?
DeepSeek מפרסמת את המשקלים ב-Hugging Face; האם DeepSeek V4.1 Flash חינמי? מסביר מה זה אומר מבחינת עלות.
האם deepseek-v4-flash הוא אותו מודל?
ב-API של DeepSeek עצמה, השם הישן מנותב עכשיו ל-V4.1 Flash. עמוד המחירים של DeepSeek אומר ש"המודלים המתאימים הוצאו משימוש, והבקשות שלהם מוגשות על ידי המודל DeepSeek-V4.1-Flash". V4.1 Flash מול V4 Flash מפרט מה השתנה.
למה DeepSeek V4.1 Flash נעצר ב-8K טוקנים?
זו מגבלת הפלט המוגדרת כברירת מחדל כשהחשיבה כבויה. הגדירו max_tokens עד 393216 כדי לאפשר תשובות ארוכות יותר.
האם חלון ההקשר כולל את הפלט?
כן. קלט ופלט חולקים את חלון ה-1M טוקנים.
איך הוא משתווה ל-DeepSeek V4 Pro?
DeepSeek מדווחת ש-V4.1 Flash מקדים את V4 Pro במדדים שלה, והוא עולה פחות. ראו DeepSeek V4.1 Flash מול V4 Pro.



