Claude Opus 5.5 כבר זמין ב-SeedRouter
SeedRouter Docs

Kimi K3

קריאה ל-Kimi K3 עם ה-API הרשמי בפורמט Chat Completions, Responses או Anthropic Messages: חלון הקשר של 1M טוקנים, הסקה שפועלת תמיד ורמת הסקה לבחירתך.

View Markdown

Kimi K3 הוא מודל הדגל של Moonshot AI לתכנות לטווח ארוך, לסוכנים ולעבודת ידע. הוא תמיד מבצע הסקה לפני שהוא עונה, ואתה בוחר את עומק ההסקה עם reasoning_effort. שלח את בקשת Kimi הרשמית ל-SeedRouter: שנה את כתובת הבסיס ואת מפתח ה-API, שמור את גוף הבקשה.

מזהה המודל

מזהה המודלחלון הקשרפלט מקסימלירמת הסקהרמת הסקה ברירת מחדל
kimi-k31,048,576 טוקנים1,048,576 טוקנים (ברירת מחדל 131,072)low, high, maxmax

קלט: טקסט ותמונות. פלט: טקסט. ראה את דף המודל לקבלת המחירים הנוכחיים.

דוגמה מהירה

curl https://api.seedrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Explain context caching in one sentence."}]
  }'

נקודות קצה

פורמטשיטה וכתובתאימות
Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> או Authorization: Bearer <key>, בתוספת anthropic-version

שלושתן מחזירות את פורמט התשובה הרשמי של Kimi, עם הזרמה או בלעדיה. שמור את מפתח ה-API בקוד שרץ בצד השרת.

פרמטרים

שדות Chat Completions:

שםסוגחובהברירת מחדלהערות
modelstringכן—kimi-k3.
messagesobject[]כן—הודעות טקסט; תמונות כחלקי image_url (ראה קלט תמונות).
max_completion_tokensintegerלא131072עד 1048576. כולל טוקני הסקה. max_tokens הוא השם הישן, שהוצא משימוש, של אותה מגבלה.
reasoning_effortenumלאmaxlow, high או max. כל ערך אחר מחזיר 400.
stopstring or string[]לא—עד 5 רצפים.
response_formatobjectלא{"type": "text"}text, json_object או json_schema (עם json_schema.name ו-json_schema.schema).
toolsobject[]לא—כלים מסוג פונקציה.
tool_choicestring or objectלאautoauto ו-none מופעלים. required ופונקציה בשם מתקבלים אך אינם מחייבים קריאה.
streambooleanלאfalseהזרמת אירועים שנשלחים מהשרת.
stream_options.include_usagebooleanלאfalseמוסיף את מקטע השימוש האחרון.
prompt_cache_optionsobjectלא{"mode": "implicit", "ttl": "5m"}mode: implicit. ttl: 5m או 1h.
prompt_cache_key, safety_identifier, prediction—לא—מתקבלים.
logprobs, top_logprobs—לא—מתקבלים (top_logprobs בין 0 ל-20), אך לא מוחזרות הסתברויות לוגריתמיות.
temperature, top_p, n, presence_penalty, frequency_penalty—לא1.0, 0.95, 1, 0, 0קבועים. כל ערך אחר מחזיר 400, לכן אל תשלח אותם.

הסקה ורמת הסקה

Kimi K3 מבצע הסקה תמיד; אין דרך לכבות אותה. reasoning_effort קובע כמה: max (ברירת המחדל) לעבודה הקשה ביותר, high לרוב המשימות, low לצעדים מהירים ופשוטים. ההסקה חוזרת ב-reasoning_content, לצד content. טוקני הסקה מחויבים כטוקני פלט ונספרים במסגרת max_completion_tokens.

בשיחות מרובות סבבים ובקריאות לכלים, שלח בחזרה כל הודעת assistant ללא שינוי, כולל ה-reasoning_content שלה.

קלט תמונות

Kimi K3 מקבל תמונות כ-data URI בקידוד base64. כתובת URL ציבורית של תמונה אינה מתקבלת ומחזירה 400, בדיוק כמו ב-API של Kimi עצמה.

{"role": "user", "content": [
  {"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64_DATA>"}},
  {"type": "text", "text": "Describe this image."}
]}

מטמון הקשר

המטמון אוטומטי: קידומת פרומפט שחוזרת נקראת מהמטמון בתעריף הנמוך של קלט מהמטמון. prompt_cache_options.ttl קובע כמה זמן קידומת שנכתבה נשארת במטמון, 5m (ברירת המחדל) או 1h; בחר 1h כשבין הבקשות שלך עוברות יותר מחמש דקות. usage.prompt_tokens_details.cached_tokens מדווח על הטוקנים שנקראו מהמטמון, ו-cache_write_tokens על הכתיבות למטמון שחויבו בבקשה.

מימדי חיוב

ראה את התעריפים הנוכחיים בדף המודל. בקשה מחויבת לפי הטוקנים בהם היא משתמשת:

  • טוקני קלט,
  • טוקני קלט מהמטמון (cached_tokens),
  • טוקני כתיבה למטמון (cache_write_tokens),
  • טוקני פלט, כולל הסקה.

המחירים אינם משתנים לפי אורך ההקשר. הסכום נלקח מה-usage המדווח עם התשובה שהסתיימה. בקשה שנכשלת אינה מחויבת. רשומות השימוש של החשבון שלך מציגות את החיוב המדויק לכל בקשה.

פלט

בקשת Chat Completions שאינה בהזרמה מחזירה:

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "created": 1790585961,
  "model": "kimi-k3",
  "choices": [{
    "index": 0,
    "finish_reason": "stop",
    "message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
  }],
  "usage": {
    "prompt_tokens": 90,
    "completion_tokens": 57,
    "total_tokens": 147,
    "cached_tokens": 90,
    "prompt_tokens_details": {"cached_tokens": 90, "cache_write_tokens": 0}
  }
}

עם "stream": true כל מקטע נושא delta עם reasoning_content או content. עם stream_options.include_usage, מקטע אחרון עם מערך choices ריק נושא את נתוני השימוש לפני data: [DONE].

Responses API ו-Codex

POST /v1/responses מקבל גוף Responses: input, instructions, max_output_tokens, reasoning.effort (low, high, max), text.format (json_schema), tools (function וכלי מותאם אישית apply_patch), tool_choice, stream, prompt_cache_options, prompt_cache_key ו-safety_identifier. ההסקה חוזרת כפריט reasoning עם חלק summary_text, וזרם נושא אירועים ממוספרים מ-response.created עד response.completed. ה-API חסר מצב: previous_response_id ו-conversation נדחים, לכן שלח את כל השיחה ב-input. הכלי web_search נדחה.

כדי להשתמש ב-Kimi K3 ב-Codex, הוסף provider ל-~/.codex/config.toml והגדר את SEEDROUTER_API_KEY:

model = "kimi-k3"
model_provider = "seedrouter"
model_context_window = 1048576

[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"

פורמט Anthropic Messages

גם קוד שנכתב עבור Anthropic Messages API יכול לקרוא ל-Kimi K3: שלח את גוף ה-Messages אל /v1/messages עם "model": "kimi-k3". system, max_tokens, tools, tool_choice (auto, none) ו-output_config.effort (low, high, max) מופעלים, ו-metadata.user_id ו-cache_control מתקבלים. stop_sequences (עד 5), tool_choice any ו-output_config.format מתקבלים אך אין להם השפעה. ההסקה חוזרת כבלוקי thinking. תמונות נשלחות כמקורות base64.

שגיאות

שגיאות משתמשות בצורה {"error": {"code": ..., "message": "..."}} (נקודת הקצה של Messages משתמשת בצורת השגיאה של Anthropic). ה-code הוא קוד מ-קטלוג השגיאות המשותף. בקשות שנכשלו אינן מחויבות.

טיפים

  • התחל עם רמת ההסקה high ועבור ל-max רק לבעיות הקשות ביותר; low מתאים לצעדים מהירים ופשוטים.
  • הגדר max_completion_tokens גבוה מספיק גם להסקה וגם לתשובה: זה תקציב אחד לשתיהן.
  • שים הקשר ארוך שחוזר על עצמו בתחילת הפרומפט כדי שבקשות מאוחרות יותר יקראו אותו מהמטמון, והשתמש ב-TTL של 1h כשהבקשות מרוחקות זו מזו.

קשור