Kimi K3
קריאה ל-Kimi K3 עם ה-API הרשמי בפורמט Chat Completions, Responses או Anthropic Messages: חלון הקשר של 1M טוקנים, הסקה שפועלת תמיד ורמת הסקה לבחירתך.
Kimi K3 הוא מודל הדגל של Moonshot AI לתכנות לטווח ארוך, לסוכנים ולעבודת ידע. הוא תמיד מבצע הסקה לפני שהוא עונה, ואתה בוחר את עומק ההסקה עם reasoning_effort. שלח את בקשת Kimi הרשמית ל-SeedRouter: שנה את כתובת הבסיס ואת מפתח ה-API, שמור את גוף הבקשה.
מזהה המודל
| מזהה המודל | חלון הקשר | פלט מקסימלי | רמת הסקה | רמת הסקה ברירת מחדל |
|---|---|---|---|---|
kimi-k3 | 1,048,576 טוקנים | 1,048,576 טוקנים (ברירת מחדל 131,072) | low, high, max | max |
קלט: טקסט ותמונות. פלט: טקסט. ראה את דף המודל לקבלת המחירים הנוכחיים.
דוגמה מהירה
curl https://api.seedrouter.ai/v1/chat/completions \
-H "Authorization: Bearer $SEEDROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Explain context caching in one sentence."}]
}'נקודות קצה
| פורמט | שיטה וכתובת | אימות |
|---|---|---|
| Chat Completions | POST https://api.seedrouter.ai/v1/chat/completions | Authorization: Bearer <key> |
| Responses | POST https://api.seedrouter.ai/v1/responses | Authorization: Bearer <key> |
| Anthropic Messages | POST https://api.seedrouter.ai/v1/messages | x-api-key: <key> או Authorization: Bearer <key>, בתוספת anthropic-version |
שלושתן מחזירות את פורמט התשובה הרשמי של Kimi, עם הזרמה או בלעדיה. שמור את מפתח ה-API בקוד שרץ בצד השרת.
פרמטרים
שדות Chat Completions:
| שם | סוג | חובה | ברירת מחדל | הערות |
|---|---|---|---|---|
model | string | כן | — | kimi-k3. |
messages | object[] | כן | — | הודעות טקסט; תמונות כחלקי image_url (ראה קלט תמונות). |
max_completion_tokens | integer | לא | 131072 | עד 1048576. כולל טוקני הסקה. max_tokens הוא השם הישן, שהוצא משימוש, של אותה מגבלה. |
reasoning_effort | enum | לא | max | low, high או max. כל ערך אחר מחזיר 400. |
stop | string or string[] | לא | — | עד 5 רצפים. |
response_format | object | לא | {"type": "text"} | text, json_object או json_schema (עם json_schema.name ו-json_schema.schema). |
tools | object[] | לא | — | כלים מסוג פונקציה. |
tool_choice | string or object | לא | auto | auto ו-none מופעלים. required ופונקציה בשם מתקבלים אך אינם מחייבים קריאה. |
stream | boolean | לא | false | הזרמת אירועים שנשלחים מהשרת. |
stream_options.include_usage | boolean | לא | false | מוסיף את מקטע השימוש האחרון. |
prompt_cache_options | object | לא | {"mode": "implicit", "ttl": "5m"} | mode: implicit. ttl: 5m או 1h. |
prompt_cache_key, safety_identifier, prediction | — | לא | — | מתקבלים. |
logprobs, top_logprobs | — | לא | — | מתקבלים (top_logprobs בין 0 ל-20), אך לא מוחזרות הסתברויות לוגריתמיות. |
temperature, top_p, n, presence_penalty, frequency_penalty | — | לא | 1.0, 0.95, 1, 0, 0 | קבועים. כל ערך אחר מחזיר 400, לכן אל תשלח אותם. |
הסקה ורמת הסקה
Kimi K3 מבצע הסקה תמיד; אין דרך לכבות אותה. reasoning_effort קובע כמה: max (ברירת המחדל) לעבודה הקשה ביותר, high לרוב המשימות, low לצעדים מהירים ופשוטים. ההסקה חוזרת ב-reasoning_content, לצד content. טוקני הסקה מחויבים כטוקני פלט ונספרים במסגרת max_completion_tokens.
בשיחות מרובות סבבים ובקריאות לכלים, שלח בחזרה כל הודעת assistant ללא שינוי, כולל ה-reasoning_content שלה.
קלט תמונות
Kimi K3 מקבל תמונות כ-data URI בקידוד base64. כתובת URL ציבורית של תמונה אינה מתקבלת ומחזירה 400, בדיוק כמו ב-API של Kimi עצמה.
{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64_DATA>"}},
{"type": "text", "text": "Describe this image."}
]}מטמון הקשר
המטמון אוטומטי: קידומת פרומפט שחוזרת נקראת מהמטמון בתעריף הנמוך של קלט מהמטמון. prompt_cache_options.ttl קובע כמה זמן קידומת שנכתבה נשארת במטמון, 5m (ברירת המחדל) או 1h; בחר 1h כשבין הבקשות שלך עוברות יותר מחמש דקות. usage.prompt_tokens_details.cached_tokens מדווח על הטוקנים שנקראו מהמטמון, ו-cache_write_tokens על הכתיבות למטמון שחויבו בבקשה.
מימדי חיוב
ראה את התעריפים הנוכחיים בדף המודל. בקשה מחויבת לפי הטוקנים בהם היא משתמשת:
- טוקני קלט,
- טוקני קלט מהמטמון (
cached_tokens), - טוקני כתיבה למטמון (
cache_write_tokens), - טוקני פלט, כולל הסקה.
המחירים אינם משתנים לפי אורך ההקשר. הסכום נלקח מה-usage המדווח עם התשובה שהסתיימה. בקשה שנכשלת אינה מחויבת. רשומות השימוש של החשבון שלך מציגות את החיוב המדויק לכל בקשה.
פלט
בקשת Chat Completions שאינה בהזרמה מחזירה:
{
"id": "chatcmpl-...",
"object": "chat.completion",
"created": 1790585961,
"model": "kimi-k3",
"choices": [{
"index": 0,
"finish_reason": "stop",
"message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
}],
"usage": {
"prompt_tokens": 90,
"completion_tokens": 57,
"total_tokens": 147,
"cached_tokens": 90,
"prompt_tokens_details": {"cached_tokens": 90, "cache_write_tokens": 0}
}
}עם "stream": true כל מקטע נושא delta עם reasoning_content או content. עם stream_options.include_usage, מקטע אחרון עם מערך choices ריק נושא את נתוני השימוש לפני data: [DONE].
Responses API ו-Codex
POST /v1/responses מקבל גוף Responses: input, instructions, max_output_tokens, reasoning.effort (low, high, max), text.format (json_schema), tools (function וכלי מותאם אישית apply_patch), tool_choice, stream, prompt_cache_options, prompt_cache_key ו-safety_identifier. ההסקה חוזרת כפריט reasoning עם חלק summary_text, וזרם נושא אירועים ממוספרים מ-response.created עד response.completed. ה-API חסר מצב: previous_response_id ו-conversation נדחים, לכן שלח את כל השיחה ב-input. הכלי web_search נדחה.
כדי להשתמש ב-Kimi K3 ב-Codex, הוסף provider ל-~/.codex/config.toml והגדר את SEEDROUTER_API_KEY:
model = "kimi-k3"
model_provider = "seedrouter"
model_context_window = 1048576
[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"פורמט Anthropic Messages
גם קוד שנכתב עבור Anthropic Messages API יכול לקרוא ל-Kimi K3: שלח את גוף ה-Messages אל /v1/messages עם "model": "kimi-k3". system, max_tokens, tools, tool_choice (auto, none) ו-output_config.effort (low, high, max) מופעלים, ו-metadata.user_id ו-cache_control מתקבלים. stop_sequences (עד 5), tool_choice any ו-output_config.format מתקבלים אך אין להם השפעה. ההסקה חוזרת כבלוקי thinking. תמונות נשלחות כמקורות base64.
שגיאות
שגיאות משתמשות בצורה {"error": {"code": ..., "message": "..."}} (נקודת הקצה של Messages משתמשת בצורת השגיאה של Anthropic). ה-code הוא קוד מ-קטלוג השגיאות המשותף. בקשות שנכשלו אינן מחויבות.
טיפים
- התחל עם רמת ההסקה
highועבור ל-maxרק לבעיות הקשות ביותר;lowמתאים לצעדים מהירים ופשוטים. - הגדר
max_completion_tokensגבוה מספיק גם להסקה וגם לתשובה: זה תקציב אחד לשתיהן. - שים הקשר ארוך שחוזר על עצמו בתחילת הפרומפט כדי שבקשות מאוחרות יותר יקראו אותו מהמטמון, והשתמש ב-TTL של
1hכשהבקשות מרוחקות זו מזו.
