Claude Opus 5.5 đã có trên SeedRouter
SeedRouter Docs

Kimi K3

Gọi Kimi K3 qua API Chat Completions, Responses hoặc Anthropic Messages chính thức: cửa sổ ngữ cảnh 1 triệu token, suy luận luôn bật và mức độ suy luận do bạn chọn.

View Markdown

Kimi K3 là mô hình chủ lực của Moonshot AI cho lập trình dài hạn, agent và công việc tri thức. Mô hình luôn suy luận trước khi trả lời, và bạn chọn mức độ suy luận bằng reasoning_effort. Gửi yêu cầu Kimi chính thức tới SeedRouter: thay đổi base URL và API key, giữ nguyên thân yêu cầu.

ID Mô hình

ID Mô hìnhCửa sổ ngữ cảnhĐầu ra tối đaMức độ suy luậnMức độ suy luận mặc định
kimi-k31.048.576 token1.048.576 token (mặc định 131.072)low, high, maxmax

Đầu vào: văn bản và hình ảnh. Đầu ra: văn bản. Xem trang mô hình để biết giá hiện tại.

Ví dụ nhanh

curl https://api.seedrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $SEEDROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Explain context caching in one sentence."}]
  }'

Điểm cuối

Định dạngPhương thức và đường dẫnXác thực
Chat CompletionsPOST https://api.seedrouter.ai/v1/chat/completionsAuthorization: Bearer <key>
ResponsesPOST https://api.seedrouter.ai/v1/responsesAuthorization: Bearer <key>
Anthropic MessagesPOST https://api.seedrouter.ai/v1/messagesx-api-key: <key> hoặc Authorization: Bearer <key>, cùng với anthropic-version

Cả ba đều trả về định dạng phản hồi chính thức của Kimi, dù có truyền phát hay không. Giữ API key trong mã phía máy chủ.

Tham số

Các trường của Chat Completions:

TênKiểuBắt buộcMặc địnhGhi chú
modelstringCó—kimi-k3.
messagesobject[]Có—Tin nhắn văn bản; hình ảnh dưới dạng các phần image_url (xem Đầu vào hình ảnh).
max_completion_tokensintegerKhông131072Tối đa 1048576. Bao gồm các token suy luận. max_tokens là tên cũ, đã ngừng dùng, của cùng giới hạn này.
reasoning_effortenumKhôngmaxlow, high hoặc max. Mọi giá trị khác trả về 400.
stopstring or string[]Không—Tối đa 5 chuỗi.
response_formatobjectKhông{"type": "text"}text, json_object hoặc json_schema (kèm json_schema.name và json_schema.schema).
toolsobject[]Không—Công cụ dạng hàm.
tool_choicestring or objectKhôngautoauto và none được áp dụng. required và một hàm được chỉ định tên được chấp nhận nhưng không buộc phải gọi.
streambooleanKhôngfalseTruyền phát server-sent events.
stream_options.include_usagebooleanKhôngfalseThêm chunk thông tin sử dụng cuối cùng.
prompt_cache_optionsobjectKhông{"mode": "implicit", "ttl": "5m"}mode: implicit. ttl: 5m hoặc 1h.
prompt_cache_key, safety_identifier, prediction—Không—Được chấp nhận.
logprobs, top_logprobs—Không—Được chấp nhận (top_logprobs từ 0 đến 20), nhưng không trả về xác suất log.
temperature, top_p, n, presence_penalty, frequency_penalty—Không1.0, 0.95, 1, 0, 0Cố định. Mọi giá trị khác trả về 400, vì vậy đừng gửi các trường này.

Suy luận và mức độ suy luận

Kimi K3 luôn suy luận; không có cách nào tắt. reasoning_effort đặt lượng suy luận: max (mặc định) cho công việc khó nhất, high cho hầu hết tác vụ, low cho các bước nhanh, đơn giản. Phần suy luận được trả về trong reasoning_content, bên cạnh content. Token suy luận được tính phí như token đầu ra và được tính vào max_completion_tokens.

Trong hội thoại nhiều lượt và các lần gọi công cụ, hãy gửi lại mỗi tin nhắn assistant nguyên vẹn, bao gồm cả reasoning_content của nó.

Đầu vào hình ảnh

Kimi K3 nhận hình ảnh dưới dạng base64 data URI. URL hình ảnh công khai không được chấp nhận và trả về 400, giống như trên API của chính Kimi.

{"role": "user", "content": [
  {"type": "image_url", "image_url": {"url": "data:image/png;base64,<BASE64_DATA>"}},
  {"type": "text", "text": "Describe this image."}
]}

Bộ nhớ đệm ngữ cảnh

Bộ nhớ đệm hoạt động tự động: một tiền tố prompt lặp lại được đọc từ bộ nhớ đệm với mức giá đầu vào từ bộ nhớ đệm thấp hơn. prompt_cache_options.ttl chọn thời gian một tiền tố đã ghi được giữ trong bộ nhớ đệm, 5m (mặc định) hoặc 1h; hãy chọn 1h khi các yêu cầu của bạn cách nhau hơn năm phút. usage.prompt_tokens_details.cached_tokens báo cáo số token đọc từ bộ nhớ đệm và cache_write_tokens báo cáo lượng ghi bộ nhớ đệm được tính phí cho yêu cầu.

Các yếu tố chi phí

Xem giá hiện tại trên trang mô hình. Yêu cầu được tính phí theo token mà nó sử dụng:

  • token đầu vào,
  • token đầu vào từ bộ nhớ đệm (cached_tokens),
  • token ghi bộ nhớ đệm (cache_write_tokens),
  • token đầu ra, bao gồm suy luận.

Giá không thay đổi theo độ dài ngữ cảnh. Phí được lấy từ usage báo cáo kèm phản hồi hoàn thành. Yêu cầu thất bại không bị tính phí. Các bản ghi sử dụng của tài khoản bạn hiển thị phí chính xác cho mỗi yêu cầu.

Đầu ra

Yêu cầu Chat Completions không truyền phát trả về:

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "created": 1790585961,
  "model": "kimi-k3",
  "choices": [{
    "index": 0,
    "finish_reason": "stop",
    "message": {"role": "assistant", "reasoning_content": "...", "content": "..."}
  }],
  "usage": {
    "prompt_tokens": 90,
    "completion_tokens": 57,
    "total_tokens": 147,
    "cached_tokens": 90,
    "prompt_tokens_details": {"cached_tokens": 90, "cache_write_tokens": 0}
  }
}

Với "stream": true, mỗi chunk mang một delta chứa reasoning_content hoặc content. Với stream_options.include_usage, một chunk cuối có mảng choices rỗng mang thông tin sử dụng trước data: [DONE].

Responses API và Codex

POST /v1/responses nhận thân Responses: input, instructions, max_output_tokens, reasoning.effort (low, high, max), text.format (json_schema), tools (function và công cụ tùy chỉnh apply_patch), tool_choice, stream, prompt_cache_options, prompt_cache_key và safety_identifier. Phần suy luận được trả về dưới dạng mục reasoning có phần summary_text, và luồng truyền phát mang các sự kiện được đánh số từ response.created đến response.completed. API này không lưu trạng thái: previous_response_id và conversation bị bỏ qua, vì vậy hãy gửi toàn bộ hội thoại trong input. Công cụ web_search bị bỏ qua.

Để dùng Kimi K3 trong Codex, thêm một provider vào ~/.codex/config.toml và đặt SEEDROUTER_API_KEY:

model = "kimi-k3"
model_provider = "seedrouter"
model_context_window = 1048576

[model_providers.seedrouter]
name = "SeedRouter"
base_url = "https://api.seedrouter.ai/v1"
env_key = "SEEDROUTER_API_KEY"
wire_api = "responses"

Định dạng Anthropic Messages

Mã viết cho Anthropic Messages API cũng có thể gọi Kimi K3: gửi thân Messages tới /v1/messages với "model": "kimi-k3". system, max_tokens, tools, tool_choice (auto, none) và output_config.effort (low, high, max) được áp dụng, còn metadata.user_id và cache_control được chấp nhận. stop_sequences (tối đa 5), tool_choice any và output_config.format được chấp nhận nhưng không có tác dụng. Phần suy luận được trả về dưới dạng các khối thinking. Hình ảnh được gửi dưới dạng nguồn base64.

Lỗi

Lỗi sử dụng {"error": {"code": ..., "message": "..."}} (điểm cuối Messages dùng định dạng lỗi của Anthropic). code là một mã từ danh mục lỗi chung. Các yêu cầu thất bại không bị tính phí.

Mẹo

  • Bắt đầu với mức độ suy luận high và chỉ chuyển sang max cho những vấn đề khó nhất; low phù hợp với các bước nhanh, đơn giản.
  • Đặt max_completion_tokens đủ cao cho cả phần suy luận lẫn câu trả lời: đó là một ngân sách chung cho cả hai.
  • Đặt ngữ cảnh dài, được tái sử dụng ở đầu prompt để các yêu cầu sau đọc nó từ bộ nhớ đệm, và dùng TTL 1h khi các yêu cầu cách xa nhau.

Liên quan