Giá API Kimi K3: chi phí mỗi triệu token, bộ nhớ đệm và mỗi tác vụ
Giá API Kimi K3 cho mỗi triệu token: đầu vào, đầu ra, đầu vào từ bộ nhớ đệm và ghi bộ nhớ đệm 5 phút hoặc 1 giờ, kèm công thức tính và chi phí một tác vụ.
Đọc dạng MarkdownKimi K3 được tính phí theo token, với mức giá riêng cho đầu vào, đầu ra, đầu vào từ bộ nhớ đệm và ghi bộ nhớ đệm. Giá không thay đổi theo độ dài prompt: một prompt 900K token trả cùng mức giá mỗi token như một prompt 900 token. Đầu ra là khoản đắt nhất, và Kimi K3 luôn suy luận, nên token suy luận là một phần của đầu ra bạn phải trả. Trên SeedRouter không có gói đăng ký, và yêu cầu thất bại không bị tính phí.
Bảng dưới đây được đọc từ bảng giá tính tiền tài khoản của bạn, nên nó cho biết một yêu cầu tốn bao nhiêu vào hôm nay.
Kimi K3 giá bao nhiêu cho mỗi triệu token?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
Đầu vào từ bộ nhớ đệm là chi phí của một tiền tố prompt lặp lại khi nó được đọc từ bộ nhớ đệm. Hai cột ghi bộ nhớ đệm là chi phí ghi một tiền tố vào bộ nhớ đệm, tùy theo thời gian nó được lưu ở đó.
Giá niêm yết của Moonshot là bao nhiêu?
Để tham khảo, đây là cấu trúc giá của chính Moonshot AI cho Kimi K3, lấy từ trang giá của họ. Mỗi dòng là một bội số của giá đầu vào:
| Khoản | Bội số của đầu vào |
|---|---|
| Đầu vào (cache miss) | 1× |
| Đầu vào từ bộ nhớ đệm (cache hit) | 0.1× |
| Ghi bộ nhớ đệm, TTL 5 phút | 1× |
| Ghi bộ nhớ đệm, TTL 1 giờ | 2× |
| Đầu ra | 5× |
Bảng giá trực tiếp phía trên cho biết giá của SeedRouter cho từng khoản, và trang Kimi K3 hiển thị chúng cạnh giá niêm yết của Moonshot.
Một yêu cầu Kimi K3 được tính phí như thế nào?
Mỗi phản hồi báo cáo số lượng token trong usage, và khoản phí dựa theo đó:
prompt_tokens: toàn bộ prompt, bao gồm mọi phần lấy từ bộ nhớ đệm hoặc được ghi vào bộ nhớ đệm.prompt_tokens_details.cached_tokens: phần được đọc từ bộ nhớ đệm.prompt_tokens_details.cache_write_tokens: phần được ghi vào bộ nhớ đệm.completion_tokens: câu trả lời cộng với phần suy luận.
Khoản phí là:
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000Một tác vụ Kimi K3 tốn bao nhiêu?
Điều đó phụ thuộc vào số token mà tác vụ đọc và viết, và mức độ suy luận thay đổi phía đầu ra rất nhiều. Trong thử nghiệm của chúng tôi với cùng một câu hỏi ngắn, mức low dùng 25 token đầu ra còn max dùng 146, gần gấp sáu lần đầu ra cho cùng một prompt. Ba dạng công việc minh họa, tính bằng token:
| Tác vụ | Đầu vào | Đầu ra |
|---|---|---|
Một câu hỏi ngắn ở mức low | khoảng 100 | khoảng 30 |
Review code một file ở mức high | khoảng 5.000 | khoảng 1.500 |
| Một bước của agent trên một repository lớn | khoảng 200.000, phần lớn từ bộ nhớ đệm | khoảng 3.000 |
Nhân từng con số với giá trực tiếp ở trên. Tính theo token, đầu ra nặng gấp năm lần đầu vào, nên phần suy luận và câu trả lời thường quyết định hóa đơn. Với một agent đọc lại cùng một repository, cache hit giảm phía đầu vào xuống còn một phần mười.
1.000 token Kimi K3 giá bao nhiêu?
Một nghìn token có giá bằng giá mỗi triệu token chia cho 1.000. Moonshot tính khoảng 3 đến 4 ký tự tiếng Anh cho mỗi token, nên 1.000 token là vài nghìn ký tự văn bản. Ở mức giá đầu vào từ bộ nhớ đệm, chúng chỉ tốn một phần mười so với đầu vào mới.
Nên dùng bộ nhớ đệm 5 phút hay 1 giờ?
Bộ nhớ đệm hoạt động tự động. Theo mặc định, một tiền tố đã ghi được giữ trong 5 phút, và mỗi lần hit sẽ làm mới nó. Đặt prompt_cache_options.ttl thành 1h khi các yêu cầu của bạn cách xa nhau:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)Lần ghi 1 giờ tốn gấp đôi giá đầu vào, so với một lần cho lần ghi 5 phút. Nếu các yêu cầu của bạn cách nhau hơn năm phút, một tiền tố được đọc từ ba lần trở lên trong vòng một giờ sẽ rẻ hơn với TTL 1 giờ: một lần ghi ở 2× và hai lần hit ở 0.1× (2.2×) so với ba lần ghi 5 phút (3×).
Có cách nào chạy Kimi K3 rẻ hơn không?
Giảm mức độ suy luận là đòn bẩy lớn nhất, vì đầu ra chiếm phần lớn hóa đơn. Đặt ngữ cảnh dài, được dùng lại ở đầu prompt để nó được đọc từ bộ nhớ đệm. Trọng số của Kimi K3 là mở, nhưng với 2,8 nghìn tỷ tham số, tự chạy nó cần phần cứng cấp trung tâm dữ liệu, chỉ đáng khi khối lượng rất lớn.
Câu hỏi thường gặp
Kimi K3 có tính phí cao hơn cho prompt dài không?
Không. Kimi K3 dùng giá cố định theo token: không có bậc giá cho ngữ cảnh dài.
Kimi K3 có gói đăng ký không?
Không trên SeedRouter. Bạn nạp số dư và trả theo token. API của chính Moonshot cũng tính phí theo token và chỉ mở khóa Kimi K3 sau lần nạp tiền đầu tiên.
Yêu cầu thất bại có bị tính phí không?
Không. Một yêu cầu Kimi K3 trả về lỗi thì không bị tính phí.
Bắt đầu như thế nào?
Hướng dẫn API Kimi K3 chỉ cách lấy khóa và thực hiện lệnh gọi đầu tiên.



