Kimi K3 API 价格:每百万 token 多少钱、缓存费率与单次任务成本
Kimi K3 API 每百万 token 价格:输入、输出、缓存输入,以及 5 分钟或 1 小时缓存写入费率,附计费公式和一次任务的成本。
以 Markdown 阅读Kimi K3 按 token 计费,输入、输出、缓存输入和缓存写入各有费率。价格不随提示长度变化:一个 90 万 token 的提示与一个 900 token 的提示按相同的每 token 费率计费。输出最贵,而 Kimi K3 始终会推理,所以推理 token 也是你要付费的输出的一部分。在 SeedRouter 上没有订阅,失败的请求不收费。
下表直接读取为你账户计费的费率表,所以显示的就是今天一次请求的成本。
Kimi K3 每百万 token 多少钱?
Kimi K3
Current rates are temporarily unavailable. No price estimate is provided; unavailable rates must not be interpreted as free usage.
缓存输入是重复的提示前缀从缓存中读取时的费用。两列缓存写入是把前缀写入缓存的费用,按它在缓存中保留的时长区分。
Moonshot 的官方标价是多少?
作为参考,这是 Moonshot AI 自己对 Kimi K3 的定价结构,来自其定价页。每一项都是输入费率的倍数:
| 项目 | 相对输入的倍数 |
|---|---|
| 输入(缓存未命中) | 1× |
| 缓存输入(缓存命中) | 0.1× |
| 缓存写入,5 分钟 TTL | 1× |
| 缓存写入,1 小时 TTL | 2× |
| 输出 | 5× |
上面的实时表格列出了 SeedRouter 每一项的费率,Kimi K3 页面把它们与 Moonshot 的官方标价并列展示。
一次 Kimi K3 请求怎么计费?
每个响应都会在 usage 中报告 token 数量,费用按这些数量计算:
prompt_tokens:整个提示,包括缓存命中或写入缓存的部分。prompt_tokens_details.cached_tokens:从缓存读取的部分。prompt_tokens_details.cache_write_tokens:写入缓存的部分。completion_tokens:回答加上推理。
费用为:
cost = ( (prompt - cached - cache writes) × input rate
+ cached × cached-input rate
+ cache writes × cache-write rate for the TTL
+ completion × output rate ) / 1,000,000一次 Kimi K3 任务多少钱?
这取决于任务读取和生成多少 token,而推理强度对输出一侧影响很大。在我们对同一个简短问题的测试中,low 用了 25 个输出 token,max 用了 146 个,同样的提示,输出几乎是前者的六倍。三种示意性的任务规模(单位:token):
| 任务 | 输入 | 输出 |
|---|---|---|
low 强度下的一个简短问题 | 约 100 | 约 30 |
high 强度下审查一个文件的代码 | 约 5,000 | 约 1,500 |
| 在大型代码库上运行的一个 agent 步骤 | 约 200,000,大部分命中缓存 | 约 3,000 |
把每一项乘以上面的实时费率即可。每个输出 token 的价格是输入的五倍,所以推理和回答通常决定账单。对于反复读取同一代码库的 agent,缓存命中能把输入一侧降到十分之一。
1,000 个 Kimi K3 token 多少钱?
1,000 个 token 的价格等于每百万费率除以 1,000。Moonshot 估算每个 token 大约对应 3 到 4 个英文字符,所以 1,000 个 token 就是几千个字符的文本。按缓存输入费率,它们只需全新输入的十分之一。
该用 5 分钟缓存还是 1 小时缓存?
缓存是自动的。默认情况下,写入的前缀保留 5 分钟,每次命中都会刷新。请求间隔较长时,把 prompt_cache_options.ttl 设为 1h:
completion = client.chat.completions.create(
model="kimi-k3",
messages=messages,
prompt_cache_options={"mode": "implicit", "ttl": "1h"},
)1 小时写入的费用是输入费率的两倍,5 分钟写入是一倍。如果你的请求间隔超过五分钟,一个前缀在一小时内被读取三次或以上时,用 1 小时 TTL 更便宜:一次 2× 的写入加两次 0.1× 的命中(2.2×),对比三次 5 分钟写入(3×)。
有没有更便宜的方式运行 Kimi K3?
降低推理强度是最大的杠杆,因为输出占了账单的大头。把长的、重复使用的上下文放在提示开头,让它从缓存读取。Kimi K3 的权重是开放的,但它有 2.8 万亿参数,自己运行需要数据中心级别的硬件,只有在调用量非常大时才划算。
常见问题
Kimi K3 对长提示收费更高吗?
不会。Kimi K3 采用统一的每 token 定价:没有长上下文档位。
Kimi K3 有订阅吗?
在 SeedRouter 上没有。你充值余额,按 token 付费。Moonshot 自己的 API 同样按 token 计费,并且首次充值后才解锁 Kimi K3。
失败的请求收费吗?
不收费。返回错误的 Kimi K3 请求不收费。
怎么开始?
Kimi K3 API 指南介绍了如何获取 key 并完成第一次调用。



