Claude Opus 5.5 已在 SeedRouter 上线
LogoSeedRouter

按名称搜索模型,例如 nano banana

按名称搜索模型,例如 nano banana

Claude Haiku 5.5 价格:token、缓存与 100K 阈值

了解 Claude Haiku 5.5 的 token 价格、100K 输入阈值、缓存写入与读取,以及已完成请求的费用估算方法。

以 Markdown 阅读

Claude Haiku 5.5 价格取决于调用服务与请求包含的上下文数量。 Anthropic 对不超过 100,000 token 和超过这一阈值的提示词公布了不同费率。在 SeedRouter 上,请用下方实时价格表估算请求,不要用厂商价格表代替应用中显示的费率。[1]

本指南分别说明官方价格结构、缓存计费与估算所需的用量数据。Claude Haiku 5.5 模型页提供在线体验与当前价格。如果正在选择模型,请先阅读 Haiku 5.5 与 Sonnet 5.5 对比指南。

Anthropic 对 Claude Haiku 5.5 如何收费?

以下为 Anthropic 公布的价格,核查日期为 2026 年 10 月 9 日。金额均按每百万 token 计算,描述的是其标准 token 价格,并非 SeedRouter 收取的实时费率。[1]

Token 类别提示词不超过 100K token提示词超过 100K token
输入$0.10$0.50
输出$0.50$2.50
5 分钟缓存写入$0.125$0.625
1 小时缓存写入$0.20$1.00
缓存读取$0.01$0.05

单看输出 token 费率无法描述整个请求。简短回答可能对应很长的文档,而重复文档可能产生缓存读取用量,而非全部作为新输入计费。比较账单时,请将这些类别分开。

超过 100K 阈值后会发生什么?

官方概览为两个提示词大小档位设置了不同的输入、输出与缓存费率。因此,跨过阈值影响的不只是额外输入的费用。请检查实际使用服务的计费规则,并保留其返回的用量,尤其是请求同时包含新输入与缓存上下文时。[1]

这个阈值不是上下文窗口上限。Haiku 5.5 的上下文窗口为 100 万 token,标准最大输出为 128,000 token。这些是能力上限,不意味着每次调用都会预留整个窗口或按整个窗口收费。较大的 max_tokens 值代表输出预算,返回的用量才说明模型实际消耗了多少。[1]

应用中可以比较两个实际任务:一个仅包含相关摘录,另一个包含完整原始文档。在将减少 token 视为节省费用之前,先记录较短输入是否仍能产生可接受的结果。

缓存写入与读取如何影响账单?

缓存写入创建可复用的提示词前缀,缓存读取则复用已有前缀。Haiku 5.5 可缓存提示词的最低长度为 512 token。给更短的提示词添加缓存控制,并不能证明已缓存:请检查响应中的 cache_creation_input_tokens 与 cache_read_input_tokens。[2]

5 分钟与 1 小时有效期有不同的写入费率。有效期较长的前缀应放在较短的前缀之前,缓存断点不超过 4 个。若指令与参考资料在多次请求间保持不变,就适合复用。前缀开头附近的文本若频繁变化,会降低复用机会。[2]

对每次请求,将未缓存输入、缓存创建、缓存读取与输出分别记录。不要同时累加缓存创建总量与其 5 分钟/1 小时明细,从而对同一批缓存创建 token 计费两次。请用明细将该总量划分到相应类别。

SeedRouter 当前费率是多少?

此表读取当前费率,是通过 SeedRouter 发起请求的价格依据;上方官方上下文档位是另一份参考。

Claude Haiku 5.5

Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-haiku-5-5$0.35$1.75$0.035$0.4375unavailable

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.

模型页价格区块的示例使用相同的当前费率。估算新工作负载前,请刷新价格表。缺少某一价格行并不证明对应的用量免费。

如何估算已完成请求的费用?

对每百万 token 计价的费率,将各用量类别乘以对应费率,再除以一百万,最后相加:

estimated cost = (
  uncached input tokens × input rate
  + output tokens × output rate
  + cache-read tokens × cache-read rate
  + five-minute cache-write tokens × five-minute write rate
  + one-hour cache-write tokens × one-hour write rate
) / 1,000,000

思考 token 属于输出用量。如果响应包含思考 token 明细,不要在返回的总输出 token 之外再次累加。默认思考努力程度为 medium;改变努力程度可能改变生成的推理量,因此请比较已完成的任务,不要假定所有设置下的 token 数相同。[3]

预测工作负载时,请保留一组有代表性的请求、用量,以及结果是否通过检查。将回答不合格导致的重试也纳入统计。需要第二次尝试的低价响应,与第一次就合格的响应,总费用不同。API 参考说明了应记录的字段、停止原因与限制。

价格常见问题

官方短上下文价格就是我在 SeedRouter 支付的价格吗?

SeedRouter 请以实时价格表为准。Anthropic 公布的表格描述其自身定价,模型名称相同不能证明收费相同。

将 max_tokens 设为 128000 会对全部这些 token 收费吗?

它设置最大输出预算。请按返回的用量估算已完成请求,包含思考用量,并检查停止原因,确认输出是否达到该上限。[1]

缓存控制字段能保证命中缓存吗?

不能。提示词必须达到最低长度,且匹配可用的缓存前缀。响应中的缓存读取数量才是发生复用的证据。[2]

失败的请求会收费吗?

返回错误的请求不收费。成功响应若因达到输出上限而停止,仍属于已完成的生成,请检查其用量与停止原因。

来源

  1. Anthropic:Claude Haiku 5.5 概览与价格。
  2. Anthropic:提示缓存。
  3. Anthropic:Haiku 5.5 的新功能。

相关指南