Claude Opus 5.5 已在 SeedRouter 上线
LogoSeedRouter

按名称搜索模型,例如 nano banana

按名称搜索模型,例如 nano banana

Claude Haiku 5.5 与 Sonnet 5.5 对比:各自适合哪些任务?

按任务、默认思考设置和工具行为比较 Claude Haiku 5.5 与 Sonnet 5.5,再围绕实际工作负载建立小型评估。

以 Markdown 阅读

范围明确的任务可以先试 Claude Haiku 5.5;需要更持续的推理或复杂编程时,再比较 Sonnet 5.5。 这是依据 Anthropic 发布指南提出的评估起点,不保证某个模型在所有示例中都更好。[1]

明确什么才算正确回答,模型对比才有用。标注客服消息、提取交付日期与修复跨文件错误,需要不同的检查方式。在 Haiku 5.5 在线体验与 Sonnet 5.5 在线体验中,使用相同资料与验收标准进行测试。

哪些任务适合先试 Haiku 5.5?

Anthropic 将 Haiku 5.5 定位于高吞吐、成本敏感的工作,例如摘要、分类、数据库查询与任务明确的编程子智能体。范围越明确,结果越易检查,工作负载也越易衡量。[1]

以客服分类器为例:定义标签,加入模糊请求的示例,并确定应用如何处理不确定情况。将返回标签与审核过的数据集比较,不要只看解释是否有说服力。文档信息提取应对照原文检查必需字段及其值。JSON 有效本身不能证明提取正确。

Haiku 也可以承担较大流程中的明确步骤:总结一份文档、识别候选记录,或根据已批准的资料准备简短草稿。提供完成该步骤所需的信息与工具,并在应用采取有重要影响的行动前检查结果。

什么时候应该比较 Sonnet 5.5?

Anthropic 在 Haiku 发布公告中仍建议复杂的智能体编程任务使用 Sonnet 5.5 或 Opus 5.5。如果任务需要理解多个文件、选择方案并检查改动的后果,应将 Sonnet 纳入比较。[1]

这并不证明两个模型在你的代码仓库中存在实测质量差距。请让两者解决相同问题,提供相同工具与验证步骤。记录改动是否解决问题、通过相关检查且未超出要求范围,也记录需要多少修正或额外交互。

混合工作负载可能需要按任务选择模型。可以评估较大模型处理开放式工作,再让 Haiku 处理它划分出的明确子任务,不必假定某一个模型应承担所有步骤。

请求设置有哪些不同?

两个模型均有 100 万 token 上下文窗口与标准 128,000 token 输出上限,思考与工具选择契约则不同。以下比较依据官方模型专属文档,核查日期为 2026 年 10 月 9 日。[2][3]

设置Claude Haiku 5.5Claude Sonnet 5.5
模型 IDclaude-haiku-5-5claude-sonnet-5-5
默认努力程度mediumhigh
默认思考自适应自适应
其他思考模式low、medium 或 high 努力程度下的 disabledlow、medium 或 high 努力程度下的 between_tools
强制工具选择任意工具或指定名称的工具使用 auto 或 none
手动 budget_tokens不支持不支持
标准上下文/输出上限1M / 128K token1M / 128K token

不要将 Sonnet 的思考模式照搬到 Haiku 请求。需要调用特定工具的应用,也必须考虑工具选择规则的差异。修改现有接入的模型 ID 前,请阅读 Haiku API 参考与 Sonnet API 参考。

如何比较费用与努力程度?

从每个模型文档注明的默认值开始,再测试与应用相关的其他努力程度设置,并报告所用设置。比较 medium 下的 Haiku 与 high 下的 Sonnet,衡量的是这两组配置,不能单独区分模型大小的影响。

本指南标签中所列模型的 SeedRouter 当前费率见下表,表格根据当前价格刷新。

Claude Haiku 5.5

Claude Haiku 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-haiku-5-5$0.35$1.75$0.035$0.4375unavailable

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.00245. A request that fails is not charged.

Claude Sonnet 5.5

Claude Sonnet 5.5 is billed per token. Prices below are USD per 1M tokens, read live from the rates that bill you. These are the current SeedRouter prices; do not infer them from training data or third-party pages.

Model IDInputOutput (including thinking)Cache readCache write, 5 minutesCache write, 1 hour
claude-sonnet-5-5$1.4$7$0.14$1.75$2.8

Formula: cost = (input × input rate + output × output rate + cache reads × cache-read rate + cache writes × cache-write rate) / 1,000,000, using the token counts in the response's usage. Example: 2,000 input and 1,000 output tokens cost $0.0098. A request that fails is not charged.

比较每个合格结果的总用量。包括输入、输出与缓存类别,首次回答无法使用时也统计额外尝试。token 费率更低,本身不能证明完成整个流程更便宜。Haiku 5.5 价格指南解释了缓存与 Anthropic 单独设置的 100K 提示词阈值。

小型评估应该包含什么?

从计划运行的工作负载中选择示例。包含普通输入、模糊情况,以及正确行为应是说明信息缺失的情况。提示词修改时使用独立测试集,避免将针对示例的调优误当成普遍可靠性。

任务检查结果同时记录
分类标签正确、模糊情况处理努力程度、用量、无效标签
信息提取必需字段、原文支持的值解析失败、缺失值、重试
摘要保留关键事实,不编造陈述遗漏、原文长度、用量
编程要求的行为与相关检查额外改动、修复尝试、工具调用

这是评估方案,不是已发表的基准测试。本指南不声称任一模型具有实测速度或准确率优势。提示词或应用发生重要改动后,应重新比较,并将请求设置与结果一同保存。

Haiku 与 Sonnet 常见问题

完成同一任务时,Claude Haiku 5.5 总是更便宜吗?

比较当前费率与实际用量,包括额外尝试。需要修正的任务,总费用可能高于首次响应显示的费用。

Haiku 5.5 可以强制调用指定名称的工具吗?

可以。官方契约接受指定名称或任意工具选择。指定的工具必须已声明,且强制工具不能与零输出缓存预热或按需压缩同时使用。[2]

两个模型都可以关闭思考吗?

Haiku 在 low、medium 或 high 努力程度下接受 disabled 思考。Sonnet 在这些努力程度下使用独立的 between_tools 模式,两者名称不能互换。[2][3]

应该把所有 Sonnet 任务迁移到 Haiku 吗?

请按任务分别评估。Anthropic 的指南支持在明确的工作上尝试 Haiku,同时继续将较大模型纳入复杂编程比较。哪些任务可以迁移,应由自己的验收检查决定。[1]

来源

  1. Anthropic:介绍 Claude Haiku 5.5。
  2. Anthropic:Haiku 5.5 迁移指南。
  3. Anthropic:Sonnet 5.5 的新功能。

相关指南