
Claude Haiku 5.5 与 Claude Haiku 4.5:降价 90% 并不等于节省 90%
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Haiku 5.5的定价为:处理最多 100,000 个 token 的提示时,每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.50 美元。Claude Haiku 4.5则一直是每百万输入 1 美元、每百万输出 5 美元的一口价,覆盖其始终拥有的整整 200,000 个 token 的窗口。Anthropic 在一处脚注中把这一差距说成"低 90%",而在其上一句里又说"运行成本大约低 75%"——而两款模型之间相隔的十一个月,恰恰就是这两个数字之间的距离。
这并不是营销上的花招。这正是一代模型坦诚的真实面貌:它在改变价格的同时,也改变了分词器、默认思考模式和上下文窗口;这意味着,任何只是换掉模型 id、就指望账单能降到十分之一的人,最终会失望于这道算术题,而不是失望于产品本身。
两款型号,均按出厂状态
以下所有内容均按每百万 token 计、以美元为单位,除另有标注外,均读取自 Anthropic 自身于 2026-10-08 的定价和模型文档。

• 输入 — Claude Haiku 5.5:最多 100,000 个词元 $0.10,超出后 $0.50;Claude Haiku 4.5:无论长度均为 $1.00。
• 输出 — Claude Haiku 5.5:不超过 100,000 个 token 为 $0.50,超出后为 $2.50;Claude Haiku 4.5:无论长度均为 $5.00。
• 缓存读取——Claude Haiku 5.5 为 $0.01(最多 100,000 个词元),超出部分为 $0.05;Claude Haiku 4.5 为 $0.10。缓存写入——分别为 $0.125 和 $0.625,相较 $1.25。
• 上下文 — 1M tokens,对比 200,000。最大输出 — 128,000 tokens,对比 64,000。
• 思考 — Claude Haiku 5.5 是自适应的,默认开启,并带有一个默认设为中等的 effort 调节盘;Claude Haiku 4.5 采用手动形式,完全没有 effort 参数。
• 独立评分 — Artificial Analysis Intelligence Index v4.3.2 将 Claude Haiku 5.5 (Max) 列为 43.40,在 182 个模型中排名第二;将 Claude 4.5 Haiku 列为 16.88,在 61 个模型中排名第三十——评估器将 4.5 的分数标记为估算值。
• 速度 — 同一来源测得 Claude Haiku 5.5 的每秒输出 token 数为 242,而 4.5 世代为 89.7,这也是旧模型唯一还算从容的方面。
十分之一价格的说法在哪里站不住脚
有三件事会蚕食这笔抽成,而其中只有第一件是 Anthropic 自己发出的警告。
分词器才是大头。Claude Haiku 5.5 使用的是随 Claude 4.7 引入的更新版分词器,而 Anthropic 的文档称,同一段文本“计得的 token 数比在 Claude Haiku 4.5 上大约多 30%”。你并不是按相同的 token 数量支付十分之一的费率;你是在大约 1.3 倍的 token 数量上支付十分之一的费率。厂商自己的迁移指南将其列为检查清单上的第二项,排在每一项代码更改之前:重新统计你的提示词,然后重新审视 max_tokens以及你的成本估算。
思考 token 按输出 token 计费,而 Claude Haiku 5.5 默认就会思考。Anthropic 的发布页面上明确写道,该模型在图表中本身就“非常啰嗦”,而独立测评对此的印证比厂商自己更为鲜明:在评估 Intelligence Index 时,Artificial Analysis 记录到 Claude Haiku 5.5 产生了 4.4 亿个输出 token,而所有模型的整体中位数为 1 亿个,并将其标记为非常啰嗦。对于账单主要来自输出的工作负载,低廉的输入价格并无助益。
10 万 token 这一档是第三档。超过这一档,费率是 $0.50 和 $2.50——是 Claude Haiku 4.5 在同一请求上收费的一半,这很划算,而且并不是大多数读者读到过的那项优惠。Anthropic 表示,低于该门槛的提示词约占对上一代 Haiku 模型请求量的 90%,正是这个数字让这次降价作为新闻标题还撑得住;它也是厂商自己的流量构成,而不是你的。

同样的工作让这两个模型付出什么代价
每个已完成任务的成本是唯一能经受住上述三种效应的指标,因为它按模型输出的全部内容计费,而不只是你发送给它的内容。
Artificial Analysis 将 Claude Haiku 5.5(Max)的每项 Intelligence Index 任务成本定为 0.21 美元——这是它与 0.10 美元输入价和 0.50 美元输出价并列发布的数据。对于 4.5 代,它根本没有发布任何每任务成本数据;相应板块显示为 unknown,因为该模型从未以推理配置在 Intelligence Index 上运行过。该页面实际发布的,是 1.00 美元和 5.00 美元的原始标价,以及一个不同的、更低的实测得分。
所以,对买家来说,真正诚实的比较并不是在 token 上差 10 倍,而是更接近这样:输入费率降到十分之一,而 token 量多出 30%;当你超过 100K 时,输出费率减半;并且模型每次回答消耗的输出 token 比上一代更多——与之相对的是,在同一个独立榜单上,能力从 16.88 跃升到 43.40。Anthropic 针对平均工作负载给出的 75% 这一数字,是合理的规划依据。它也是基于你无法控制的流量组合得出的、混合了供应商的估算。
这次迁移并不是简单地替换 model-id
Anthropic 的迁移指南为任何要从 Claude Haiku 4.5 迁移离开的人列出了十项内容,其中好几项是硬性失败,而非建议。
• 手动思考已失效 — thinking: {"type": "enabled", "budget_tokens": N}会返回错误。自适应思考取代了它,而 thinking.display必须设置为 "summarized",如果你想看到推理内容的话。
• 采样参数会出问题 —— temperature、top_p和top_k都必须从请求中移除。
• 助手预填充会失效——以助手回合结束的对话会返回错误;请以用户回合结束。
• 块顺序会发生变化——响应可能以思考块开头,因此将第一个内容块读取为答案的代码必须改为依据 type 进行选择。
• 拒绝是新增的——模型会运行安全分类器,可能返回 stop_reason: "refusal",并且没有服务器端回退方案。
• 重放受到限制——思考块仅在生成它们的账户中有效,或在与该账户关联的账户中有效。
• Priority Tier 不会延续——在 Claude Haiku 4.5 上持有 Priority Tier 承诺的组织必须单独规划容量,因为 Claude Haiku 5.5 不支持该层级。
其中两个比其余的更值得关注。拒绝停止原因是任何假设每个响应都有内容的循环中的一处控制流变更,而与账户绑定的 thinking 块会破坏任何存储对话并通过凭证池重放它们的队列。两者都要到生产环境才会显现。
使用一个密钥运行两个层级
对大多数团队来说,实际的问题并不是这两个模型哪个更好,因为答案完全取决于你正在发起的是哪种调用。真正的问题是,级联中那个廉价的环节能否独立于它周围的一切进行升级。
Claude Haiku 4.5 今天已上架 OrcaRouter 目录,按 Anthropic 官方标价提供,加价 0%,因此供应商的费率直接透传,Anthropic 对其做出的任何调整,我们这边当天就能同步体现。Claude Sonnet 5.5 和 Claude Opus 5.5 也已在列,这意味着现在就能搭建一条双层流水线——用较小的模型处理占多数的常规请求,用更大的模型处理升级请求——只需一个密钥、一套 SDK以及底层的自动故障转移,而且之后把小模型那一环换成 Claude Haiku 5.5 时,只需更改模型 ID 即可,无需重写代码。
Claude Haiku 5.5 尚未在目录中,这一点值得直白说明,而不是留下暗示。模型发布与模型可路由之间存在发布当日的间隔是正常的,这并不承诺该间隔何时结束;今早可从我们这边调用的模型,就是上文列出的那些。

谁应该切换,以及先切换哪个调用?
如果你的 Haiku 4.5 流量是分类、提取、路由、压缩或摘要,且提示词低于 100,000 个 token,那就迁移——费率是原来的十分之一,窗口宽五倍,而且 effort 拨盘给了你旧模型从未有过的成本杠杆。预算降低约 75%,一周后再对照你自己的 token 数量进行核对。
如果你的提示词经常超过 100,000 个 token,那你买到的是 50% 的降幅,而不是 90% 的降幅,而且第二档定价会以让货比三家变得值得的方式改变对比:超过 100K 后 $2.50 的输出费率,高于几个竞争性小模型对整个窗口收取的费用。
如果你还在用 Haiku 4.5,只是因为它是唯一能装下 20 万 token 文档的便宜选项,那就留意一下发生了什么变化。现在窗口已经是 100 万 token,这已经是另一款产品了,而继续留着旧模型的理由,也随着它当初便宜的理由一起悄然消失了。
