一张生成的标题卡,上面写着“Claude Haiku 5.5:10 万 token 的价格阶梯”,展示两张价格卡——“10 万 token 以下:$0.10 输入 / $0.50 输出”和“超过 10 万 token:$0.50 输入 / $2.50 输出”——两者之间有一个向上的阶梯图形,页脚一行写着“Anthropic 标价,2026 年 10 月”。真实的 OrcaRouter 标志合成在右下角。
Guides & Insights

Claude Haiku 5.5 真正引人关注的是 10 万 token 断崖:新版 Haiku 在超过 100,000 token 后如何收费

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5 于 2026 年 10 月 7 日问世,主推价格为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元,而被到处重复的那个数字,正是 Anthropic 自己在公告中给出的:针对同样两个计费项,相较 Haiku 4.5 的费率下调 90%。这个 90% 是真的。但它也只限定于账单某一个维度的一半,而一旦请求超过 100,000 个 token,其中每一项费率都会发生某种变化,而发布报道大多略过了这一点。本文讲的就是这条分界线——它的成本是多少、哪些工作负载实际会触及它,以及为什么“便宜 90%”是一种关于账单某一部分的说法,而不是关于你的账单的说法。

这两个价格,以及它们切换的位置

Anthropic 为该模型发布两列,而两列之间的切换取决于请求大小的单一阈值,而不是你选择的任何模型设置:

• 短档位,不超过 100,000 个 token — 每百万输入 token $0.10,每百万输出 token $0.50(Anthropic 标价) • 长档位,超过 100,000 个 token — 每百万输入 token $0.50,每百万输出 token $2.50(Anthropic 标价) • 缓存读取 — 每百万 $0.01(短档位)和每百万 $0.05(长档位) • Batch API — 任一列均享 50% 折扣,最大输出长度为 300,000 个 token • 标准最大输出 — 128,000 个 token,两个档位均提供 100 万个 token 的上下文窗口

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

那些是 Anthropic 自己公布的价格,并非实测所得,而且它们就是当前价目表:一个如此新的模型,其定价还来不及变动,尽管 Anthropic 并未承诺会维持这一价格。

按顺序读那四个数字,这件事的形态就一目了然。长上下文层级中的每一项费率都正好是短上下文费率的五倍,而且对所有费率来说,阈值同时都是同样的 100,000 个 token。没有渐进曲线,没有插值,也没有中间档位——一个 99,000 token 的请求和一个 101,000 token 的请求,在账单中的每一个 token 上都相差五倍,而不仅仅是越过界线的那 2,000 个 token。正是这一点让它成为一道悬崖,而不是一道斜坡,也正是“便宜 90%”这种说法看不到的地方。

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

为什么伤口看起来比实际更大

与 Haiku 4.5 相比——Anthropic 所做的对比——短档位在输入和输出上都确实降低了 90%:Haiku 4.5 在同样这两列上每百万 token 收费 $1.00 和 $5.00。长档位则是另一回事:$0.50 和 $2.50 对同样的 $1.00 和 $5.00,是 50% 的降价,而不是 90%。因此,这次发布声明中诚实的说法是:在 100,000 个 token 以下,Claude Haiku 5.5 比 Haiku 4.5 便宜 90%;超过这一门槛,则便宜 50%——而这正是 Anthropic 自己的文档在你两列都读、而不是只读一列后所给出的分档。那个单一百分比并没有错;它是短档位的百分比,只是在呈现时没有带上其适用条件。

还有第二个朝相反方向拉扯的因素,而它更值得玩味,因为它容易被忽略,又难以绕开。Claude Haiku 5.5 随附了一款新的分词器,而 Anthropic 自己的指引指出,同一段文本的 token 数比 Haiku 4.5 对相同内容给出的结果大约高出 30%。相对于旧模型的计费方式,你原先每 token 支付的价格下降了,而你为*你的*文本中每个 token 支付的费用却上涨了约三分之一。Anthropic 给出的净数字——即该模型平均运行成本大约便宜 75%——已经把这一点计入其中:90% 的标价下调减去约 30% 的 token 膨胀,在短上下文流量下就落在这个区间附近——但这两个效应是可以分开的,也值得分开来看。价格变动是你能直接从页面上一眼读到的标价变化;分词器的变动则改变你现有提示词会消耗多少个该价格的单位,而且它会先出现在你自己的 token 计数里,之后才会出现在别处。

对于每次调用本已轻松低于 100,000 个 token 的工作负载,实际效果就是每次调用成本直接降低,只是部分被分词器抵消。而对于并非如此的工作负载,算账的结果在长的那一半上会反过来两次。

100,000 个 token 之上实际存在的是什么?

本能的反应是把长上下文定价归入“智能体编程和 RAG,不是我们”这一类。但这过于草率,因为 100,000 token 这条线是按请求计的,而单次请求的规模并不等同于任务规模。有几种模式会经常越过这条线:

• 一个代码库阅读智能体,在整个会话期间将庞大的工作集保持在上下文中,而不是每一步都重新检索

• 文档与合同分析:输入是一份很长的 PDF,外加其自身的指令和少样本示例——这类提示词在还没加入示例之前就已经有 60,000 个 token。

• 将许多小项批量合并为一次调用、以分摊每次调用开销的摄取管道,并因此让整批数据一起越过阈值

• 将完整对话历史内联保留而非对其进行摘要的聊天产品,其中的请求会单调增长,直到有东西将其截断

• 音频和长视频转录式输入,而这正是100万token窗口所宣传能够处理的流量类型

100 万 token 的上下文窗口,是规格表中让这道“断崖”值得一谈的那一项。Anthropic 推销的是把超大请求交给模型的能力,而定价结构的设计是:该请求最后 90 万个 token 的成本,是前 10 万个 token 的五倍。这两个事实都是刻意为之;只是它们被公布在不同的地方。如果你关注这个模型,完全是因为它的长上下文窗口,那么长上下文那一列才是你该看的列,而发布百分比则是别人的。

价格对Flash层级造成的压力

Anthropic 表示,该模型背后的意图是占据技术栈中廉价、高吞吐量的一端,而价目表清楚地反映了这一意图。Bloomberg 对此次发布的报道将其描述为 Anthropic 在抵御更廉价的开放权重竞争对手、捍卫自身的低成本定位,而厂商方面的说法则更进一步——新款 Haiku 的定价旨在以大幅低于直接竞争对手的价格展开竞争。

只有在短上下文档位上,这种比较才干净:在那里,$0.10 和 $0.50 低得咄咄逼人。超过 100,000 个 token 后,$0.50 和 $2.50 的费率不再低于任何人的短上下文档位;它们只是普通的中档数字。该供应商的“大幅价差”说法,是针对费率表第一列而言的,Anthropic 有权在那里这么说——这是对其公布数字的准确解读。它并不是关于长上下文工作负载实际支付多少的说法,也不应被当作这种说法来引用。

模型的其余部分,简述

Claude Haiku 5.5 保留了 Sonnet 和 Opus 系列已经推出的功能,而不是为了体积级别而做削减。它具备自适应思考能力,默认 effort 设置为 medium,并且是 Haiku 系列中首个提供可调 effort 档位(从 Low 到 Max)的模型。知识截止日期为 2026 年 6 月,模型 ID 为 claude-haiku-5-5。Anthropic 声明的退役日期不早于 2027 年 10 月 7 日——与发布日期相同,即一年之后——该模型已上架 Amazon Bedrock、Google Cloud 和 Microsoft Azure,同时也可通过 Anthropic 自家的 API 使用。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

在基准测试方面,发布博文中的所有内容都带有相同的来源标签,也确实理应如此:这些是厂商报告的数字,由售卖该模型的公司自行测得,而在撰写本文之时,尚无任何独立复现的结果发布。

• GDPval-AA v2.1 —— 厂商报告称,Claude Haiku 5.5 为 1,620,而在同一测试框架下 Haiku 4.5 为 735

• AA-Briefcase v1.1 — 厂商报告为 1,578,而上一代为 614

• OSWorld 2.1 — 厂商报告为 72.4%,而对照组为 15.7%

• Terminal-Bench 4.0 — 厂商报告值 39.2,对比 0.0

• Humanity's Last Exam — 厂商报告为 45.9%,使用工具时为 57.4

这些差距的幅度,正是应当给它们打上标记、而不是直接引用的原因。在由模型自家厂商测量的 OS-agent 基准上,从 15.7 跃升到 72.4,这个数字在第三方运行同一套测评框架之前只能姑且看待。Artificial Analysis 截至 2026 年 10 月初已发布了针对该模型的自己的指数——独立数字为 43.395,其中 Terminal-Bench Hard 上为 0.329,HLE 上为 0.444——当这一说法需要经得起质疑时,应该引用的就是这组数据。厂商数字和独立数字并不冲突;它们只是不同的测评框架,而把它们混进同一句话里,正是一篇博客文章最后把厂商评测说成事实的方式。

基础设施说明,因为我们运行着一个

Anthropic 通过自家 API 以及 Bedrock、Google Cloud 和 Azure 销售 Claude Haiku 5.5。如果你正在决定该调用其中哪一个,或者正打算把它加到技术栈中已有的其他模型旁边,请注意:无论在哪里销售,厂商的目录价都相同,而 OrcaRouter 的设计就是以零加价将这一目录价原样传递出去——因此 Anthropic 在该模型上的价格变动,在我们这边当天即生效,而不会滞后。我们的目录还收录了qwen/qwen3.8-flash,价格为每百万 $0.15 和 $0.47,以及z-ai/glm-5.3-flash,价格为 $0.15 和 $0.50——这两个模型最常出现在 Haiku 级别模型旁边的槽位上,共享同一把密钥、同一份账单——正是这一点让混合技术栈只需一份合同,而不是三份。我们自身并不提供 Claude Haiku 5.5;如需使用,请直接调用 Anthropic。

如果你会在多个模型之间路由,这种断崖式定价的一个实用推论是:100,000 token 边界是一个原本便宜的请求会变贵、而请求本身并没有实质性变化的地方。如果你的路由层能够故障转移,合理的做法是让长上下文流量始终指向在阈值以上真正便宜的那个模型,让短上下文流量落到在阈值以下便宜的那个模型,而不是假设一个模型的标称费率同时适用于两者。

从这次发布中能学到什么

在 100,000 个 token 以下,这次降价是真实存在的,而且幅度很大。该模型是首个具备完整交付功能集和 effort 调节旋钮的 Haiku,这一点对智能体用途而言比价格更重要。基准测试差异由厂商报告,每次引用时都应照此标注。而价目表在 100,000 个 token 处有一个台阶,会一次性把每一项费率乘以五——对于关注你技术栈的人,而不是只读新闻稿的人,这是本次发布中最需要在下一个冲刺的 token 预算确定之前知道的一点。

如果你想用自己实际的流量来核对这笔账,需要取出的两个数字是:你的请求大小的第 95 百分位,以及超过 100,000 个 token 的请求在你总支出中所占的份额。如果第一个数字低于这条线,那么 90% 就适用于你,发布时的报道对你的情况判断是准确的。如果第二个数字在账单中占了相当大的比重,那么真正重要的数字就是 50,而且值得重新做一遍成本估算——针对你在技术栈中基于 90% 这一假设所选的任何模型。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新