一张为“Claude Haiku 5.5 成本仅为十分之一”生成的主视觉卡片,带有“最便宜的 CLAUDE”徽章,小标题为“ANTHROPIC,2026 年 10 月 7 日”,副标题为“降价 90%,一个分词器会增加约 30% 的 token,以及一段 Anthropic 没有发布的发布视频”。四个标签分别显示“输入 $0.10”、“输出 $0.50”、“1M 上下文”和“实际节省 75%”。下方两张卡片分别标为“哪些下降了”(“输入从 $1.00 降至 $0.10,输出从 $5.00 降至 $0.50(100,000 token 以内)”)和“哪些上升了”(“同样的文本现在计入的 token 数比之前多约 30%”)。页脚显示“供应商定价文档,查阅于 2026 年 10 月 8 日。”OrcaRouter 的 logo 合成在右下角。
Guides & Insights

Claude Haiku 5.5:价格直降 90%、全新分词器,以及 Anthropic 没有发布的那段视频

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

有人向Claude Haiku 5.5里输入了一句话,就得到了一支制作完成的发布影片。这条提示词于 2026 年 10 月 7 日晚上发布在 X 上,全文如下:“为你的发布活动做一条炸裂十倍的视频,展示你作为动效设计师有多出色。”帖子的配文只有三个英文词——“One shotted this video”——并附上了这段短片作为附件。没有重试,没有分镜,没有剪辑师。如果这就是 Claude 系列里最便宜的模型现在的表现,那么这个档位就不再是将就之选。

那是这场发布中有意思的一半。另一半是算术,而真正的新闻恰恰就在这里:Claude Haiku 5.5在提示不超过 100,000 个 token 时,每百万输入 token 收费 $0.10、每百万输出 token 收费 $0.50,而Claude Haiku 4.5则是统一的 $1 和 $5。Ant​hropic 自己的脚注称,在常见情况下这降低了 90%——紧接着又说,买家真正该用来做规划的数值更接近 75%。两个数字都没错,而它们之间的差距,才是这次发布中最重要的事。

Anthropic 在10月7日公开发表了什么

厂商的发布公告与其定价文档对这一定位的描述是一致的,而这一步的跨度,比通常伴随降价而来的变化要大。

A generated scoreboard titled 'Claude Haiku 5.5 benchmark table - Anthropic's own harness' with two columns. Claude Haiku 5.5 reads GDPval-AA v2.1 1620, AA-Briefcase v1.1 1578, OSWorld 2.1 72.4%, Humanity's Last Exam 45.9%, Terminal-Bench 4.0 39.2% and Chartography 46.4%. Claude Haiku 4.5 reads 735, 614, 15.7%, 10.2%, 0.0% and 6.4%. A footer reads 'Vendor-reported evaluations published by Anthropic on October 7, 2026; not independently reproduced.'

• 价格 — 对于不超过 100,000 个 token 的提示词,每百万输入 token 为 $0.10,每百万输出 token 为 $0.50。超过该阈值后,同一请求的输入和输出分别按 $0.50 和 $2.50 计费。缓存读取每百万 token 费用为 $0.01(最高 100K),超过后为 $0.05;缓存写入为 $0.125 和 $0.625。

• 上下文 — 100 万 tokens,最大输出 128,000 tokens。这与 Claude Fable 5.1、Claude Opus 5.5 和 Claude Sonnet 5.5 所具备的窗口和输出上限完全相同,并在最便宜的档位上得以实现。

• 思考 — 使用 effort 参数进行自适应思考,默认为 medium。Ant​hropic 表示,这是首个具有可调节 effort 设置的 Haiku 级模型,这意味着同一个模型 ID 既可以低成本运行,也可以谨慎运行,而无需更改其他任何内容。

• 分词器——与 Claude 4.7 及更高版本共享的较新分词器,其“对相同文本,生成的 token 大约多 30%”。Ant​hropic 的文档表示,确切的增幅取决于内容和工作负载形态。

• 生命周期 —— 知识截止日期为 2026 年 6 月,以及“不早于 2027 年 10 月 7 日”的退役承诺。

• 可用性 — Claude API、Amazon Web Services、Google Cloud、Microsoft Azure,以及 AWS 上的 Claude Platform,第一天便全部同时可用。

10x 标签与 75% 的现实

“便宜十倍”这个数字会传播得最远,也最有可能在某个人的预算模型里出现在错误的位置。它适用于最多 100,000 个 token 的提示。Haiku 5.5 并非在整个窗口内都保持这一费率。

• 最多 100,000 个 token —— 输入 $0.10、输出 $0.50,相比之下 Haiku 4.5 为 $1 和 $5。这就是 90% 的降幅,Anthropic 称,对上一代 Haiku 模型的请求中有 90% 都落在这个区间内。

超过 100,000 个 token —— 输入 $0.50,输出 $2.50。在同一请求上,仍然恰好是 Haiku 4.5 收费的一半,且没有会撞上的上限。

• 分词器——同样的文本,其 token 数量比在 Haiku 4.5 上大约多出 30%,因此每个 token 的降价并不会一比一地转化为更低的账单。

• 供应商自己给出的平均值——Anthropic 将这一组合表述为“运行成本降低约 75%”。这是它自己给出的数字,而非独立测量所得,而做预测时应当采用的正是这个数字。

• 缓存经济性 — 在常见档位中,缓存读取价格从每百万 $0.10 降至 $0.01,对于任何会重复发送长共享前缀的流水线而言,这一点比输入单价更重要。

75% 这个数字还解释了另一件事,而读者原本可能会把它读成一处矛盾。这两个位于标题中的数字并不冲突:一个是针对某种请求形态的比率,另一个则是在真实流量组合上得出的混合估算,而这个组合既包含那超过 100K 的少数情况,也包含分词器额外产生的 token。如果你要为花费建模,就用 75%,并先核对你自己的 prompt 长度分布,然后再去相信更乐观的数字。

视频声称了什么,以及没有声称什么

这段视频是真实的,提示词就是上方逐字引用的那段,而那个时间戳——10月7日19:49 UTC,大致就是该模型上线当天——是可以核查的。这一归因指向的是一位个人用户,而非Anthropic。

这一区分在这里很重要,因为 Anthropic 自家的 Claude Haiku 5.5 产品页完全没有嵌入视频:没有播放器,没有媒体文件,只有一个指向该公司 YouTube 频道的链接。如果发布影片是用该模型制作的,厂商并未说明。所以准确的说法范围很窄:一名用户称用 Claude Haiku 5.5 一次性生成了发布视频,并公布了提示词。它是否为一次性生成、花费多少、有多少内容在剪辑后保留下来,都只是来自单一信源的说法。把这个片段当作演示,而不是基准测试。

之所以仍然值得一提,是因为视频生成并不在该模型的规格说明之中。Haiku 5.5 接收文本和图像,返回文本。如此质量的动态设计成果意味着,模型所驱动的是别的东西——一条代码生成路径、一条渲染管线、一个工具循环——而不是自己生成画面。这说的是在每百万输入 0.10 美元的价格下进行的智能体编排,而这才是真正令人惊讶的地方。

Anthropic 发布的数字

供应商的发布表格是与 Haiku 4.5 的前后对比,GPT-6 Luna 和 Claude Sonnet 5.5 也被放在同一列中以供参照。下文的每一个数字都是 Ant​hropic 自行报告的评估结果,在 Ant​hropic 的测试框架上运行,此处仅作转述,未经独立验证。

A screenshot of Anthropic's Claude Haiku 5.5 launch page, dated October 7 2026 and headed with the model name, the identifier claude-haiku-5-5 and the launch standfirst, with the vendor's reported evaluation rows and pricing notes below.

• 知识工作——GDPval-AA v2.1 得 1620 分,对比 Haiku 4.5 的 735 分、GPT-6 Luna 的 1437 分和 Sonnet 5.5 的 1840 分。AA-Briefcase v1.1 得 1578 分,对比 614、1336 和 1824。

• 计算机使用 — 在离线子集上,OSWorld 2.1 达到 72.4%,相比之下 Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%,Sonnet 5.5 为 83.9%。

• 多学科推理——Humanity's Last Exam 在无工具情况下达到45.9%,有工具情况下达到57.4%,而Haiku 4.5分别为10.2%和18.7%。

• 智能体编码 — Terminal-Bench 4.0 为 39.2%,对比 0.0%、16.4% 和 70.6%。FrontierCode 1.1 (Main) 为 46.4%,对比 GPT-6 Luna 的 42.4% 和 Sonnet 5.5 的 52.1%。

• 视觉推理——无工具条件下 Chartography 为 46.4%,相比之下分别为 6.4%、29.1% 和 61.6%。

Ant​hropic 对于小模型层级在哪些方面无法取胜,态度也异常直白。它自己对 Terminal-Bench 图表的评论指出,Sonnet 5.5 和 Opus 5.5“仍是复杂智能体编程任务的更优选择”,并把 Haiku 5.5 定位为负责压缩、摘要和子智能体工作。博文中的客户引述指向同一方向,也带有同样的限定——这些都是早期访问合作伙伴在描述自家的评估,而非审计:Asana 报告任务完成的延迟降低超过 30%,每个智能体轮次的推理速度最高提升 2.5 倍;HubSpot 报告在某个 CRM 门户套件上三次运行平均达到 92.8%;AlphaSense 报告在每周约 800 万次调用的工作负载上,400 条查询中取得 0.84 对 0.76 的成绩;Box 报告比 Haiku 4.5 高 11 分,延迟约为其一半;Rogo 描述了一个 Haiku 5.5 子智能体从 10-K 中提取分部收入行的过程;Cognition 报告称,以 Haiku 5.5 作为助手的 Devin Fusion 在 FrontierCode 上取得 66.2 的分数。

独立董事会怎么说

厂商的榜单是厂商自己的。对于任何要判断该层级是否已变动到足以改变生产流水线的人来说,首个外部排名才是更有用的数字。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 in its Max configuration, showing an Intelligence Index v4.3.2 score of 43.40 ranked second of 182 models, an output speed of 242 tokens per second, a cost of $0.21 per Intelligence Index task, and the evaluator's note that the model generated 440 million output tokens against a 100 million median and is very verbose.

Artificial Analysis 在 Intelligence Index v4.3.2 上给 Claude Haiku 5.5 的 Max 配置打出 43 分,在该榜单的 182 个模型中排名第二,远高于榜单中位数 13。同一页面还测得每秒 242 个输出 token——在 182 个模型中排名第九——以及每项 Intelligence Index 任务 0.21 美元的成本。

那个页面上有两件事比标题更值得关注。首先是冗长:在评估 Index 时,Artificial Analysis 记录了 4.4 亿个 token,而中位数为 1 亿个,并将该模型描述为“非常冗长”。标价是按 token 收费的,所以一个会长时间思考的模型要为此买单——这正是为什么每任务成本数字是 0.21 美元,而不是接近零,也是为什么输入削减 90% 并非全部真相。其次是努力程度阶梯:同一个页面展示了从 Max 到 Low 的配置,而 Anthropic 的默认值是 medium,而不是 max。榜单上的 43 分是那个阶梯的最高端,而不是你什么都不做时得到的设置。

运行比你已能调用的层级低一级的层级

Claude Haiku 5.5 不在 OrcaRouter 目录中,而这一点值得直说,而不是暗示相反:一个模型从存在到可被路由之间的发布日空档通常为几天,有时更长。

目前 Anthropic 目录上提供的是 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5,均按提供商的标价以 0% 加价透传,因此 Anthropic 的任何降价当天就会同时落到我们这边。对于现在就想测试子代理模式的人来说,这就是实用的桥梁:一种将例行轮次发送给 Haiku 4.5、将困难轮次向上升级的级联方式如今就能用,只需一个 SDK、一个密钥,而以后把小模型那一环换成 Haiku 5.5 只是改一下模型 ID,而不是迁移。自动故障转移位于你所选的任一环节之下,因此单个提供商的一个糟糕下午不会拖垮整条管道。

如果您根本不想等待,相同的 $0.10 输入价格区间已经由 GPT-6 Luna 占据,我们确实会路由它,并且它将该费率维持至 272,000 个 token 后才升档。

谁应该移动,谁不应该移动

如果你的工作负载是大批量分类、提取、路由、压缩或摘要,并且你的提示词低于 100,000 个词元,那么情况很简单:费率是原来的十分之一,窗口宽了五倍,而 effort 旋钮让你在某个请求需要时可以反向权衡。按大约降低 75% 来做预算,你就不会感到意外。

如果你的提示词经常超过 100,000 个 token,那你买到的是 50% 的折扣,而不是 90% 的折扣;而且,深度上下文比价仍然值得花一个下午——这一领域有多个模型的价格处于或低于该档位超过 100K 的费率。

如果你的评测在 Terminal-Bench 形态的工作上依然通不过,那么能修复它的并不是这个模型;Anthropic 自己也这么说,而 39.2% 对 Sonnet 5.5 的 70.6%,是这篇文章中最干净利落的证据。对 10 月 7 日最诚实的总结是:有用智能的地板大幅下沉,而天花板纹丝未动。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新