一张生成的主视觉卡片,显示“每日 AI 简报 — 2026 年 10 月 8 日”,带有 NEWS 徽章,标题为“Claude Haiku 5.5 发布,Sonnet 5.5 缓存读取减半”,还有四个标签,分别显示每 1M $0.10 / $0.50、1M token 上下文、默认 effort 为 Medium,以及缓存读取从 $0.20 降至 $0.10。
Engineering & Research

每日AI简报,10月8日:Claude Haiku 5.5以$0.10推出,Sonnet 5.5缓存读取费用减半

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5 于 2026 年 10 月 7 日发布,是该公司至今通过 API 提供过的最便宜的东西:在不超过 100,000 token 的提示词上,每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.50 美元,还配有 100 万 token 的上下文窗口,以及一个从 Low 到 Max 的 effort 调节档。同一天,Claude Sonnet 5.5 的提示缓存读取价格从每百万 token 0.20 美元降至 0.10 美元,却没有自己的发布公告。这两者中,一个是产品,另一个只是账目上的一行,而本季度能撬动更多钱的,正是这一行。

先说价格,因为这是你今天就能采取行动的那部分。然后是 effort,它才是悄悄决定价格的东西。再然后是缓存削减,为 Sonnet 5.5 付费的人里有一半,要到下一张账单才会听说这件事。

Claude Haiku 5.5 是什么,按重要性依次说明

厂商自己的说法是“我们迄今发布过的最便宜、最快、能力最强的小型模型”,发布日期是 2026 年 10 月 7 日——就在本简报的前一天。模型 ID 是 claude-haiku-5-5。它支持文本和图像输入、文本输出。上下文窗口为 1,000,000 个 token,较 Claude Haiku 4.5 的 200,000 有所提升,最大输出为 128,000 个 token,而在 Batch API 上使用一个 beta 标头可将其提高到 300,000。训练数据截止到 2026 年 6 月,Anthropic 承诺在 2027 年 10 月 7 日之前不会将其退役。

对于任何进行流量调度的人来说,最关键的一点不是上下文窗口。而在于这是首个具备可调 effort 的 Haiku 级模型。Effort 提供 Low、Medium、High、Xhigh 和 Max 五档,默认是 Medium,且自适应思考默认开启——这是 Sonnet 和 Opus 的功能,如今下放到更低一档。发布文章还提到两件关乎“购买”而非“构建”的事:Claude Max 和 Team 套餐的每月 API 额度,Max 5x 为 $100,Max 20x 为 $200,Team 最高可共享 $500;以及 SDK 中的 beta 版 computer-use 和 browser-use 支持。安全性也与该层级保持同步:网络防护比 Claude Haiku 4.5 更严格,渗透测试请求仍被阻止,生物安全防护则与 Claude Sonnet 5、Claude Sonnet 5.5 和 Claude Opus 5 持平。

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

价格,以及其中间那道 10 万 token 的断崖

标称费率是每百万输入 token $0.10,每百万输出 token $0.50。注意星号注释:这是提示不超过 100,000 个 token 时的费率。超过 100,000 后,两个数字都乘以五,变为输入 $0.50、输出 $2.50。在低价区间内,缓存写入在五分钟档为每百万 $0.125,在一小时档为 $0.20;缓存读取为每百万 $0.01——是输入费率的十分之一,这是 Anthropic 在任何模型上公布过的最大缓存折扣。批处理会让所有价格再减半:低价区间内为 $0.05 和 $0.25,超过后为 $0.25 和 $1.25。

将这一点与 Claude Haiku 4.5 对比:后者仍在价目表上,输入和输出分别为固定的 $1.00 和 $5.00,没有基于上下文的阶梯定价,缓存读取为 $0.10,上下文窗口为 200,000 token。新模型在相同提示词形态下价格只有其十分之一,上下文却是其五倍。这里无需进行什么迁移测算;两者在算术上根本不在一个量级。

这道悬崖(cliff)正是需要围绕它来设计的地方。在输入费率下,一个 99,000 token 的提示词每千次调用花费 99 美分;一个 101,000 token 的提示词每千次调用则要花 5.05 美元。两千 token 的差距带来的是 5 倍账单,所以你在低价区间构建的任何东西,要么应舒适地保持在 100,000 token 以下,要么就刻意且始终地超过它——最糟糕的结果,是一条正好跨在这条线上的流水线,一半流量都要按高价费率付费。

投入程度如今成了一个定价参数,而默认值并不是最便宜的那个

因为 effort 默认是 Medium,而且思考默认开启,所以标价和实际价格并不是同一个数字。推理 token 按输出 token 计费。在 Anthropic 自己公布的 Artificial Analysis Intelligence Index 运行结果中——由厂商报告,未经我们复现——Claude Haiku 5.5 每项任务大约输出 162,000 个 token,其中约 129,000 个是推理 token。该指数中位数模型在整个测试套件中大约输出 1 亿个 token;Haiku 5.5 则要花费 4.4 亿个。按每百万输出 token 0.50 美元计算,这种冗长是可以负担得起的,而这正是关键所在:以 Haiku 5.5 的费率,大量思考仍然比在一个输出收费 5.00 美元的模型上少量思考更便宜。

将 effort 设为“低”,用于分类、提取和路由决策——这些场景下你要的是快速作答,而不是深思熟虑;而对于任何用户会读到的内容,则保持“中”。降到“低”也是让冗长的智能体稳定处于 100,000 token 区间内的可靠方法,因为它会先削减推理 token,之后才影响回答质量。

更安静的系列:Sonnet 5.5 读取量减半

Claude Sonnet 5.5 自 10 月 7 日起读取缓存提示词的价格为每百万 token $0.10,低于此前的 $0.20。Sonnet 5.5 的输入价格为 $2.00,输出价格为 $10.00,因此 0.05 倍的缓存读取倍率如今与 Haiku 5.5 的倍率相同,只是应用在二十倍大的输入费率上。Anthropic 自己的估计是,这能将大多数智能体工作的成本降低约 20%,这是关于工作负载形态的说法,而非基准测试:只有当你的输入中有很大一部分是每轮都重新发送的稳定前缀时,它才成立。如果你的提示词在每次调用时都是独一无二的,那么这一变化既不会让你多花钱,也不会让你省钱。

值得注意的是,这次降价意味着什么。Anthropic 在中端模型上对长生命周期前缀给出了激进的定价,而恰在此时,它又发布了一个非常便宜的小模型;这读起来像是在论证一种双模型架构:一条 Sonnet 5.5 路径配合热缓存,负责需要判断力的工作;另一条 Haiku 5.5 路径,则负责那些不需要判断力的大批量工作。

一天之后,独立数据说明了什么

Artificial Analysis 在 Claude Haiku 5.5 发布次日就完成了评分。其 Intelligence Index 总分为 43,Max-effort 配置报告为 43.40,在榜单 182 个模型中排名第二。每个索引任务成本为 $0.21,便宜程度排第 46。按输入:缓存输入:输出为 7:2:1 的混合比例计算,混合价格为每百万 $0.08,正是这个数字让此前的那档比较对其他所有模型都显得不公平。输出速度为每秒 243.4 个 token,在榜单上排第九快,报告的首 token 延迟约为 0.3 秒,并享有 90% 缓存折扣。

那个4.4亿token的输出数字,是附在43这个分数上的但书。分数是真实且独立跑出来的;冗长程度也是。一个思考这么多的模型,单token成本低,但单任务成本未必总是低,而这两个数字之间的差距,正是路由决策真正所在之处。

作为参照,Anthropic 自己公布的对比显示,Claude Haiku 5.5 在 GDPval-AA v2.1 上为 1620,而 Claude Haiku 4.5 为 735;在 OSWorld 2.1 上为 72.4%,而后者为 15.7%;在无工具条件下 Humanity's Last Exam 上为 45.9%,而后者为 10.2%;在 Terminal-Bench 4.0 上为 39.2%,而后者为 0.0%。这些是厂商自行报告、在厂商自选评测上的数字,应视为方向性参考,但方向并不含糊——这并不是对一个小模型的小幅升级。

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

无需第二份合同即可使用这些模型

Claude Haiku 5.5 可通过 Anthropic 自家的 API 使用,并由此覆盖到所有转售 Anthropic 模型的渠道。在 OrcaRouter 的目录中,Anthropic 系列目前包括 anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5 以及 anthropic/claude-fable-5.1——我们不托管 Claude Haiku 5.5,本简报也不会假装可以。我们提供的是它之上的一档,并且 OrcaRouter 按提供商标价原价转售,加价 0%,因此 Sonnet 5.5 的缓存读取降价当天就出现在我们的定价中,而不是等到既定的重新定价周期才生效,Anthropic 调整价格便是如此。

实用的版本是:如果你想在分类环节试用 Haiku 5.5,而判断环节继续用 Claude Sonnet 5.5,那你手里拿的是两把密钥而不是一把,而 A/B 的取舍正是在路由层决定的。这就是用网关替代直接集成的全部理由——一个端点、模型字符串,以及当某家供应商出现波动时的故障转移路径。

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

接下来要关注什么

三件事。第三方提供商是否会开始以低于 0.10 美元的混合费率转售 Haiku 5.5——这正是路由层证明自己物有所值、而不只是简化采购的临界点。Anthropic 是否会扩展 100,000 token 的层级边界,因为对于一个拥有 100 万 token 窗口的模型来说,恰好在 100,000 处出现断崖是个奇怪的位置。以及 4.4 亿 token 的冗长度数值是否会在某个小版本中降下来,因为正是这一个数字,挡在 Haiku 5.5 成为整个生产栈下半部分显而易见默认选项的路上。