
Claude Haiku 5.5 已上线,每百万 Token 收费 0.10 美元:75% 的说法及其两个脚注
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Anthropic 将 Claude Haiku 5.5于 2026 年 10 月 7 日全面开放,定价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元——这两个数字与 OpenAI 为 GPT-6 Luna收取的完全相同,也只有 Claude Haiku 4.5自 2025 年以来的价格(它发布时为 1.00 美元和 5.00 美元)的五分之一。Anthropic 发布博文中最醒目的说法是,新模型的平均运行成本比上一代低约 75%,而这正是此后每一篇摘要都在重复的数字。它随附两条脚注,大多数这类摘要都把它们略去了:低于 100,000 token 时降幅为 90%,高于这一门槛则为 50%;此外 Claude Haiku 5.5 使用与 4.7 及之后版本相同的新分词器,因此同样的文本会被算作大约 多出 30% 的 token,而基准是Claude Haiku 4.5。所以这个 75% 讲的是账单,而不是价目表;对于提示词很长的人来说,这两者是不同的东西。厂商自己的对比表还把它与 GPT-6 Luna和 Claude Sonnet 5.5并排列为对比列,这让这份发布文档格外容易被人挑刺。
“少75%”背后的算术
先看价目表,因为它并非固定费率。输入在不超过 100,000 个 token 时是每百万 $0.10,超过后是每百万 $0.50——足足五倍。输出则是 $0.50,然后是 $2.50。缓存也遵循同样的阶梯:五分钟缓存写入在分界线以下为每百万 $0.125,以上为 $0.625;一小时写入为 $0.20 和 $1.00;缓存读取为 $0.01 和 $0.05。Message Batches API 对两项计费都减免 50%,而且在批量路径上,模型支持最多 300,000 个输出 token,并带有 output-300k-2026-03-24 beta 标头。
现在在此基础上再加上分词器,因为正是在这里,标题中的说法开始变得有意思。一个在 Claude Haiku 4.5 分词器上测得 90,000 个 token 的提示词,在新分词器上大约测得 117,000 个。它的大小并没有改变,却已经越过了 100,000 个 token 这条线,因此按每百万输入 $0.50 计费,而不是 $0.10。在 Claude Haiku 4.5 上,同样的内容输入成本为 $0.09(每百万 $1.00 × 0.09 百万)。在 Claude Haiku 5.5 上,成本为 $0.0585。这是 35% 的降幅——确实存在,但远不及 90%。90% 这个数字适用于那些在分词器扩展后仍低于这条线的请求,而大量短调用流量正属于这一类:一次 20,000 个 token 的分类调用变成 26,000 个 token,仍留在第一档,而在那里,输入价格确实只有原来的十分之一。
由此可以得出三点,它们值得分开考虑,而不是平均处理:
• 短调用可享受完整折扣。对于未超过限额的文档,其抽取、路由、分类和摘要——在输入和输出上都能拿到 90% 这一数字,但要减去分词器带来的膨胀。
• 长调用大约便宜三分之一,而不是四分之三。重新分词后超过 100,000 token 的请求,每百万 token 需支付 $0.50 和 $2.50——仍然只有 Claude Haiku 4.5 费率的一半,但它所处的档位是标价所宣传档位的五倍。
• “平均减少 75%”是一个按流量加权的数字,而且是 Anthropic 自己的数字。这是供应商对自身预期流量构成的描述,而 Anthropic 也明确指出,低于该阈值的提示词约占此前 Haiku 所收到请求的 90%。如果你的流量构成不是那种构成,你的平均值也就不会是那个平均值——而要弄清究竟属于哪种情况,唯一的办法就是在设定预算之前,用新的分词器对你自己的流量进行 token 计数。

还有什么随它一起发布了?
这个模型不仅仅是一个价格。发布细节中有好几项会改变你针对它编写代码的方式,而其中一项还会破坏现有的客户端。
• 自适应思考默认开启,努力程度可从“低”调节到“最高”,默认值为中。这是首个具备可调努力程度设置的 Haiku 级模型,也是影响每次回答质量与成本的主要调节手段。
• 采样参数会被拒绝。发送非默认的 temperature、top_p 或 top 会返回 400。任何将这些参数沿用下去的迁移,都会在第一次请求时直接失败,而不是悄悄降级,这至少是一种诚实的失败模式。
• 100 万 token 上下文,最多 128,000 个输出 token,适用于同步 Messages API,知识截止日期为 2026 年 6 月,并承诺不早于 2027 年 10 月 7 日退役。
• 首日即登陆五大平台:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform。这是同日一次性上线,而非此类发布常见的分阶段开放。
• 工具链也有了变化。Anthropic 的 Python 和 TypeScript SDK 现在已在测试版中支持计算机使用和浏览器使用,该公司还为 Max 5x(100 美元)、Max 20x(200 美元)和 Team(最高 500 美元共享额度)订阅用户增加了每月 API 额度。
• 其安全防护范围比价格所暗示的更窄。Anthropic 表示,Claude Haiku 5.5 在网络领域的安全防护比 Claude Haiku 4.5 更严格,但比近期前沿模型更宽松——其允许的防御性用途比 Claude Sonnet 5.5 更广,同时渗透测试仍被禁止——并且其生物领域的安全防护与 Claude Sonnet 5、Claude Sonnet 5.5 和 Claude Opus 5 相当。在 Anthropic 自家的评测套件上,对齐评估相较前代总体有所提升。
供应商的表格说了什么,以及独立董事会说了什么
Anthropic 发布了一张包含三列对比的基准测试表,值得当作一份关于厂商如何论证的文献来读。下文的每一个数字都由厂商自行报告,在 Anthropic 的评测框架上产生,且无一经过独立复现;凡是出现 GPT-6 Luna 的地方,都是 Anthropic 用自家评测去跑竞争对手的模型。
• 知识工作 — GDPval-AA v2.1 在 Claude Haiku 5.5 上为 1620,而 Claude Haiku 4.5 为 735,GPT-6 Luna 为 1437,Claude Sonnet 5.5 为 1840。AA-Briefcase v1.1 分别为 1578、614、1336 和 1824。
• 计算机使用——OSWorld 2.1 离线成绩为 72.4%,相比之下分别为 15.7%、48.9% 和 83.9%。
• 推理 — Humanity's Last Exam 上,无工具时为 45.9%,使用工具时为 57.4%;相比之下,Claude Haiku 4.5 为 10.2% 和 18.7%,Claude Sonnet 5.5 为 56.9% 和 64.5%。
• 智能体编程 — 在 Terminal-Bench 4.0 上达 39.2%,相比之下分别为 0.0%、16.4% 和 70.6%。FrontierCode 1.1(Main)达 46.4%,而 GPT-6 Luna 为 42.4%,Claude Sonnet 5.5 为 52.1%。
• 图表解读 — 不使用工具时图表学为46.4%,相比之下分别为6.4%、29.1%和61.6%。
在那张表上,Claude Haiku 5.5 在与上一代 Haiku 和 GPT-6 Luna 的对比中每一行都胜出,而在与 Claude Sonnet 5.5 的对比中大多数行都落败——这正是小模型层级的真实面貌:一次巨大的代际跃升,但在最难的工作上仍比中档模型低一个层级。Anthropic 在文章中也是这样说的,推荐将 Claude Sonnet 5.5 和 Claude Opus 5.5 用于复杂的智能体编码,同时将 Haiku 定位为用于压缩、摘要、分类和子智能体角色。
独立视角下的情况更为微妙,也需要更多的关注。Artificial Analysis 在其 Intelligence Index v4.3.2 上测得,Claude Haiku 5.5 在 Max 努力档位下为 43 分,在 182 个模型中排名第二,输出速度为每秒 241.9 个 token——确实如宣传所说的那样快。它还测得每完成一项 Index 任务的成本为 0.21 美元,因为该模型在运行整套测试时生成了 4.4 亿个输出 token,而中位数是 1 亿个;评测方称其非常冗长。GPT-6 Luna 在同一指数上得 38 分,每项任务成本为 0.07 美元。标价相同,账单却是三倍。这并不与发布时的说法相矛盾——它正是该说法所指向的同一现象,只是从另一端来看:价目表说的是每个 token 你付多少钱,而你实际支付的数字是单价乘以 token 数,而 Claude Haiku 5.5 每个回答所消耗的 token 比它的竞争对手更多。努力程度就是那根杠杆;该模型的默认值是中等,而非 Max,而把它固定在更低档位的团队,看到的账单会更小,分数也会更低。
从一处调用它
这次发布带来的迁移问题不是"它是不是更好",而是"我的流量在它上面要花多少钱",而这个答案取决于你的提示词长度、缓存命中率,以及你选择的 effort 设置。要弄清楚这一点,就意味着把你自己的提示词集在两代模型上都跑一遍——在同一个端点后面做这件事很便宜,跨两个端点做就很繁琐。
Claude Haiku 5.5 本身尚未出现在 OrcaRouter 的目录中,而直白地说明这一点比暗示相反的情况更有用。Anthropic 产品线的其余部分如下:Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 今天都可以通过我们按提供商标价调用,0% 加价原样传递,因此迁移测试的“之前”阶段运行在你之后仍会保留的同一密钥上,而供应商在那条链路上的降价当天就会在我们这边生效。“之后”阶段则是 Anthropic 的 API,直到新模型进入我们路由的某个运行时。与此同时,共享端点为你带来的是调用底层的自动故障转移,因此新模型可以承载生产流量而不让这条路径依赖它,以及当从 Haiku 升级到 Sonnet 应放在路由中而不是你的应用程序代码中时所用的路由 DSL。

发布中的两项客户成果值得作为线索而非证据继续跟进。Asana 报告延迟降低超过 30%,每个智能体回合的推理速度最高提升 2.5 倍;HubSpot 报告在其 CRM 套件上三次运行平均达到 92.8%;AlphaSense 报告在 400 个查询上达到 0.84,对比 0.76。这些是供应商在自己公告中挑选的客户数据,其价值在于告诉你应首先测试哪些工作负载,而不在于告诉你将会得到什么。
什么会改变局面
75% 这个数字将以每一种按流量加权的厂商声明都会被定论的方式得到定论:用你自己的账单。在独立评测这一边,真正尚未有定论的是每任务成本这个数字。如果随着更多运行结果积累,它依然站得住脚,那么对这次发布最诚实的总结就是:Anthropic 把费率表下调了 80%,并打造了一个每次回答消耗更多 token 的模型,因此实际节省是真实的、幅度可观、取决于工作负载,而且很少等于海报上的那个数字。如果它会随着 effort 设置和缓存而下移,这一档位看起来还会更好。无论如何,在切换之前要核对的数字,是你自己在新分词器下每任务消耗的 token 数——这正是发布文章无法给你的那个数字。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
