一张主视觉卡片,标题为“Claude Haiku 5.5 与 Claude Sonnet 5.5”,副标题为“相隔六天,相差一个档位”。两张圆角卡片并排:左侧标题为“Claude Haiku 5.5”,各行显示指数 43、每任务 $0.21 和发布于 2026 年 10 月 7 日;右侧标题为“Claude Sonnet 5.5”,各行显示指数 56、每任务 $7.60 和发布于 2026 年 9 月 28 日。二者之间居中放置的徽章写着“实测成本差距 36 倍”。页脚一行写着“每任务成本与 Intelligence Index 均依据 Artificial Analysis;两个模型均为 1M 上下文。”
Guides & Insights

Claude Haiku 5.5 对比 Claude 5.5:20 倍的价目表,实测的账单

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5和Claude Sonnet 5.5同属一个系列,相隔六天、相差一个层级,共享一百万 token 的上下文窗口,并以相同的 API 形态作答。在公布的价目表上,在大多数请求所处的区间内,较便宜的那个价格是较贵的那个的五分之一。在独立的 Artificial Analysis 榜单上,差距还要更大:在 Claude Haiku 5.5 上完成一项 Intelligence Index 任务需 $0.21,而在 Claude Sonnet 5.5 上需 $7.60,二者的 Intelligence Index 分别为 43 与 56。引发本文的那个信号是这样说的:Claude Haiku 5.5 “远好于 GPT-6 Luna”,并且“(更)接近 Sonnet 5.5”。前半句大致与厂商自家对比集所显示的情况相符。后半句则是测量结果不再与营销说法一致的地方,而值得精确说明的是,分歧究竟在何处。

两款机型,相隔六天,相差一个档位

Claude Haiku 5.5 于 2026 年 10 月 7 日发布,模型 ID 为 claude-haiku-5-5。它是 Claude Haiku 4.5 的直接替代品,可接收文本和图像并返回文本,也是 Anthropic 首个为其配备可调 effort 设置的 Haiku 级模型——Low、Medium、High、Xhigh 和 Max,其中 API 默认值为 medium。Anthropic 称其为“我们发布过的成本最低、速度最快、能力最强的小型模型”,其脚注对此的限定是:在每款模型的标准速度下最快,但当 Opus 模型以 Fast Mode 运行时,它仍落后于这些模型。

Claude Sonnet 5.5 提前六天发布,于 2026 年 9 月 28 日上线,型号为 claude-sonnet-5-5——这正是 Anthropic 定位为速度与智能最佳结合的层级,也是它推荐用于复杂智能体编程的型号。同样是一百万 token 的上下文窗口。与 Claude Haiku 5.5 不同,它没有按提示长度划分的价格区间,而事实证明,这一点比那六天的先发优势更为重要。

两者现已在所有平台上提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure,并且都承诺在发布后至少一年内不会退役——Claude Haiku 5.5 为 2027 年 10 月 7 日,Claude Sonnet 5.5 为 2027 年 9 月 28 日。Anthropic 表示,Claude Sonnet 5.5 支持零数据保留,与 Claude Opus 5.5 和 Claude Sonnet 5 一致。

费率卡,双面,尽在一处

按 Anthropic 公布的价格,每百万个 token 以美元计算:

• 输入 — Claude Haiku 5.5:提示词在 100,000 个 token 以内为 $0.10,超出该额度后为 $0.50;Claude Sonnet 5.5 统一为 $2.00,无阶梯定价。

• 输出 — Claude Haiku 5.5:$0.50(最多 100,000 个 token),超出后 $2.50;Claude Sonnet 5.5:统一 $10.00。

• 缓存读取 — Claude Haiku 5.5 在较低档位为 $0.01,超过该档位为 $0.05;Claude Sonnet 5.5 为 $0.10。Anthropic 在发布 Haiku 的同时,将 Claude Sonnet 5.5 的缓存读取价格从 $0.20 下调了一半,并表示由于缓存读取在智能体 token 使用中占很大比重,Claude Sonnet 5.5 在大多数智能体工作上的成本如今降低了约 20%。

• 缓存写入 — Claude Haiku 5.5 在较低档位下,五分钟写入为 $0.125,一小时写入为 $0.20;超出该档位则为 $0.625 和 $1.00;Claude Sonnet 5.5 五分钟写入为 $2.50,一小时为 $4.00。

• Batch — Batch API 在输入和输出两方面均享受 50% 折扣。这样一来,Claude Haiku 5.5 在 100,000 个 token 的分界线以下为 $0.05 和 $0.25,在分界线以上为 $0.25 和 $1.25;相比之下,Claude Sonnet 5.5 为 $1.00 和 $5.00。

横向看这些线,形态是一致的:在较低区间,你看到的是 20 倍输入差距和 20 倍输出差距;线上方则是 4 倍和 4 倍。Anthropic 的主打说法是,与 Claude Haiku 4.5 相比,平均运行成本降低约 75%;脚注进一步说明,在 100,000 个 token 以下便宜 90%,以上便宜 50%,而分词器变更已计入该平均值。

10 万 token 这一步,正是算术发生转折的地方

有两股力量朝相反方向拉扯,而其中只有一股写在价目表上。与 Claude Haiku 4.5 相比,价格大幅下降。与此同时,Claude Haiku 5.5 搭载了更新版分词器,与 Claude Sonnet 5.5 和 Claude Opus 5.5 所用的类似;Anthropic 称其“每个任务使用的 token 略多”——因此,同一个提示词所产生的计费 token 数会比上一代更多。75% 的平均值是这两者相抵后的净结果,而它是一个厂商口径的数字。

10 万 token 这道线,才是最容易让人踩坑的地方。Anthropic 对 Claude Haiku 5.5 的定价是按提示长度来的:提示超过 100,000 token 的请求,整项请求都要按更高的价格计费,而不只是超过阈值的那些 token。提示长度会统计所有输入 token,包括缓存读取和缓存写入,而且每个请求都单独计价——长请求即使有一部分提示命中缓存,也仍按更高档位付费,而更早的请求则保留它们当时被计费的价格。一条稳稳停在 90,000 token 的检索流水线,支付的是 $0.10 和 $0.50。把窗口稍微往上一推,整项请求就会重新按 $0.50 和 $2.50 计价。Claude Sonnet 5.5 不会这样,因为完整的百万 token 窗口都按标准价格计费。

由此产生两个后果,而它们指向相反的方向。首先,人们所期待的那个交叉点——即长上下文让昂贵模型反而变得更便宜——并没有出现:按价目表计算,位于分界线之上的 Claude Haiku 5.5 依然只是 Claude Sonnet 5.5 的四分之一。其次,你所指望的那道差距,会在你的工作负载变重时恰好从 20 倍缩小到 4 倍,而那恰恰正是绝对数字开始变得要紧的时候。这个阶跃,正是一条对成本敏感的流水线需要拥有自己的预算科目、而不是按每 token 费率来算的原因。

各供应商报告其得分

本节中的所有内容均由厂商报告,未经第三方复现。Anthropic 在其 Claude Haiku 5.5 和 Claude Sonnet 5.5 页面上发布了相同的对比集,而在两个页面重叠之处,它们的结果一致:

• GDPval-AA v2.1,知识工作——Claude Haiku 5.5 为 1,620,而 Claude Sonnet 5.5 为 1,840,Claude Haiku 4.5 为 735,GPT-6 Luna 为 1,437。

• AA-Briefcase v1.1 — 在 Claude Haiku 5.5 上为 1,578,相比之下 Claude Sonnet 5.5 为 1,824,Claude Haiku 4.5 为 614,GPT-6 Luna 为 1,336。

• OSWorld 2.1,计算机使用,离线子集——Claude Haiku 5.5 为 72.4%,而 Claude Sonnet 5.5 为 83.9%,Claude Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%。

• Terminal-Bench 4.0,智能体编程 —— Claude Haiku 5.5 为 39.2%,而 Claude Sonnet 5.5 为 70.6%,Claude Haiku 4.5 为 0.0%,GPT-6 Luna 为 16.4%。

• FrontierCode 1.1、Main — Claude Haiku 5.5 为 46.4%,而 Claude Sonnet 5.5 在 Xhigh 努力级别下为 52.1%,GPT-6 Luna 为 42.4%。Anthropic 还指出,在这项测试中,Claude Sonnet 5.5 在 Max 努力级别下的得分低于 Xhigh 级别,并将其归因于更频繁地使用代码审查技能,从而导致超时或超出范围的编辑。

• 图表解析,无工具视觉推理——Claude Haiku 5.5 为 46.4%,Claude Sonnet 5.5 为 61.6%,Claude Haiku 4.5 为 6.4%,GPT-6 Luna 为 29.1%。

• Humanity's Last Exam — Claude Haiku 5.5 不使用工具时为 45.9%,使用工具时为 57.4%;在同一页面上,Claude Sonnet 5.5 使用工具时为 64.5%,Claude Haiku 4.5 为 18.7%,Claude Sonnet 5.5 不使用工具时为 56.9%。Anthropic 指出,GPT-6 系列的数据可能已过时,因为 OpenAI 修复了一个图像理解错误,而第三方评分尚未全部更新。

其中两行值得读两遍。在 FrontierCode 上,这两个模型称得上接近——46.4% 对 52.1%;而在 Chartography 上,由于没有工具可以遮掩,差距达到 15 个百分点。Terminal-Bench 4.0 则完全谈不上接近:39.2% 对 70.6%,这已经是另一个能力层级,正因如此,Anthropic 的 Claude Sonnet 5.5 页面仍将复杂智能体编程指向 Claude Sonnet 5.5 和 Claude Opus 5.5,并把 Claude Haiku 5.5 定位为适合范围窄、高吞吐量工作的模型。

董事会带来什么

Anthropic 给出的数字是将自家模型相互比较,并与一个竞争对手作对比。一个独立榜单则把两者与整个领域放在一起衡量,而它给出、各家厂商却没有给出的那个数字,是每完成一项任务的成本。

Artificial Analysis 对 Claude Haiku 5.5 在 Max effort 模式下的评分为:智能指数 43,远高于同类模型 13 的中位数;在该指数测试中生成了 4.4 亿输出 token,而中位数为 1 亿——输出极为冗长——输入价格为每百万 token 0.10 美元,输出价格为每百万 token 0.50 美元,输出速度为每秒 242 个 token。其测得的成本为每个智能指数任务 0.21 美元。

同一排行榜给 Claude Sonnet 5.5 打出 56 分,而中位数为 26;生成 4.10 亿个输出 token,而中位数为 8800 万;输入价格为 $2.00,输出价格为 $10.00,并享有 90% 的缓存折扣。其在每项 Intelligence Index 任务上的实测成本为 $7.60。

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

把这两行并排放,比例本身就说明了一切。$0.21 对 $7.60 是略高于 36 倍,而两个模型在冗长度上几乎持平——输出 token 为 440M 对 410M——所以这个倍数几乎完全是价目表在按照它所说的方式发挥作用。在供应商自己的价目表上,同样的比较是 20 倍。多出来的部分来自按 token 计价无法体现的东西:在这个 effort 设置下,较便宜的模型每项任务以更少的计费 token 得出答案,而且缓存读取的计费费率是 Claude Sonnet 5.5 的十分之一。相同测试框架,相同任务,独立测量。

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

低价档位真正耗尽的地方

Anthropic 公布的客户数据比基准测试更能决定取舍,而且它们都指向同一个方向。Asana 报告称任务完成的延迟降低了 30% 以上,每个智能体回合的推理速度最高提升 2.5 倍。Box 报告称其得分比 Claude Haiku 4.5 高出 11 分,而延迟约为后者的一半。HubSpot 报告称这是其自有测试套件上见过的最高得分,三次运行平均为 92.8%,命中率最高,误报率最低。AlphaSense 每周通过“Ask in Document”运行约 800 万次调用,并报告称相比 Claude Haiku 4.5 有统计显著提升,0.84 对 0.76。Cognition 报告称,以 Claude Haiku 5.5 作为辅助,其 Fusion 智能体保持了 66.2 的 FrontierCode 得分。

这些当中没有一个是长时程智能体。它们是点状解决方案——只负责一个定义明确的步骤,而且越来越快、越来越便宜。这正是 Claude Haiku 5.5 为之打造的场景,也正是在这种场景下,36 倍的成本优势是实打实的钱,而不是可以四舍五入抹掉的零头。这一优势会随调用量增加而累积,也会随调用深度增加而消失:每天十万次分类调用,输入 $0.10、输出 $0.50,是一笔你会眼看着它消失的支出项;而每个会话一百个智能体回合、每一回合都要重新读取累积的上下文,则是一笔超线性增长的支出项,因为超过阈值的每一个回合都要按更高的费率档位付费。

Claude Sonnet 5.5 的反驳论点在于按每次尝试计算的成本,而非按 token 计算的成本。Anthropic 称,它比 Claude Sonnet 5 快 30% 以上,并且在大多数工作中成本最多降低 30%,这一节省来自所需 token 更少,而非单价更低。第三方测试者给出了具体数字:Slack 报告输出 token 减少约 14%,Balyasny 每次回答约 121k token,而对照为 497k,Box 快 2.4 倍且 token 减少 12%,Lovable 工具调用减少约三分之一、shell 运行次数减少约一半,Atlassian 的 Rovo Agents 最多快 30%,Base44 每次构建 3.6 次迭代,而 Claude Opus 5 为 7.7 次。一次奏效的回合胜过四次不奏效的回合。

还有第三个因素朝着相反方向起作用。Anthropic 在这一代已将 effort 调整为模型级调节项——Claude Haiku 5.5 的 effort 是按请求设置一次,而不是作为每次请求的思考设置,并且旧的 budget_tokens 模式在 4.6 模型上已弃用,在后续模型上也不再被接受。对于由许多服务组成、调用同一个模型 ID 的机群来说,这是一种简化。对于任何按调用自行决定推理规模的东西来说,这都是一次重写。

在同一个端点后面运行两者

这个决定之所以值得做对,是因为一旦选错其中一半,纠正的代价会很高:把一条生产路径从一个模型 ID 改接到另一个,意味着要动到每一处曾假定旧模型行为的调用点。想知道某个工作负载该归到哪一档,更省事的做法是让两者跑在同一个端点后面,靠配置而不是靠重构在它们之间切换流量。

这正是 OrcaRouter 的用途所在。Claude Sonnet 5.5 已在目录中,其标识为 anthropic/claude-sonnet-5.5,与 Claude Sonnet 5、Claude Opus 5.5 和 Claude Haiku 4.5 并列——较旧的 Haiku 层级仍然可用,作为你迁移离开它时的参照基准。该平台以零加价透传提供商的目录价,因此上面的 $2.00 和 $10.00 就是你要支付的费率,反之亦然:当供应商调价时,新价格当天即在此生效,Claude Sonnet 5.5 的缓存读取降价就是这样传到我们这里的。这一具体决策需要两项功能来实现。自动故障转移能让仍在评估中的模型自动远离你的关键路径,而路由 DSL 让你在同一请求流程中把低于 100,000 token 的调用发送到廉价层级,把长上下文或长周期任务的调用交给更贵的那一个,无需第二份合同或第二个 SDK。

准确地说,哪些已托管、哪些尚未托管:Claude Sonnet 5.5 目前可通过我们进行路由调用。Claude Haiku 5.5 尚未上线我们的平台。在它上线之前,只能通过 Anthropic 自家的 API 以及上文列出的三个云平台访问。

如何决定

选择 Claude Haiku 5.5,适用于任务范围窄、量大且可核验的场景——分类、抽取、路由、摘要,以及你已构建的智能体内部的逐轮工作。20 倍的价格差距在那里正是关键所在,100,000 token 的档位在设计上本就可避免,而独立测得的每任务 $0.21 说明这一优势在厂商自家实验室之外依然成立。按任务类别设置 effort 档位,而不是让它停留在默认值;在 Haiku 级模型上,Low 与 Max 之间的差异是成本倍增,而不是质量偏好。

当任务属于长周期、智能体式或无法验证的范畴时——比如必须能编译通过的代码、必须让屏幕停留在已知状态的计算机操作,以及任何错误答案的代价高于调用成本的情况——就选 Claude Sonnet 5.5。Terminal-Bench 4.0 上 70.6% 对 39.2%,这不是细微差别,而是不同层级的能力,并且固定费率卡意味着长上下文不会悄悄让整个请求重新计价。如果你的工作负载确实介于两者之间,那么诚实的答案是:目前两个模型都还没有大量第三方复现作为支撑,索引分数来自单一测试框架,而上面引用的厂商数字是厂商自己给出的。

什么会改变这个答案

有三件事值得关注,而且都不是基准测试的发布。第一,对 Claude Haiku 5.5 在 Low、High 和 Xhigh 努力程度下——而不只是 Max——进行的独立评估,是否显示相同的每任务成本比,因为努力程度调节是这一比较中最便宜的杠杆,也是被测量得最少的。第二,10 万 token 的档位是否能延续;如果下一代出现第三档,或者完全没有档位,那么对每一套检索流水线来说,其算术变化都会超过任何单个基准测试分数对这条线的影响。第三,是分词器。如果后续某个检查点以较旧的比例对同一文本进行分词,那么 Anthropic 的 75% 平均值就会变成下限而不是目标,而与 Claude Sonnet 5.5 的差距就会在双方价格都不变的情况下扩大。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新