
Claude Haiku 5.5 对比 Claude 5.5:20 倍的价目表,实测的账单
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Haiku 5.5和Claude Sonnet 5.5同属一个系列,相隔六天、相差一个层级,共享一百万 token 的上下文窗口,并以相同的 API 形态作答。在公布的价目表上,在大多数请求所处的区间内,较便宜的那个价格是较贵的那个的五分之一。在独立的 Artificial Analysis 榜单上,差距还要更大:在 Claude Haiku 5.5 上完成一项 Intelligence Index 任务需 $0.21,而在 Claude Sonnet 5.5 上需 $7.60,二者的 Intelligence Index 分别为 43 与 56。引发本文的那个信号是这样说的:Claude Haiku 5.5 “远好于 GPT-6 Luna”,并且“(更)接近 Sonnet 5.5”。前半句大致与厂商自家对比集所显示的情况相符。后半句则是测量结果不再与营销说法一致的地方,而值得精确说明的是,分歧究竟在何处。
两款机型,相隔六天,相差一个档位
Claude Haiku 5.5 于 2026 年 10 月 7 日发布,模型 ID 为 claude-haiku-5-5。它是 Claude Haiku 4.5 的直接替代品,可接收文本和图像并返回文本,也是 Anthropic 首个为其配备可调 effort 设置的 Haiku 级模型——Low、Medium、High、Xhigh 和 Max,其中 API 默认值为 medium。Anthropic 称其为“我们发布过的成本最低、速度最快、能力最强的小型模型”,其脚注对此的限定是:在每款模型的标准速度下最快,但当 Opus 模型以 Fast Mode 运行时,它仍落后于这些模型。
Claude Sonnet 5.5 提前六天发布,于 2026 年 9 月 28 日上线,型号为 claude-sonnet-5-5——这正是 Anthropic 定位为速度与智能最佳结合的层级,也是它推荐用于复杂智能体编程的型号。同样是一百万 token 的上下文窗口。与 Claude Haiku 5.5 不同,它没有按提示长度划分的价格区间,而事实证明,这一点比那六天的先发优势更为重要。
两者现已在所有平台上提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure,并且都承诺在发布后至少一年内不会退役——Claude Haiku 5.5 为 2027 年 10 月 7 日,Claude Sonnet 5.5 为 2027 年 9 月 28 日。Anthropic 表示,Claude Sonnet 5.5 支持零数据保留,与 Claude Opus 5.5 和 Claude Sonnet 5 一致。
费率卡,双面,尽在一处
按 Anthropic 公布的价格,每百万个 token 以美元计算:
• 输入 — Claude Haiku 5.5:提示词在 100,000 个 token 以内为 $0.10,超出该额度后为 $0.50;Claude Sonnet 5.5 统一为 $2.00,无阶梯定价。
• 输出 — Claude Haiku 5.5:$0.50(最多 100,000 个 token),超出后 $2.50;Claude Sonnet 5.5:统一 $10.00。
• 缓存读取 — Claude Haiku 5.5 在较低档位为 $0.01,超过该档位为 $0.05;Claude Sonnet 5.5 为 $0.10。Anthropic 在发布 Haiku 的同时,将 Claude Sonnet 5.5 的缓存读取价格从 $0.20 下调了一半,并表示由于缓存读取在智能体 token 使用中占很大比重,Claude Sonnet 5.5 在大多数智能体工作上的成本如今降低了约 20%。
• 缓存写入 — Claude Haiku 5.5 在较低档位下,五分钟写入为 $0.125,一小时写入为 $0.20;超出该档位则为 $0.625 和 $1.00;Claude Sonnet 5.5 五分钟写入为 $2.50,一小时为 $4.00。
• Batch — Batch API 在输入和输出两方面均享受 50% 折扣。这样一来,Claude Haiku 5.5 在 100,000 个 token 的分界线以下为 $0.05 和 $0.25,在分界线以上为 $0.25 和 $1.25;相比之下,Claude Sonnet 5.5 为 $1.00 和 $5.00。
横向看这些线,形态是一致的:在较低区间,你看到的是 20 倍输入差距和 20 倍输出差距;线上方则是 4 倍和 4 倍。Anthropic 的主打说法是,与 Claude Haiku 4.5 相比,平均运行成本降低约 75%;脚注进一步说明,在 100,000 个 token 以下便宜 90%,以上便宜 50%,而分词器变更已计入该平均值。
10 万 token 这一步,正是算术发生转折的地方
有两股力量朝相反方向拉扯,而其中只有一股写在价目表上。与 Claude Haiku 4.5 相比,价格大幅下降。与此同时,Claude Haiku 5.5 搭载了更新版分词器,与 Claude Sonnet 5.5 和 Claude Opus 5.5 所用的类似;Anthropic 称其“每个任务使用的 token 略多”——因此,同一个提示词所产生的计费 token 数会比上一代更多。75% 的平均值是这两者相抵后的净结果,而它是一个厂商口径的数字。
10 万 token 这道线,才是最容易让人踩坑的地方。Anthropic 对 Claude Haiku 5.5 的定价是按提示长度来的:提示超过 100,000 token 的请求,整项请求都要按更高的价格计费,而不只是超过阈值的那些 token。提示长度会统计所有输入 token,包括缓存读取和缓存写入,而且每个请求都单独计价——长请求即使有一部分提示命中缓存,也仍按更高档位付费,而更早的请求则保留它们当时被计费的价格。一条稳稳停在 90,000 token 的检索流水线,支付的是 $0.10 和 $0.50。把窗口稍微往上一推,整项请求就会重新按 $0.50 和 $2.50 计价。Claude Sonnet 5.5 不会这样,因为完整的百万 token 窗口都按标准价格计费。
由此产生两个后果,而它们指向相反的方向。首先,人们所期待的那个交叉点——即长上下文让昂贵模型反而变得更便宜——并没有出现:按价目表计算,位于分界线之上的 Claude Haiku 5.5 依然只是 Claude Sonnet 5.5 的四分之一。其次,你所指望的那道差距,会在你的工作负载变重时恰好从 20 倍缩小到 4 倍,而那恰恰正是绝对数字开始变得要紧的时候。这个阶跃,正是一条对成本敏感的流水线需要拥有自己的预算科目、而不是按每 token 费率来算的原因。
各供应商报告其得分
本节中的所有内容均由厂商报告,未经第三方复现。Anthropic 在其 Claude Haiku 5.5 和 Claude Sonnet 5.5 页面上发布了相同的对比集,而在两个页面重叠之处,它们的结果一致:
• GDPval-AA v2.1,知识工作——Claude Haiku 5.5 为 1,620,而 Claude Sonnet 5.5 为 1,840,Claude Haiku 4.5 为 735,GPT-6 Luna 为 1,437。
• AA-Briefcase v1.1 — 在 Claude Haiku 5.5 上为 1,578,相比之下 Claude Sonnet 5.5 为 1,824,Claude Haiku 4.5 为 614,GPT-6 Luna 为 1,336。
• OSWorld 2.1,计算机使用,离线子集——Claude Haiku 5.5 为 72.4%,而 Claude Sonnet 5.5 为 83.9%,Claude Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%。
• Terminal-Bench 4.0,智能体编程 —— Claude Haiku 5.5 为 39.2%,而 Claude Sonnet 5.5 为 70.6%,Claude Haiku 4.5 为 0.0%,GPT-6 Luna 为 16.4%。
• FrontierCode 1.1、Main — Claude Haiku 5.5 为 46.4%,而 Claude Sonnet 5.5 在 Xhigh 努力级别下为 52.1%,GPT-6 Luna 为 42.4%。Anthropic 还指出,在这项测试中,Claude Sonnet 5.5 在 Max 努力级别下的得分低于 Xhigh 级别,并将其归因于更频繁地使用代码审查技能,从而导致超时或超出范围的编辑。
• 图表解析,无工具视觉推理——Claude Haiku 5.5 为 46.4%,Claude Sonnet 5.5 为 61.6%,Claude Haiku 4.5 为 6.4%,GPT-6 Luna 为 29.1%。
• Humanity's Last Exam — Claude Haiku 5.5 不使用工具时为 45.9%,使用工具时为 57.4%;在同一页面上,Claude Sonnet 5.5 使用工具时为 64.5%,Claude Haiku 4.5 为 18.7%,Claude Sonnet 5.5 不使用工具时为 56.9%。Anthropic 指出,GPT-6 系列的数据可能已过时,因为 OpenAI 修复了一个图像理解错误,而第三方评分尚未全部更新。
其中两行值得读两遍。在 FrontierCode 上,这两个模型称得上接近——46.4% 对 52.1%;而在 Chartography 上,由于没有工具可以遮掩,差距达到 15 个百分点。Terminal-Bench 4.0 则完全谈不上接近:39.2% 对 70.6%,这已经是另一个能力层级,正因如此,Anthropic 的 Claude Sonnet 5.5 页面仍将复杂智能体编程指向 Claude Sonnet 5.5 和 Claude Opus 5.5,并把 Claude Haiku 5.5 定位为适合范围窄、高吞吐量工作的模型。
董事会带来什么
Anthropic 给出的数字是将自家模型相互比较,并与一个竞争对手作对比。一个独立榜单则把两者与整个领域放在一起衡量,而它给出、各家厂商却没有给出的那个数字,是每完成一项任务的成本。
Artificial Analysis 对 Claude Haiku 5.5 在 Max effort 模式下的评分为:智能指数 43,远高于同类模型 13 的中位数;在该指数测试中生成了 4.4 亿输出 token,而中位数为 1 亿——输出极为冗长——输入价格为每百万 token 0.10 美元,输出价格为每百万 token 0.50 美元,输出速度为每秒 242 个 token。其测得的成本为每个智能指数任务 0.21 美元。
同一排行榜给 Claude Sonnet 5.5 打出 56 分,而中位数为 26;生成 4.10 亿个输出 token,而中位数为 8800 万;输入价格为 $2.00,输出价格为 $10.00,并享有 90% 的缓存折扣。其在每项 Intelligence Index 任务上的实测成本为 $7.60。


把这两行并排放,比例本身就说明了一切。$0.21 对 $7.60 是略高于 36 倍,而两个模型在冗长度上几乎持平——输出 token 为 440M 对 410M——所以这个倍数几乎完全是价目表在按照它所说的方式发挥作用。在供应商自己的价目表上,同样的比较是 20 倍。多出来的部分来自按 token 计价无法体现的东西:在这个 effort 设置下,较便宜的模型每项任务以更少的计费 token 得出答案,而且缓存读取的计费费率是 Claude Sonnet 5.5 的十分之一。相同测试框架,相同任务,独立测量。

低价档位真正耗尽的地方
Anthropic 公布的客户数据比基准测试更能决定取舍,而且它们都指向同一个方向。Asana 报告称任务完成的延迟降低了 30% 以上,每个智能体回合的推理速度最高提升 2.5 倍。Box 报告称其得分比 Claude Haiku 4.5 高出 11 分,而延迟约为后者的一半。HubSpot 报告称这是其自有测试套件上见过的最高得分,三次运行平均为 92.8%,命中率最高,误报率最低。AlphaSense 每周通过“Ask in Document”运行约 800 万次调用,并报告称相比 Claude Haiku 4.5 有统计显著提升,0.84 对 0.76。Cognition 报告称,以 Claude Haiku 5.5 作为辅助,其 Fusion 智能体保持了 66.2 的 FrontierCode 得分。
这些当中没有一个是长时程智能体。它们是点状解决方案——只负责一个定义明确的步骤,而且越来越快、越来越便宜。这正是 Claude Haiku 5.5 为之打造的场景,也正是在这种场景下,36 倍的成本优势是实打实的钱,而不是可以四舍五入抹掉的零头。这一优势会随调用量增加而累积,也会随调用深度增加而消失:每天十万次分类调用,输入 $0.10、输出 $0.50,是一笔你会眼看着它消失的支出项;而每个会话一百个智能体回合、每一回合都要重新读取累积的上下文,则是一笔超线性增长的支出项,因为超过阈值的每一个回合都要按更高的费率档位付费。
Claude Sonnet 5.5 的反驳论点在于按每次尝试计算的成本,而非按 token 计算的成本。Anthropic 称,它比 Claude Sonnet 5 快 30% 以上,并且在大多数工作中成本最多降低 30%,这一节省来自所需 token 更少,而非单价更低。第三方测试者给出了具体数字:Slack 报告输出 token 减少约 14%,Balyasny 每次回答约 121k token,而对照为 497k,Box 快 2.4 倍且 token 减少 12%,Lovable 工具调用减少约三分之一、shell 运行次数减少约一半,Atlassian 的 Rovo Agents 最多快 30%,Base44 每次构建 3.6 次迭代,而 Claude Opus 5 为 7.7 次。一次奏效的回合胜过四次不奏效的回合。
还有第三个因素朝着相反方向起作用。Anthropic 在这一代已将 effort 调整为模型级调节项——Claude Haiku 5.5 的 effort 是按请求设置一次,而不是作为每次请求的思考设置,并且旧的 budget_tokens 模式在 4.6 模型上已弃用,在后续模型上也不再被接受。对于由许多服务组成、调用同一个模型 ID 的机群来说,这是一种简化。对于任何按调用自行决定推理规模的东西来说,这都是一次重写。
在同一个端点后面运行两者
这个决定之所以值得做对,是因为一旦选错其中一半,纠正的代价会很高:把一条生产路径从一个模型 ID 改接到另一个,意味着要动到每一处曾假定旧模型行为的调用点。想知道某个工作负载该归到哪一档,更省事的做法是让两者跑在同一个端点后面,靠配置而不是靠重构在它们之间切换流量。
这正是 OrcaRouter 的用途所在。Claude Sonnet 5.5 已在目录中,其标识为 anthropic/claude-sonnet-5.5,与 Claude Sonnet 5、Claude Opus 5.5 和 Claude Haiku 4.5 并列——较旧的 Haiku 层级仍然可用,作为你迁移离开它时的参照基准。该平台以零加价透传提供商的目录价,因此上面的 $2.00 和 $10.00 就是你要支付的费率,反之亦然:当供应商调价时,新价格当天即在此生效,Claude Sonnet 5.5 的缓存读取降价就是这样传到我们这里的。这一具体决策需要两项功能来实现。自动故障转移能让仍在评估中的模型自动远离你的关键路径,而路由 DSL 让你在同一请求流程中把低于 100,000 token 的调用发送到廉价层级,把长上下文或长周期任务的调用交给更贵的那一个,无需第二份合同或第二个 SDK。
准确地说,哪些已托管、哪些尚未托管:Claude Sonnet 5.5 目前可通过我们进行路由调用。Claude Haiku 5.5 尚未上线我们的平台。在它上线之前,只能通过 Anthropic 自家的 API 以及上文列出的三个云平台访问。
如何决定
选择 Claude Haiku 5.5,适用于任务范围窄、量大且可核验的场景——分类、抽取、路由、摘要,以及你已构建的智能体内部的逐轮工作。20 倍的价格差距在那里正是关键所在,100,000 token 的档位在设计上本就可避免,而独立测得的每任务 $0.21 说明这一优势在厂商自家实验室之外依然成立。按任务类别设置 effort 档位,而不是让它停留在默认值;在 Haiku 级模型上,Low 与 Max 之间的差异是成本倍增,而不是质量偏好。
当任务属于长周期、智能体式或无法验证的范畴时——比如必须能编译通过的代码、必须让屏幕停留在已知状态的计算机操作,以及任何错误答案的代价高于调用成本的情况——就选 Claude Sonnet 5.5。Terminal-Bench 4.0 上 70.6% 对 39.2%,这不是细微差别,而是不同层级的能力,并且固定费率卡意味着长上下文不会悄悄让整个请求重新计价。如果你的工作负载确实介于两者之间,那么诚实的答案是:目前两个模型都还没有大量第三方复现作为支撑,索引分数来自单一测试框架,而上面引用的厂商数字是厂商自己给出的。
什么会改变这个答案
有三件事值得关注,而且都不是基准测试的发布。第一,对 Claude Haiku 5.5 在 Low、High 和 Xhigh 努力程度下——而不只是 Max——进行的独立评估,是否显示相同的每任务成本比,因为努力程度调节是这一比较中最便宜的杠杆,也是被测量得最少的。第二,10 万 token 的档位是否能延续;如果下一代出现第三档,或者完全没有档位,那么对每一套检索流水线来说,其算术变化都会超过任何单个基准测试分数对这条线的影响。第三,是分词器。如果后续某个检查点以较旧的比例对同一文本进行分词,那么 Anthropic 的 75% 平均值就会变成下限而不是目标,而与 Claude Sonnet 5.5 的差距就会在双方价格都不变的情况下扩大。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
