
Claude Haiku 5.5:价格直降 90%、全新分词器,以及 Anthropic 没有发布的那段视频
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
有人向Claude Haiku 5.5里输入了一句话,就得到了一支制作完成的发布影片。这条提示词于 2026 年 10 月 7 日晚上发布在 X 上,全文如下:“为你的发布活动做一条炸裂十倍的视频,展示你作为动效设计师有多出色。”帖子的配文只有三个英文词——“One shotted this video”——并附上了这段短片作为附件。没有重试,没有分镜,没有剪辑师。如果这就是 Claude 系列里最便宜的模型现在的表现,那么这个档位就不再是将就之选。
那是这场发布中有意思的一半。另一半是算术,而真正的新闻恰恰就在这里:Claude Haiku 5.5在提示不超过 100,000 个 token 时,每百万输入 token 收费 $0.10、每百万输出 token 收费 $0.50,而Claude Haiku 4.5则是统一的 $1 和 $5。Anthropic 自己的脚注称,在常见情况下这降低了 90%——紧接着又说,买家真正该用来做规划的数值更接近 75%。两个数字都没错,而它们之间的差距,才是这次发布中最重要的事。
Anthropic 在10月7日公开发表了什么
厂商的发布公告与其定价文档对这一定位的描述是一致的,而这一步的跨度,比通常伴随降价而来的变化要大。

• 价格 — 对于不超过 100,000 个 token 的提示词,每百万输入 token 为 $0.10,每百万输出 token 为 $0.50。超过该阈值后,同一请求的输入和输出分别按 $0.50 和 $2.50 计费。缓存读取每百万 token 费用为 $0.01(最高 100K),超过后为 $0.05;缓存写入为 $0.125 和 $0.625。
• 上下文 — 100 万 tokens,最大输出 128,000 tokens。这与 Claude Fable 5.1、Claude Opus 5.5 和 Claude Sonnet 5.5 所具备的窗口和输出上限完全相同,并在最便宜的档位上得以实现。
• 思考 — 使用 effort 参数进行自适应思考,默认为 medium。Anthropic 表示,这是首个具有可调节 effort 设置的 Haiku 级模型,这意味着同一个模型 ID 既可以低成本运行,也可以谨慎运行,而无需更改其他任何内容。
• 分词器——与 Claude 4.7 及更高版本共享的较新分词器,其“对相同文本,生成的 token 大约多 30%”。Anthropic 的文档表示,确切的增幅取决于内容和工作负载形态。
• 生命周期 —— 知识截止日期为 2026 年 6 月,以及“不早于 2027 年 10 月 7 日”的退役承诺。
• 可用性 — Claude API、Amazon Web Services、Google Cloud、Microsoft Azure,以及 AWS 上的 Claude Platform,第一天便全部同时可用。
10x 标签与 75% 的现实
“便宜十倍”这个数字会传播得最远,也最有可能在某个人的预算模型里出现在错误的位置。它适用于最多 100,000 个 token 的提示。Haiku 5.5 并非在整个窗口内都保持这一费率。
• 最多 100,000 个 token —— 输入 $0.10、输出 $0.50,相比之下 Haiku 4.5 为 $1 和 $5。这就是 90% 的降幅,Anthropic 称,对上一代 Haiku 模型的请求中有 90% 都落在这个区间内。
超过 100,000 个 token —— 输入 $0.50,输出 $2.50。在同一请求上,仍然恰好是 Haiku 4.5 收费的一半,且没有会撞上的上限。
• 分词器——同样的文本,其 token 数量比在 Haiku 4.5 上大约多出 30%,因此每个 token 的降价并不会一比一地转化为更低的账单。
• 供应商自己给出的平均值——Anthropic 将这一组合表述为“运行成本降低约 75%”。这是它自己给出的数字,而非独立测量所得,而做预测时应当采用的正是这个数字。
• 缓存经济性 — 在常见档位中,缓存读取价格从每百万 $0.10 降至 $0.01,对于任何会重复发送长共享前缀的流水线而言,这一点比输入单价更重要。
75% 这个数字还解释了另一件事,而读者原本可能会把它读成一处矛盾。这两个位于标题中的数字并不冲突:一个是针对某种请求形态的比率,另一个则是在真实流量组合上得出的混合估算,而这个组合既包含那超过 100K 的少数情况,也包含分词器额外产生的 token。如果你要为花费建模,就用 75%,并先核对你自己的 prompt 长度分布,然后再去相信更乐观的数字。
视频声称了什么,以及没有声称什么
这段视频是真实的,提示词就是上方逐字引用的那段,而那个时间戳——10月7日19:49 UTC,大致就是该模型上线当天——是可以核查的。这一归因指向的是一位个人用户,而非Anthropic。
这一区分在这里很重要,因为 Anthropic 自家的 Claude Haiku 5.5 产品页完全没有嵌入视频:没有播放器,没有媒体文件,只有一个指向该公司 YouTube 频道的链接。如果发布影片是用该模型制作的,厂商并未说明。所以准确的说法范围很窄:一名用户称用 Claude Haiku 5.5 一次性生成了发布视频,并公布了提示词。它是否为一次性生成、花费多少、有多少内容在剪辑后保留下来,都只是来自单一信源的说法。把这个片段当作演示,而不是基准测试。
之所以仍然值得一提,是因为视频生成并不在该模型的规格说明之中。Haiku 5.5 接收文本和图像,返回文本。如此质量的动态设计成果意味着,模型所驱动的是别的东西——一条代码生成路径、一条渲染管线、一个工具循环——而不是自己生成画面。这说的是在每百万输入 0.10 美元的价格下进行的智能体编排,而这才是真正令人惊讶的地方。
Anthropic 发布的数字
供应商的发布表格是与 Haiku 4.5 的前后对比,GPT-6 Luna 和 Claude Sonnet 5.5 也被放在同一列中以供参照。下文的每一个数字都是 Anthropic 自行报告的评估结果,在 Anthropic 的测试框架上运行,此处仅作转述,未经独立验证。

• 知识工作——GDPval-AA v2.1 得 1620 分,对比 Haiku 4.5 的 735 分、GPT-6 Luna 的 1437 分和 Sonnet 5.5 的 1840 分。AA-Briefcase v1.1 得 1578 分,对比 614、1336 和 1824。
• 计算机使用 — 在离线子集上,OSWorld 2.1 达到 72.4%,相比之下 Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%,Sonnet 5.5 为 83.9%。
• 多学科推理——Humanity's Last Exam 在无工具情况下达到45.9%,有工具情况下达到57.4%,而Haiku 4.5分别为10.2%和18.7%。
• 智能体编码 — Terminal-Bench 4.0 为 39.2%,对比 0.0%、16.4% 和 70.6%。FrontierCode 1.1 (Main) 为 46.4%,对比 GPT-6 Luna 的 42.4% 和 Sonnet 5.5 的 52.1%。
• 视觉推理——无工具条件下 Chartography 为 46.4%,相比之下分别为 6.4%、29.1% 和 61.6%。
Anthropic 对于小模型层级在哪些方面无法取胜,态度也异常直白。它自己对 Terminal-Bench 图表的评论指出,Sonnet 5.5 和 Opus 5.5“仍是复杂智能体编程任务的更优选择”,并把 Haiku 5.5 定位为负责压缩、摘要和子智能体工作。博文中的客户引述指向同一方向,也带有同样的限定——这些都是早期访问合作伙伴在描述自家的评估,而非审计:Asana 报告任务完成的延迟降低超过 30%,每个智能体轮次的推理速度最高提升 2.5 倍;HubSpot 报告在某个 CRM 门户套件上三次运行平均达到 92.8%;AlphaSense 报告在每周约 800 万次调用的工作负载上,400 条查询中取得 0.84 对 0.76 的成绩;Box 报告比 Haiku 4.5 高 11 分,延迟约为其一半;Rogo 描述了一个 Haiku 5.5 子智能体从 10-K 中提取分部收入行的过程;Cognition 报告称,以 Haiku 5.5 作为助手的 Devin Fusion 在 FrontierCode 上取得 66.2 的分数。
独立董事会怎么说
厂商的榜单是厂商自己的。对于任何要判断该层级是否已变动到足以改变生产流水线的人来说,首个外部排名才是更有用的数字。

Artificial Analysis 在 Intelligence Index v4.3.2 上给 Claude Haiku 5.5 的 Max 配置打出 43 分,在该榜单的 182 个模型中排名第二,远高于榜单中位数 13。同一页面还测得每秒 242 个输出 token——在 182 个模型中排名第九——以及每项 Intelligence Index 任务 0.21 美元的成本。
那个页面上有两件事比标题更值得关注。首先是冗长:在评估 Index 时,Artificial Analysis 记录了 4.4 亿个 token,而中位数为 1 亿个,并将该模型描述为“非常冗长”。标价是按 token 收费的,所以一个会长时间思考的模型要为此买单——这正是为什么每任务成本数字是 0.21 美元,而不是接近零,也是为什么输入削减 90% 并非全部真相。其次是努力程度阶梯:同一个页面展示了从 Max 到 Low 的配置,而 Anthropic 的默认值是 medium,而不是 max。榜单上的 43 分是那个阶梯的最高端,而不是你什么都不做时得到的设置。
运行比你已能调用的层级低一级的层级
Claude Haiku 5.5 不在 OrcaRouter 目录中,而这一点值得直说,而不是暗示相反:一个模型从存在到可被路由之间的发布日空档通常为几天,有时更长。
目前 Anthropic 目录上提供的是 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5,均按提供商的标价以 0% 加价透传,因此 Anthropic 的任何降价当天就会同时落到我们这边。对于现在就想测试子代理模式的人来说,这就是实用的桥梁:一种将例行轮次发送给 Haiku 4.5、将困难轮次向上升级的级联方式如今就能用,只需一个 SDK、一个密钥,而以后把小模型那一环换成 Haiku 5.5 只是改一下模型 ID,而不是迁移。自动故障转移位于你所选的任一环节之下,因此单个提供商的一个糟糕下午不会拖垮整条管道。
如果您根本不想等待,相同的 $0.10 输入价格区间已经由 GPT-6 Luna 占据,我们确实会路由它,并且它将该费率维持至 272,000 个 token 后才升档。
谁应该移动,谁不应该移动
如果你的工作负载是大批量分类、提取、路由、压缩或摘要,并且你的提示词低于 100,000 个词元,那么情况很简单:费率是原来的十分之一,窗口宽了五倍,而 effort 旋钮让你在某个请求需要时可以反向权衡。按大约降低 75% 来做预算,你就不会感到意外。
如果你的提示词经常超过 100,000 个 token,那你买到的是 50% 的折扣,而不是 90% 的折扣;而且,深度上下文比价仍然值得花一个下午——这一领域有多个模型的价格处于或低于该档位超过 100K 的费率。
如果你的评测在 Terminal-Bench 形态的工作上依然通不过,那么能修复它的并不是这个模型;Anthropic 自己也这么说,而 39.2% 对 Sonnet 5.5 的 70.6%,是这篇文章中最干净利落的证据。对 10 月 7 日最诚实的总结是:有用智能的地板大幅下沉,而天花板纹丝未动。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
