
Claude Haiku 5.5 瞄准的是中国的 Flash 梯队。这一说法经不起细究,只有一半站得住脚。
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
一位用中文写作的读者本周提出了一个尖锐的论点:Claude Haiku 5.5似乎旨在夺取中国中端市场,因为它压低了DeepSeek V4.1 Flash和GLM 5.3 Flash的价格,并且在 Terminal Bench 4.0 和 Artificial Analysis Intelligence Index 上得分高于 GLM 5.3 Flash。这比大多数发布评论更敏锐。这也是两个主张披着一件外衣,它们并不具有同等程度的真实性。
Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5——一次完整的公开发布,配有注明日期的公告、一份系统卡以及一份公开的价目表。这让该说法拥有了二手市场评论鲜少能得到的东西:可以核对的数字。
下面这份审查发现,其中一半比读者所说的更为有力,另一半则在它所引用的那个具体基准上是错的。这两项发现都值得了解,因为它们指向的是相反的方向。
该命题,精确表述如下
剥去一切枝节,这一论点由三个部分组成。
• 价格 — Claude Haiku 5.5 比 DeepSeek V4.1 Flash 更便宜,也比 GLM 5.3 Flash 更便宜。
• 独立评分——它在 Artificial Analysis 智能指数上比 GLM 5.3 Flash 高出约一分。
• 编程基准测试 —— 它在 Terminal Bench 4.0 上的得分也比 GLM 5.3 Flash 高出一分。
其中两项可以对照已公布的表格进行核查,经调整后依然站得住脚。第三项可以对照同一张表格核查,但得出的结果与所述不同。

价格那一半:是真的,而且在一个方向上被低估,在另一个方向上被高估
Anthropic 公布的 Claude Haiku 5.5 费率为:每百万输入 token 0.10 美元,每百万输出 token 0.50 美元(适用于不超过 100,000 token 的提示);超过该阈值后,分别升至 0.50 美元和 2.50 美元。缓存输入读取费用为 0.01 美元,写入费用为 0.125 美元。上下文窗口为一百万 token;最大输出为 128,000。
来自 Z.ai 的 GLM 5.3 Flash 标价为 $0.15 和 $0.50,缓存输入为 $0.026。DeepSeek V4.1 Flash 标价为 $0.30 和 $1.20,缓存输入为 $0.006。
就标价而言,读者说得没错。0.10 美元的输入价格比 GLM 5.3 Flash 低了三分之一,比 DeepSeek V4.1 Flash 低了三分之二;而 0.50 美元的输出价格与 GLM 5.3 Flash 完全持平,却远不到 DeepSeek 的一半。这看起来像是一次刻意设计的落点:输出与更便宜的那个对手打平,输入上压过它,然后让这个比值自己说话。
对这项主张更有利的地方在于每完成一项任务的实测成本。在 Artificial Analysis 的 Intelligence Index v4.3.2 上,完成整项任务的成本为:Claude Haiku 5.5 是 0.21 美元,GLM 5.3 Flash 是 0.25 美元,DeepSeek V4.1 Flash 是 0.27 美元。价目表显示,Claude Haiku 5.5 在输入价格上比 GLM 5.3 Flash 便宜 1.5 倍;而实测显示,完成同一任务约便宜六分之一。它仍是三者中最便宜的那个——只是没有标价所暗示的那么大差距。
原因正是大多数价格比较都略去的那一点。Claude Haiku 5.5 很啰嗦。Artificial Analysis 在运行 Index 时记录到它输出 162,164 个 token,而 GLM 5.3 Flash 为 68,673 个,DeepSeek V4.1 Flash 为 88,574 个。Anthropic 自己的文档还补充了第二个影响:该模型使用与 Claude 4.7 及后续版本共用的较新分词器,因此同一段文本所计的 token 数比它所取代的模型大约多 30%。更便宜的费率用在更多 token 上,就是更便宜的费率用在更多 token 上。
有一个细节只在按路由计费的账单上才会显现:我们自己的目录把 DeepSeek V4.1 Flash 列为输入 $0.15、输出 $0.60,并在每天两个时间段——UTC 01:00–04:00 和 06:00–10:00——应用 2 倍乘数。每天有十八个小时就是基础费率;每天有六个小时,输出费率是 $1.20。可以安排避开这些时间段的批处理流量,能拿到比供应商标称列表价所暗示的明显更优的 DeepSeek 价格,而交互式流量则不能。如果你要真实地模拟这种对比,日历和费率表同样重要。

比分部分:“大约一分”是 1.6
在Artificial Analysis Intelligence Index v4.3.2上,Claude Haiku 5.5在Max配置下测得43.40。GLM 5.3 Flash测得41.81。DeepSeek V4.1 Flash为39.46。
所以,这一说法中关于指数的部分在方向上是对的,而且会向下取整:差距是 1.59 分,而不是 1 分。在一个会跑到六十多的指数上,这是实实在在的领先,而且这个数字在每一份关于这场对决的总结里都会被引用。
它并非关于底层基准测试的断言。两家厂商都发布各自的评估集,而这些评估集并不相同——Anthropic 为 Claude Haiku 5.5 报告的是 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 和 FrontierCode;Z.ai 为 GLM 5.3 Flash 报告的是其自己的套件。独立榜单是唯一可用的同类比较行,这正是指数差距被如此大力倚重的原因,也是下一节之所以重要的原因。
编程那一半:这一项是彻底的平局,不是胜利。
Terminal Bench 4.0 在共享独立测量中,对 Claude Haiku 5.5 的读数为 0.32828,对 GLM 5.3 Flash 的读数也是 0.32828。精确到小数点后五位完全相同。
这是这场对比中最值得引用的一个数字,而相关说法对它并不正确。造成混淆的可能来源是相邻的那一行:非 Flash 版本的完整 GLM-5.3 在同一基准测试中得分为 0.4192。如果你曾看到“GLM”和“Terminal Bench”出现在同一句话里,旁边是一个比 Claude Haiku 5.5 高出一个点的数字,那就是这个同门版本,而不是 Flash。
Artificial Analysis 为这两个模型发布的另外三行,比这一平局更有意思,而且它们并不指向同一个方向:
• SciCode — Claude Haiku 5.5 为 0.5498,而 GLM 5.3 Flash 为 0.5162。Anthropic 领先 3.4 个百分点。
• Humanity's Last Exam — 0.4439 对 0.3985。Anthropic 领先 4.5 个百分点。
• AutomationBench,部分得分——0.3541 对 0.6037。GLM 5.3 Flash 领先 25 个百分点,是这一组中迄今为止最大的差距。
最后一行是采购团队最关心的,因为中端模型的实际部署场景正是智能体自动化。在衡量模型能否将多步骤任务执行到底的指标上,运行成本更低的开放权重模型以明显优势胜出,这一差距远大于反方向上那1.6个百分点的指数差异。
速度的分野与价格如出一辙,只是更为悬殊。Artificial Analysis 测得,每项 Index 任务在 Claude Haiku 5.5 上耗时 424.6 秒,而 GLM 5.3 Flash 需要 1035.4 秒。Anthropic 的模型实际耗时不到后者的一半,而在智能体循环中,这一运营数字比 token 速率更有分量。
该说法完全省略的内容
这一比较被框定为一段价格与分数的叙事,悄然略过了两个模型最不相似的那个维度。GLM 5.3 Flash 是开放权重,以 MIT 许可证发布,总参数 3200 亿,激活参数 180 亿。DeepSeek V4.1 Flash 同样是开放权重,总参数 5520 亿,激活参数 160 亿。Claude Haiku 5.5 则是专有模型,仅通过 API 提供,既未公布参数数量,也没有代码仓库。
对许多买家来说,这不是脚注;这是需求文档的第一行。一个需要在自己的租户环境中运行推理、进行微调,或让某个模型版本多年保持不变的团队,根本不是在按指标分数在这三者之间做选择——还没看到价格那一栏,三者中就已经有两个出局了。读者的框架是一种市场定位观察,而且说得有道理;只不过,这种结构性差异恰好与该框架所维护的模式相悖。
自行运行比较
GLM 5.3 Flash 和 DeepSeek V4.1 Flash 均已上架 OrcaRouter 目录,按供应商标价提供,加价 0%,这让本次对比中的中国一侧成为你今天就能实际调用的对象,而不必在电子表格里做建模。由于费率是直接透传而非混合计算的,供应商一旦调价,当天就会同样落到我们这边——而上文所述的基于日历的 DeepSeek 窗口,就显示在你将要据以路由的同一个定价区块中。一把密钥、一个 SDK,自动故障转移在底层支撑,还有路由 DSL——如果你更愿意在路由中而非应用代码里表达成本上限的话。
Claude Haiku 5.5 不在我们的目录中。它可以通过 Anthropic 自家的 API 访问,这一点与其含糊带过,不如直截了当地说明。

读者理解正确的地方,以及如何加以利用
这种直觉是对的。如果你想衬托得这波便宜、能力又不错的中国中端模型显得很贵,大致就会打出这张牌:把输出价格对齐更便宜的对手,把输入价格砍到它的一半,在指数上领先 1.6 个点,再让“每完成一项任务的价格”这个数字来支撑论点。Claude Haiku 5.5 正是这么做的,而且它每项任务的速度还比它所瞄准的模型快一倍以上。
读者弄错的地方更细微,也更有趣。Terminal Bench 4.0 算不上胜出,而是完全打平。价格优势——一旦按整个任务而不是按 token 来计费——大约是六分之一,而不是价目表所暗示的 1.5 倍。而两个模型差距最大的那个基准,正是智能体类基准:GLM 5.3 Flash 在其中领先 25 分。
所以,这个说法的诚实版本是这样的:Claude Haiku 5.5 瞄准的是中国 Flash 档位,它在综合指数、每完成一项任务的成本以及延迟上赢得了这一比较,但在智能体自动化或开放性上并没有赢,而那个让该论点显得具有决定性的具体编程基准优势并不存在。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
