一张主视觉卡片,标题为“在 0.32828 打成平手”,数字两侧分别是 Claude Haiku 5.5 和 GLM 5.3 Flash;一行显示 Terminal Bench 4.0 0.32828,一行指数显示 43.40 对 41.81,副标题为“相同数字,不同机器”。
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash:在两家厂商都引用的基准测试中势均力敌

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

让 Claude Haiku 5.5 和 GLM 5.3 Flash跑 Terminal Bench 4.0,你会得到同一个数字:两者都是 0.32828。不是接近——而是完全相同,精确到小数点后五位,在这项该厂商在自己发布材料中主推、Z.ai 的发布材料也同样主推的基准测试上。对于两个建立在完全不同技术栈上、由不同国家的厂商相隔六周发布的模型来说,这种巧合值得停下来想想。

这也是一个不该拿来作决策的数字。这两个模型在其他所有维度上都泾渭分明,而这种分化的模式非同寻常,足以改变你解读任一厂商高调宣称的方式。其中一个赢下了综合指数和每任务成本数据。另一个则几乎赢下了一切看起来像实际部署的方面。

它们不是按能力区分的。它们是按形状区分的。

从那个表明“这些属于同一类模型”的数字开始。

• SciCode——Claude Haiku 5.5 为 0.5498,GLM 5.3 Flash 为 0.5162。Anthropic 得两分,而在一个两分不过是噪声的基准上。

• Terminal Bench 4.0 — 0.32828 对 0.32828。平局,分毫不差。

• 上下文窗口 — 两者均为 100 万 token。

• 输出价格,第一档 — 两者均为每百万 token $0.50。

四行,四个近乎匹配。如果你停在这里,你会得出这些模型可以互换、应按价格挑选的结论。那个结论会是错的,而下一组行正是原因所在。

在它们出现分歧的地方,方向是一致的。

那些确实能将它们区分开的行并非零散分布。它们聚成两组,而每个模型都完全独占其中一组。

该智能体组属于 GLM 5.3 Flash。在 AutomationBench 上,GLM 5.3 Flash 的部分得分读数为 0.6037,而 Claude Haiku 5.5 为 0.3541——相差 25 个百分点,这是这两个模型在任意共同测评项上最大的单项差异。在 Tau-Bench Banking 上,GLM 5.3 Flash 的读数为 0.4722;Claude Haiku 5.5 在该项没有已公布的数值。GPQA 上 GLM 5.3 Flash 的读数为 0.9121;同样没有 Anthropic 的数值可供比较。在衡量一个模型能否将多步骤任务连贯地维持下去、并在结构化领域内可靠地使用工具的指标上,Z.ai 的模型所领先的幅度,远超综合指数上方向相反的那点差距。

综合与成本这一组属于 Claude Haiku 5.5。Artificial Analysis Intelligence Index v4.3.2 的读数为 43.40 对 41.81——相差 1.59 分,这也是每一份关于这场对比的总结都会引用的数字。每完成一个 Index 任务的成本为 0.21 美元对 0.25 美元。每个 Index 任务的挂钟时间为 424.6 秒对 1,035.4 秒:Anthropic 的模型用时不到一半。

这就是这个选择的格局。Claude Haiku 5.5 更快、每完成一项任务成本更低,综合表现也更高。GLM 5.3 Flash 在人们购买廉价模型时所针对的那一类具体工作上更可靠。

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

该相信哪一个?

单独来看,两者都不成立——而分歧本身就是信息。

智能指数是对推理、科学、编程和智能体类别的加权综合。它的设计目的是用一个单一数字回答“这个模型大致有多强”,而它确实做到了这一点。它做不到的是告诉你,1.59 分的领先优势究竟来自你的工作负载所涉及的类别,还是来自它从不触及的类别。在这里,这一领先优势在很大程度上来自 SciCode 和 Humanity's Last Exam 这类行——0.5498 对 0.5162,以及 0.4439 对 0.3985——而 25 分的劣势则落在 AutomationBench 上,且符号相反。

在终端循环中构建编程助手的团队会注意到 SciCode 的优势。构建一个必须端到端完成银行工作流的智能体的团队会注意到 AutomationBench 的差距,而且每天都会注意到它。这两个团队看着同一个指数,却应该得出相反的结论。

实际做法是把综合评分当作筛选器,而不是排名。如果两个模型相差约两个指数点以内,综合评分只说明它们处在同一档,并没有告诉你该选哪一个。到那时,唯一值得看的就是与你工作负载匹配的那些行——如果某家供应商没有公布你需要的那一行,那么这一缺失本身就是一条数据点,而不是一个可以用假设来填补的空白。

没人会写进对比表的那行:分词器

Anthropic 自己的文档中有一句话,会改变所有涉及 Claude Haiku 5.5 的价格比较,而且很容易被略过。该模型使用与 Claude 4.7 及更高版本共享的较新分词器,对相同文本,它统计出的 token 数比它所取代的模型多约 30%。

把这一点与价目表对照来看,算下来的账就没有标价所暗示的那么漂亮了。Claude Haiku 5.5 的输入费率为每百万 token 0.10 美元,而 GLM 5.3 Flash 为 0.15 美元——前者有 1.5 倍的优势。如果同一提示词要多消耗 30% 的 token,那么在相同文本上的实际优势会明显收窄,尽管并未消失。第一档的输出费率同为 0.50 美元,因此分词器效应在那里会直接体现,没有任何因素将其抵消。

实测结果才是这一说法诚实的版本:按照 Artificial Analysis 自己的核算,Claude Haiku 5.5 每个 Index 任务生成 162,164 个输出 token,而 GLM 5.3 Flash 为 68,673 个——是后者的 2.4 倍——但每个已完成任务的成本仍为 0.21 美元,而后者为 0.25 美元。费率优势在冗长之下依然成立,而它剩下的部分比价目表上说的要小。

这两者中只有一个的费率被标为统一固定。Claude Haiku 5.5 的价格在提示词超过 100,000 token 后会上涨至输入 $0.50、输出 $2.50;而 GLM 5.3 Flash 并未公布相当的阈值。对于大多数聊天和代码辅助类流量而言,这一阶梯永远不会触发。但对于长文档或大上下文的智能体任务,它却会持续触发,而到了那个时候,两者的对比会发生反转,其差距远超第一档数字所显示的程度。

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

在任何数据说话之前就一锤定音的那句话

以上一切都假定你能够在这两个模型之间自由选择。很大一部分团队做不到这一点,原因就在于规格表中的某一项——基准测试的讨论往往会把这一项埋没。

GLM 5.3 Flash 采用开放权重,以 MIT 许可证发布,总参数 3200 亿,活跃参数 180 亿。它可以被下载、自托管、微调、量化、固定到某个版本,并运行在你掌控的租户环境内。Claude Haiku 5.5 是专有模型,仅提供 API,未公布参数规模,没有许可证,也没有代码仓库。

如果你的需求文档写明,模型必须运行在你们自己的硬件上,或者某个特定检查点必须在未来三年内保持可调用,那么在读到价格栏之前,这场比较就已经结束了。这不是什么技术细节。这正是团队最终会选择开放权重中端模型的最常见原因,也正是为什么 AutomationBench 上 25 个百分点的优势并不是唯一把方向拉向 Z.ai 的因素。

反过来也一样,同样需要这份坦诚。Anthropic 为 Claude Haiku 5.5 公布了不早于 2027 年 10 月的退役承诺,并通过第一方 API 提供该模型,附带系统卡和一套有文档记录的评估集。开放权重的发布并不会自动更持久——你在拿到权重的同时也继承了运维负担,而许可证文件并不是支持合同。你想要这两者中的哪一个,取决于你的团队,而不是取决于模型。

双方同用一个按键,如果你想用实证方式一决高下的话

GLM 5.3 Flash 已收录在 OrcaRouter 目录中,按 Z.ai 的标价提供,加价为 0%,是直接透传而非混合计价,因此上方的费率就是账单上的费率,Z.ai 做出的任何调整都会在同一天落到我们这边。Claude Haiku 5.5 不在我们的目录中——它可通过 Anthropic 自家的 API 访问——与其让它隐而不宣,不如明确说明这一点。

目录真正让事情变简单的,是这场对决实际所需的测试形态。综合指数与智能体条目之间的分歧,是一个关于你工作负载的假设,而要解决它,唯一的办法就是让两个模型跑在同一份 trace 上。当路由上是 GLM 5.3 Flash、同一网关另一侧接的是 Anthropic 时,这就变成改一次配置,而不是做两套集成——一个 API 覆盖 200 多个模型,一个密钥, 自动故障转移在底下兜底,想按任务类别切分流量、从一张账单上读出成本时,还有路由 DSL 可用。

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

结论,以数据所能支撑的方式陈述

如果你的工作是文本输入、文本输出,你的提示词停留在第一档定价内,并且你是按 token 为真实用量付费,那么 Claude Haiku 5.5 在这里是更好的模型:综合得分更高,每个已完成任务的成本更低,而且每个任务的速度快一倍以上。终端基准测试的头条数字不分胜负,不应被用来决定任何事情。

如果你的工作是一个必须在无人监督下完成多步骤工作流的智能体,那么 GLM 5.3 Flash 在唯一一个恰好衡量这一点的共享基准测试上领先 25 分,而且由于你可以持有权重,它是两者中修改成本更低的那一个。

0.32828 处的并列正是这对模型的合适写照,但并不是因为这两个模型相等。它是唯一一行:两个几乎再无其他共同点的模型恰好落在同一个数字上——而把这个数字当作比较的总结,正是采购决策会基于表中最不具信息量的数字作出的原因。