
Claude Haiku 5.5 vs GLM 5.3 Flash:在两家厂商都引用的基准测试中势均力敌
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
让 Claude Haiku 5.5 和 GLM 5.3 Flash跑 Terminal Bench 4.0,你会得到同一个数字:两者都是 0.32828。不是接近——而是完全相同,精确到小数点后五位,在这项该厂商在自己发布材料中主推、Z.ai 的发布材料也同样主推的基准测试上。对于两个建立在完全不同技术栈上、由不同国家的厂商相隔六周发布的模型来说,这种巧合值得停下来想想。
这也是一个不该拿来作决策的数字。这两个模型在其他所有维度上都泾渭分明,而这种分化的模式非同寻常,足以改变你解读任一厂商高调宣称的方式。其中一个赢下了综合指数和每任务成本数据。另一个则几乎赢下了一切看起来像实际部署的方面。
它们不是按能力区分的。它们是按形状区分的。
从那个表明“这些属于同一类模型”的数字开始。
• SciCode——Claude Haiku 5.5 为 0.5498,GLM 5.3 Flash 为 0.5162。Anthropic 得两分,而在一个两分不过是噪声的基准上。
• Terminal Bench 4.0 — 0.32828 对 0.32828。平局,分毫不差。
• 上下文窗口 — 两者均为 100 万 token。
• 输出价格,第一档 — 两者均为每百万 token $0.50。
四行,四个近乎匹配。如果你停在这里,你会得出这些模型可以互换、应按价格挑选的结论。那个结论会是错的,而下一组行正是原因所在。
在它们出现分歧的地方,方向是一致的。
那些确实能将它们区分开的行并非零散分布。它们聚成两组,而每个模型都完全独占其中一组。
该智能体组属于 GLM 5.3 Flash。在 AutomationBench 上,GLM 5.3 Flash 的部分得分读数为 0.6037,而 Claude Haiku 5.5 为 0.3541——相差 25 个百分点,这是这两个模型在任意共同测评项上最大的单项差异。在 Tau-Bench Banking 上,GLM 5.3 Flash 的读数为 0.4722;Claude Haiku 5.5 在该项没有已公布的数值。GPQA 上 GLM 5.3 Flash 的读数为 0.9121;同样没有 Anthropic 的数值可供比较。在衡量一个模型能否将多步骤任务连贯地维持下去、并在结构化领域内可靠地使用工具的指标上,Z.ai 的模型所领先的幅度,远超综合指数上方向相反的那点差距。
综合与成本这一组属于 Claude Haiku 5.5。Artificial Analysis Intelligence Index v4.3.2 的读数为 43.40 对 41.81——相差 1.59 分,这也是每一份关于这场对比的总结都会引用的数字。每完成一个 Index 任务的成本为 0.21 美元对 0.25 美元。每个 Index 任务的挂钟时间为 424.6 秒对 1,035.4 秒:Anthropic 的模型用时不到一半。
这就是这个选择的格局。Claude Haiku 5.5 更快、每完成一项任务成本更低,综合表现也更高。GLM 5.3 Flash 在人们购买廉价模型时所针对的那一类具体工作上更可靠。

该相信哪一个?
单独来看,两者都不成立——而分歧本身就是信息。
智能指数是对推理、科学、编程和智能体类别的加权综合。它的设计目的是用一个单一数字回答“这个模型大致有多强”,而它确实做到了这一点。它做不到的是告诉你,1.59 分的领先优势究竟来自你的工作负载所涉及的类别,还是来自它从不触及的类别。在这里,这一领先优势在很大程度上来自 SciCode 和 Humanity's Last Exam 这类行——0.5498 对 0.5162,以及 0.4439 对 0.3985——而 25 分的劣势则落在 AutomationBench 上,且符号相反。
在终端循环中构建编程助手的团队会注意到 SciCode 的优势。构建一个必须端到端完成银行工作流的智能体的团队会注意到 AutomationBench 的差距,而且每天都会注意到它。这两个团队看着同一个指数,却应该得出相反的结论。
实际做法是把综合评分当作筛选器,而不是排名。如果两个模型相差约两个指数点以内,综合评分只说明它们处在同一档,并没有告诉你该选哪一个。到那时,唯一值得看的就是与你工作负载匹配的那些行——如果某家供应商没有公布你需要的那一行,那么这一缺失本身就是一条数据点,而不是一个可以用假设来填补的空白。
没人会写进对比表的那行:分词器
Anthropic 自己的文档中有一句话,会改变所有涉及 Claude Haiku 5.5 的价格比较,而且很容易被略过。该模型使用与 Claude 4.7 及更高版本共享的较新分词器,对相同文本,它统计出的 token 数比它所取代的模型多约 30%。
把这一点与价目表对照来看,算下来的账就没有标价所暗示的那么漂亮了。Claude Haiku 5.5 的输入费率为每百万 token 0.10 美元,而 GLM 5.3 Flash 为 0.15 美元——前者有 1.5 倍的优势。如果同一提示词要多消耗 30% 的 token,那么在相同文本上的实际优势会明显收窄,尽管并未消失。第一档的输出费率同为 0.50 美元,因此分词器效应在那里会直接体现,没有任何因素将其抵消。
实测结果才是这一说法诚实的版本:按照 Artificial Analysis 自己的核算,Claude Haiku 5.5 每个 Index 任务生成 162,164 个输出 token,而 GLM 5.3 Flash 为 68,673 个——是后者的 2.4 倍——但每个已完成任务的成本仍为 0.21 美元,而后者为 0.25 美元。费率优势在冗长之下依然成立,而它剩下的部分比价目表上说的要小。
这两者中只有一个的费率被标为统一固定。Claude Haiku 5.5 的价格在提示词超过 100,000 token 后会上涨至输入 $0.50、输出 $2.50;而 GLM 5.3 Flash 并未公布相当的阈值。对于大多数聊天和代码辅助类流量而言,这一阶梯永远不会触发。但对于长文档或大上下文的智能体任务,它却会持续触发,而到了那个时候,两者的对比会发生反转,其差距远超第一档数字所显示的程度。

在任何数据说话之前就一锤定音的那句话
以上一切都假定你能够在这两个模型之间自由选择。很大一部分团队做不到这一点,原因就在于规格表中的某一项——基准测试的讨论往往会把这一项埋没。
GLM 5.3 Flash 采用开放权重,以 MIT 许可证发布,总参数 3200 亿,活跃参数 180 亿。它可以被下载、自托管、微调、量化、固定到某个版本,并运行在你掌控的租户环境内。Claude Haiku 5.5 是专有模型,仅提供 API,未公布参数规模,没有许可证,也没有代码仓库。
如果你的需求文档写明,模型必须运行在你们自己的硬件上,或者某个特定检查点必须在未来三年内保持可调用,那么在读到价格栏之前,这场比较就已经结束了。这不是什么技术细节。这正是团队最终会选择开放权重中端模型的最常见原因,也正是为什么 AutomationBench 上 25 个百分点的优势并不是唯一把方向拉向 Z.ai 的因素。
反过来也一样,同样需要这份坦诚。Anthropic 为 Claude Haiku 5.5 公布了不早于 2027 年 10 月的退役承诺,并通过第一方 API 提供该模型,附带系统卡和一套有文档记录的评估集。开放权重的发布并不会自动更持久——你在拿到权重的同时也继承了运维负担,而许可证文件并不是支持合同。你想要这两者中的哪一个,取决于你的团队,而不是取决于模型。
双方同用一个按键,如果你想用实证方式一决高下的话
GLM 5.3 Flash 已收录在 OrcaRouter 目录中,按 Z.ai 的标价提供,加价为 0%,是直接透传而非混合计价,因此上方的费率就是账单上的费率,Z.ai 做出的任何调整都会在同一天落到我们这边。Claude Haiku 5.5 不在我们的目录中——它可通过 Anthropic 自家的 API 访问——与其让它隐而不宣,不如明确说明这一点。
目录真正让事情变简单的,是这场对决实际所需的测试形态。综合指数与智能体条目之间的分歧,是一个关于你工作负载的假设,而要解决它,唯一的办法就是让两个模型跑在同一份 trace 上。当路由上是 GLM 5.3 Flash、同一网关另一侧接的是 Anthropic 时,这就变成改一次配置,而不是做两套集成——一个 API 覆盖 200 多个模型,一个密钥, 自动故障转移在底下兜底,想按任务类别切分流量、从一张账单上读出成本时,还有路由 DSL 可用。

结论,以数据所能支撑的方式陈述
如果你的工作是文本输入、文本输出,你的提示词停留在第一档定价内,并且你是按 token 为真实用量付费,那么 Claude Haiku 5.5 在这里是更好的模型:综合得分更高,每个已完成任务的成本更低,而且每个任务的速度快一倍以上。终端基准测试的头条数字不分胜负,不应被用来决定任何事情。
如果你的工作是一个必须在无人监督下完成多步骤工作流的智能体,那么 GLM 5.3 Flash 在唯一一个恰好衡量这一点的共享基准测试上领先 25 分,而且由于你可以持有权重,它是两者中修改成本更低的那一个。
0.32828 处的并列正是这对模型的合适写照,但并不是因为这两个模型相等。它是唯一一行:两个几乎再无其他共同点的模型恰好落在同一个数字上——而把这个数字当作比较的总结,正是采购决策会基于表中最不具信息量的数字作出的原因。
