一张为《Claude Haiku 5.5 vs GLM-5.3-FlashX —— 相同的权重,多付 2.5 倍》生成的标题卡,两个模型名称分列分隔线两侧,配文为「两款中价位模型,四张费率表,一个 100K 门槛」,页脚为「Anthropic 与 Z.ai 标价,2026 年 10 月」。真实的 OrcaRouter 标志合成于右下角。
Guides & Insights

Claude Haiku 5.5 与 GLM-5.3-FlashX:为相同的权重支付 2.5 倍价格,以及这是否值得

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在把 GLM-5.3-FlashX 与 Claude Haiku 5.5 作比较之前,最有用的一点认知是:它运行的权重与 GLM-5.3-Flash 完全相同,而调用成本却是后者的 2.5 倍。Z​.ai 于 2026 年 9 月 18 日在其自有 API 上推出了 FlashX,定价为每百万输入 token 0.37 美元、每百万输出 token 1.25 美元,而它衍生自的那款基础模型则是 0.15 美元和 0.50 美元。模型本身没有任何改变;改变的是它在哪里运行,以及在那里被承诺的运行为何有多快。理解这种配对关系正是这里的关键所在,因为它意味着这并非两个能力层级之间的比较——而是价格档位与服务档位之间的比较,而 Haiku 5.5 正从完全不同的方向切入,恰好落在这场争论的正中间。

两个模型,四种价格,一个阈值

把四张相关的费率卡并排摆出来,决策的轮廓会比任何单独一对都更清晰:

• Claude Haiku 5.5,低于 100,000 tokens 时——每百万 $0.10 输入、$0.50 输出(Anthropic 价目表)

• Claude Haiku 5.5,超过 100,000 个 token — 每百万输入 $0.50、输出 $2.50(Anthropic 定价)

• GLM-5.3-Flash — 每百万 $0.15 输入、$0.50 输出(Z​.ai 标价)

• GLM-5.3-FlashX — 每百万 $0.37 输入、$1.25 输出(Z.ai 标价)

• 上下文 — 四款均为 100 万 token(厂商公布)

• 开放权重——GLM-5.3-Flash 与 FlashX 继承基础模型的 MIT 许可权重;Claude Haiku 5.5 则为闭源(由厂商发布)

• 独立评分 — GLM-5.3-Flash 在 Artificial Analysis 智能指数上测得 41.807;Claude Haiku 5.5 测得 43.395(Artificial Analysis)

首先要注意的是,FlashX 的价格几乎正好落在 Claude Haiku 5.5 的长上下文档位上——输入 $0.37 对 $0.50,输出 $1.25 对 $2.50。这并不是市场的巧合;当底层模型是中等量级、供应商按吞吐量而非能力收费时,这就是高端服务档位所要付出的成本。第二点是,GLM-5.3-FlashX 是某个模型的昂贵版本,而 A​nthropic 的新 Haiku 在短上下文下比它更便宜,在长上下文下则与它相当。第三点是,这四个数字彼此都在五倍以内,这比大多数正面比较中“便宜模型对昂贵模型”的框架所暗示的区间要窄得多。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GLM-5.3-FlashX — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, input price (over 100K) $0.50 per million. Right column GLM-5.3-FlashX: input price $0.37 per million, output price $1.25 per million, and a serving-premium row. A footer labels the sources. The real OrcaRouter logo is composited bottom-right.

FlashX 实际上是什么

GLM-5.3-FlashX 并不是一款新模型。它是运行在 Z.ai 自有基础设施上的 GLM-5.3-Flash:官方宣称其峰值输出速度最高可达每秒 200 个 token,而基准模型的实测速率与之相比要低得多;其定价则是基准模型标价的 2.5 倍。Z.ai 的卖点很直白:答案完全相同,只是每秒能给出更多;你付钱买的是推理服务,而不是模型权重。对于受吞吐量制约的工作负载——批量分类、大规模抽取,以及任何瓶颈在于延迟而非成本的场景——这都是一件说得通、也值得买的产品。

它并非能力升级,定价也如实反映了这一点:如果 FlashX 是更好的模型,Z.ai 就无法为基础模型的权重单独收费。2.5 倍是服务溢价。它是否值得付费,取决于你的工作负载瓶颈,而对于延迟受限的流水线,答案与成本受限的流水线不同。

在撰写本文时,Artificial Analysis 还没有为 FlashX 设立单独的页面,这一点值得直说,而不是含糊带过:该榜单为 GLM-5.3-Flash 公布的独立数据——Intelligence Index 上 41.807、实测每秒 52.14 个输出 token、Terminal-Bench Hard 上 0.328——是基础模型的数据,而非以 2.5 倍速率提供服务的那一版本的数据。厂商自己对 FlashX 吞吐量的说法是峰值数字,且由厂商自行报告。没有任何独立第三方公布过 FlashX 本身的吞吐量,因此把 Haiku 5.5 的实测速度与 FlashX 相比,实际上是在与 Z​.ai 就自家服务给出的一个数字作比较。

Z.ai 的 2.5 倍乘数并不是让 FlashX 相对于其基础价格显得昂贵的唯一原因。由于基础权重采用 MIT 许可证并由第三方托管,一个确实需要比单一供应商端点所能提供的更高吞吐量的工作负载,往往可以通过以接近基础价格的价格分散到多个提供相同权重的供应商那里来获得,而不是支付某一家供应商的溢价层级。这是 FlashX 价目表正在与之竞争的真正替代方案,而 Z.ai 对此心知肚明——这大概就是为什么其宣传侧重于峰值吞吐量,而非独特性。

A screenshot of Z.ai's documentation pricing page, showing the API pricing table for the GLM model line with per-million input and output rates, captured in English.

Haiku 5.5 与 FlashX 分道扬镳之处

在决定真实工作负载的各个维度上让两者相互较量,分界就足够清晰,可以直接据此做出选择:

• 100K 上下文以内的价格 — Haiku 5.5 为 $0.10 / $0.50,FlashX 为 $0.37 / $1.25;Haiku 两项均胜出

• 超过 100K 上下文的价格——Haiku 5.5 $0.50 / $2.50,对比 FlashX $0.37 / $1.25;FlashX 两边都胜出

• 吞吐量 — FlashX 的厂商峰值 200 tok/s,而 Anthropic 公布的 Haiku 5.5 服务并未宣称此类峰值

• 独立指数——Haiku 5.5 43.395 对比 GLM-5.3-Flash 41.807(Artificial Analysis;FlashX 本身无独立数据)

• 权重 — FlashX 继承 MIT 许可的开放权重;Haiku 5.5 为闭源,仅提供 API

• 自托管 — FlashX 可借助开放权重实现;Haiku 5.5 则无法实现

• 工具/智能体功能集 — Haiku 5.5 上可调节的投入力度拨盘,G​LM Flash 系列则没有

有意思的是第二个单元格。在短请求上,Claude Haiku 5.5 是比 GLM-5.3-FlashX 便宜五倍的模型,而在长请求上则略贵于后者,因为 Haiku 的价格表在 100,000 个 token 处跳升 5 倍,而 FlashX 只收取单一固定费率。如果你的流量以短请求为主,那么单从价格来看,Haiku 显然是首选。如果以长请求为主,那么 FlashX 根本不是在和 Haiku 的短请求档价格竞争——它是在和 Haiku 的长请求档竞争,并且在这一比较中以大约三分之一的优势胜出。

能力对比比两家供应商愿意承认的还要接近。在同一个独立指数上,41.807 对 43.395,差距不到百分之四,完全落在大多数应用级评测的噪声范围内,也小到根本不足以单独作为选择依据。在通用推理上,两个模型都没有压倒对方;做出决定靠的是价目表和吞吐量,而不是谁更聪明。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', showing an Intelligence Index of 43.395 and speed rank #10 of 182, with the cost comparison block reading $0.10 input.

许可差异是实实在在的差异

FlashX 在起源上就是开放权重,这一点在某个维度上比价格差距更重要:它可以自托管,也可以由任何人来提供服务。Claude Haiku 5.5 这两样都做不到。对于一个有合规要求、推理必须跑在自己硬件上的团队,或者对于一个稳定用量足够大、摊销一块 GPU 比按 token 付费更划算的团队来说,这两者中只有 GLM 这条线真正回答了这个问题。对于其他人——也就是大多数只想用 API 背后的模型、不愿自己运行服务层的人——许可证只是脚注,价格才是论据。

这也意味着,当某个提供商遭遇不顺时,这两种模型会有不同的故障模式。一个闭源模型如果只由其供应商以及该供应商的云合作伙伴提供服务,那么当这些服务宕机时,它也会宕机。而一个由多个独立主机托管的开源模型,则可以在这些主机之间进行故障转移——前提是有某种机制来执行这种故障转移。这是一种实实在在的运维差异,而且这种事往往只有在真正关键的那一天才会显现出来。

无需第二份合约即可路由两者

如果上面的判断无法为你的流量收敛出唯一的赢家——通常也不会,因为这两个模型在价目表的不同区间上互有胜负——那么实际的问题就是:如何同时运行两者,而不必维护两套集成。OrcaRouter 按厂商标价提供 z-ai/glm-5.3-flash,每百万 token 为 $0.15 和 $0.50,同时还提供 qwen/qwen3.8-flash 以及 200 多个模型目录中的其余模型,只需一个密钥、一张账单。Anthropic 对 Claude Haiku 5.5 的价格调整,或 Z.ai 对 Flash 系列的价格调整,都会在当天以零加价传导过来,而不是滞后于转售商自己的费率表,因此上面的数字始终就是你实际支付的数字。

我们不提供 Claude Haiku 5.5,也不提供 GLM-5.3-FlashX —— 这两者都不在我们的目录里;如需它们,请直接联系 A​nthropic 和 Z​.ai。我们提供的是 GLM-5.3-Flash,也就是 FlashX 底层的基座模型;对于许多工作负载而言,它才是正确的选择——在这些场景中,2.5 倍的调用溢价换来的却是根本没人需要的吞吐量。当某条生产路径确实依赖我们并未托管的这两款模型中的任意一款时,故障转移就是我们用来试水而不把整条路径都押上去的机制:把请求指向它,同时保留一个可用的模型作为回退,然后让路由层决定由哪一个来应答。

该选哪一个

在每次请求低于 100,000 个 token 时,Claude Haiku 5.5 在价格上胜出,并且在能力上与 FlashX 足够接近,因此这个选择毫无悬念。超过 100,000 个 token 时,GLM-5.3-FlashX 比 Haiku 5.5 的长上下文档位更便宜;如果请求规模是任务本身的属性而非一种选择,那它就是应当选用的模型——不过基础版 GLM-5.3-Flash 还要更便宜,而唯一值得支付 2.5 倍价格的理由,是你特别需要 FlashX 所宣传的吞吐量。

应当摒弃的思维定式是:其中一个是经济型选择,另一个是性能型选择。它们都是中端价位的模型,费率表固定且公开透明,而真正值得关注的变量不是哪一个更好,而是你的流量中哪一半用哪一个更便宜。先拉出你的请求大小分布;上面的两列价格对比会告诉你其余答案。

收录200多个型号的产品目录

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新