一張主視覺卡片,標題為「在 0.32828 上平分秋色」,數字兩側分別是 Claude Haiku 5.5 與 GLM 5.3 Flash,一列顯示 Terminal Bench 4.0 0.32828,一列指數顯示 43.40 對 41.81,副標題為「相同數字,不同機器」。
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash:在兩家廠商都引用的基準測試上完全打成平手

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

這也是一個不該拿來做決定的數字。這兩個模型在其他所有方面都明顯分道揚鑣,而這種分歧的模式極不尋常,足以改變你解讀任一廠商主要宣稱的方式。其中一個贏得綜合指標與每項任務成本數字。另一個則幾乎在所有看起來像實際部署的項目上都勝出。

它們不是以能力區分的。它們是以形狀區分的。

從那個說明「這些是同一類模型」的數字開始。

• SciCode — Claude Haiku 5.5 為 0.5498,對上 GLM 5.3 Flash 的 0.5162。Anthropic 多得兩分,但在一個兩分不過是雜訊的基準測試上。

• Terminal Bench 4.0 — 0.32828 對 0.32828。完全平手,一分不差。

• 上下文視窗 — 兩者皆為一百萬個詞元。

輸出價格,第一層級——每百萬個詞元 $0.50,兩者皆同。

四列,四個近乎吻合。如果你就此打住,你會斷定這些型號可以互換,並依價格挑選。那個結論會是錯的,而接下來的那幾列就是原因。

在它們分歧之處,方向是一致的

那些真正能將它們區分開來的列並非零散分布。它們會聚成兩組,而每個模型都獨佔其中一組。

此代理類別屬於 GLM 5.3 Flash。AutomationBench 部分分數顯示,GLM 5.3 Flash 為 0.6037,而 Claude Haiku 5.5 為 0.3541——差距達 25 點,是這兩個模型在任何共同測量項目上最大的單一差異。Tau-Bench Banking 方面,GLM 5.3 Flash 為 0.4722;Claude Haiku 5.5 在該項目並無公布數據。GP 方面,GLM 5.3 Flash 為 0.9121;同樣沒有 Anthropic 的數據可供比較。在衡量模型能否維持多步驟任務的連貫性,並在結構化領域中可靠使用工具的指標上,Z.ai 的模型領先的幅度,令反向的綜合指數差距相形見絀。

綜合與成本組別屬於 Claude Haiku 5.5。Artificial Analysis Intelligence Index v4.3.2 的讀數為 43.40,對比 41.81——差距 1.59 分,也是每一份這場對決摘要都會引用的數字。每項完成的 Index 任務成本為 $0.21,對比 $0.25。每項 Index 任務的實際耗時為 424.6 秒,對比 1,035.4 秒:Anthropic 的模型完成時間不到一半。

這就是這個選擇的樣貌。Claude Haiku 5.5 速度更快、每完成一項工作的成本更低,而且在總體表現上更高。GLM 5.3 Flash 則在廉價模型通常被買來處理的那類特定工作上更可靠。

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

該相信哪一個?

兩者都不是,單獨來看——而歧異本身就是資訊。

「Intelligence Index 是跨推理、科學、程式設計與代理類別的加權混合。它旨在以單一數字回答「這個模型大致有多能幹」,而且它做到了這一點。它無法做到的是告訴你,1.59 分的領先優勢是來自你的工作負載所屬的類別,還是來自它從未觸及的類別。在這裡,領先優勢主要來自像 SciCode 和 Humanity's Last Exam 這樣的項目——0.5498 對 0.5162,以及 0.4439 對 0.3985——而 25 分的劣勢則落在 AutomationBench 上,且符號相反。」

在終端迴圈上打造程式設計助理的團隊,會注意到 SciCode 的優勢。打造必須端到端完成銀行工作流程的代理的團隊,則會注意到 AutomationBench 的落差,而且每一天都會注意到。這兩個團隊看的是同一個指標,卻應該得出相反的結論。

實務上的做法,是把這項綜合指標當成篩選器來解讀,而不是當成排名。如果兩個模型相差約兩個指數點,這項綜合指標等於告訴你它們落在同一級距,卻完全沒告訴你該選哪一個。到了那個時候,唯一值得看的,是符合你工作負載的那些資料列——而如果供應商沒有公布你需要的那一列,這個從缺本身就是一項資料點,不是用假設去填補的缺口。

沒人會放進比較表裡的那行分詞器數據

Anthropic 自家的文件裡有一句話,會改變每一項涉及 Claude Haiku 5.5 的價格比較,而且很容易被略過。該模型採用與 Claude 4.7 及後續版本共用的較新分詞器,同樣的文字,它算出的 token 數會比它所取代的模型大約多 30%。

把這一點對照價目表來看,算出來的結果就沒有標價上看起來那麼漂亮。Claude Haiku 5.5 的輸入費率是每百萬個 token 0.10 美元,相較於 GLM 5.3 Flash 的 0.15 美元——有 1.5 倍的優勢。若同一則提示需要多耗用 30% 的 token,那麼在相同文字上的實際優勢就會明顯縮小,儘管並未消失。第一級的輸出費率同樣都是 0.50 美元,因此分詞器效應在此發揮作用,沒有任何因素能抵銷它。

實測結果才是這項說法的誠實版本:依 Artificial Analysis 自家的計算,Claude Haiku 5.5 每個 Index 任務產生 162,164 個輸出 token,而 GLM 5.3 Flash 則是 68,673 個——足足是 2.4 倍——但每完成一項任務仍只要 $0.21,相較之下為 $0.25。費率優勢在如此冗長之下依然成立,而它剩下的部分比價目表上寫的還要小。

這兩者之中,只有一個的費率是以單一固定價呈現。Claude Haiku 5.5 的價格在提示超過 100,000 個 token 後會調升為輸入 $0.50、輸出 $2.50;GLM 5.3 Flash 則沒有公布相對應的門檻。對大多數聊天與程式輔助流量而言,這個級距永遠不會觸發。但對於長文件或大脈絡的代理工作,它卻會不斷觸發,而到了那個時候,比較結果的反轉會遠遠超出第一層級數字所暗示的範圍。

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

在任何數字做出決定之前,就已經決定結果的那條線

上述一切的前提,都是你可以自由地在這兩個模型之間做選擇。但有很大一部分團隊做不到,而原因就在規格表上的一行——那一行往往被基準測試的討論所掩蓋。

GLM 5.3 Flash 是開放權重,以 MIT 授權條款發布,總參數量達 3,200 億,其中 180 億為活躍參數。它可以被下載、自行託管、微調、量化、鎖定至特定版本,並在你掌控的租戶環境中運行。Claude Haiku 5.5 則是專有且僅提供 API,沒有公布參數量、沒有授權條款,也沒有程式碼儲存庫。

如果你的需求文件寫明,模型必須在你自己的硬體上執行,或者某個特定檢查點在未來三年內必須保持可呼叫,那麼在讀到價格欄之前,這場比較就已經結束了。這不是什麼技術細節。這正是團隊最終會選擇開放權重中階模型的最常見原因,也是為什麼 25 分的 AutomationBench 優勢並非唯一把大家拉向 Z.ai 的因素。

這也有反向的一面,同樣的誠實標準也適用。Anthropic 為 Claude Haiku 5.5 公布了一份退役承諾,時間不早於 2027 年 10 月,並以第一方 API 提供該模型,附有系統卡與有文件記錄的評估集。開放權重發布並不自動更耐久——你連同權重一起繼承了維運負擔,而授權檔案不是支援合約。你想要這兩者中的哪一個,是關於你團隊的問題,而不是關於模型的問題。

雙方都放在同一個鍵上,如果你想用實證來定案的話

GLM 5.3 Flash 已在 OrcaRouter 目錄上,以 Z.ai 的定價提供,0% 加成,是直接轉嫁而非混合計算,因此上述費率就是帳單上的費率,Z.ai 所做的任何變更都會在同一天反映到我們這邊。Claude Haiku 5.5 不在我們的目錄中——它是可透過 Anthropic 自家的 API 存取——與其留待暗示,不如明確說明這一點。

這個模型目錄真正讓事情變簡單的,是這場對決實際上所需要的測試形態。綜合指標與代理式項目之間的落差,是一個關於你的工作負載的假設,而唯一能解決它的方法,就是讓兩個模型跑同一份追蹤資料。當路由上跑的是 GLM 5.3 Flash,而同一閘道的另一端接上 Anthropic,這就變成一次設定變更,而不是兩套整合——一組 API 涵蓋 200 多個模型、一把金鑰, 底層自動容錯移轉,以及當你想依任務類別拆分流量、並從單一帳單讀出成本時可用的路由 DSL。

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

結論,以數字所支持的方式陳述

如果你的工作是文字進、文字出,你的提示仍落在第一個定價層級內,而且你是為實際用量按 token 付費,那麼 Claude Haiku 5.5 在這裡是更好的模型:綜合分數更高、每完成一項任務更便宜,而且每項任務速度快超過兩倍。終端機基準測試的頭條數字則不分軒輊,不應拿它來決定任何事。

如果你的工作是一個必須在無人監督下完成多步驟工作流程的代理,GLM 5.3 Flash 在唯一一個正好衡量這點的基準測試上領先 10 分,而且它是兩者中修改成本較低的那個,因為權重掌握在你手中。

0.32828 上的平手是這組配對的正確寫照,但並不是因為這兩個模型相等。它是唯一一列,兩個除此之外幾乎毫無共通點的模型恰好落在同一個數字上——而把那個數字當作這項比較的總結,正是採購決策以表中最不具資訊量的數字為依據的方式。