
Claude Haiku 5.5 vs GLM-5.3-FlashX:為相同的權重多付 2.5 倍,以及這是否值得
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在把 GLM-5.3-FlashX 拿來與 Claude Haiku 5.5 相比之前,最該知道的一件事是:它跑的是與 GLM-5.3-Flash 完全相同的權重,但每次呼叫的費用是後者的 2.5 倍。Z.ai 於 2026 年 9 月 18 日在自家 API 上推出 FlashX,每百萬輸入 token 收費 0.37 美元、每百萬輸出 token 收費 1.25 美元,而它所衍生自的基礎模型則是 0.15 美元與 0.50 美元。模型本身沒有任何改變;改變的是它跑在哪裡,以及在那裡被承諾跑得多快。搞懂這組搭配就是這裡的全部關鍵,因為這意味著這並不是兩種能力層級之間的比較——而是價格層級與服務層級之間的比較,而 Haiku 5.5 則是從一個完全不同的方向落入了這場論辯的正中央。
兩個模型,四種價格,一個門檻
把四張相關的費率卡並排列出來,決策的輪廓就會比任何單一配對都更清楚:
• Claude Haiku 5.5,低於 100,000 個 token — 每百萬輸入 $0.10、輸出 $0.50(Anthropic 定價表)
• Claude Haiku 5.5,超過 100,000 個 token — 每百萬 token 輸入 $0.50、輸出 $2.50(Anthropic 定價表)
• GLM-5.3-Flash — 每百萬 $0.15 輸入、$0.50 輸出(Z.ai 定價表)
• GLM-5.3-FlashX — 每百萬 $0.37 輸入、$1.25 輸出(Z.ai 價目表)
• 上下文 — 四者皆為 100 萬個詞元(由廠商公布)
• 開放權重 — GLM-5.3-Flash 與 FlashX 繼承基礎模型的 MIT 授權權重;Claude Haiku 5.5 為閉源(由廠商發布)
• 獨立評分 — GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 中測得 41.807;Claude Haiku 5.5 測得 43.395(Artificial Analysis)
首先會注意到的是,FlashX 的價格幾乎正好落在 Claude Haiku 5.5 的長上下文級距上——輸入是 $0.37 對上 $0.50,輸出是 $1.25 對上 $2.50。這並非市場上的巧合;當底層模型屬於中等量級,而供應商收費收的是吞吐量而非能力時,這就是高階服務層級的成本。第二點是,GLM-5.3-FlashX 是某個模型的昂貴版本,而 Anthropic 的新 Haiku 在短上下文時比它便宜,在長上下文時則與它相當。第三點是,這四個數字彼此之間的差距都在五倍以內,這比大多數一對一比較中「便宜模型對昂貴模型」的框架所暗示的區間要窄得多。

FlashX 實際上是什麼
GLM-5.3-FlashX 並不是新模型。它是把 GLM-5.3-Flash 部署在 Z.ai 自有基礎架構上,宣稱尖峰時最高可達每秒 200 個輸出 token,對比基準模型的實測速率,而價格是基準模型牌價的 2.5 倍。Z.ai 的賣點很直接:相同的答案,每秒產出更多,而你付費買的是服務,而不是權重。對於受吞吐量限制的工作負載——批次分類、大量擷取,任何以延遲而非成本為限制條件的情境——這是一項說得通的可賣之物,也是一項說得通的可買之物。
它並不是能力升級,而這點在定價上也誠實地反映出來:如果 FlashX 是更好的模型,Z.ai 就無法針對基礎模型的權重另行收費。那 2.5 倍是服務溢價。是否值得支付,取決於你工作負載的瓶頸;對於受延遲限制的管線與受成本限制的管線,答案並不相同。
在撰寫本文時,Artificial Analysis 並沒有為 FlashX 設立獨立頁面,這一點值得直白說明,而不是粉飾帶過:該排行榜為 GLM-5.3-Flash 公布的獨立數字——Intelligence Index 上的 41.807、實測每秒 52.14 個輸出 token、Terminal-Bench Hard 上的 0.328——是基礎模型的數字,而非以 2.5 倍供應的版本。廠商自己對 FlashX 的吞吐量宣稱是峰值數字,且屬廠商自行回報。沒有任何獨立第三方公布過 FlashX 本身的吞吐量,因此任何拿 Haiku 5.5 的實測速度與 FlashX 相比的比較,都是在跟 Z.ai 就自家服務所提供的數字相比。
Z.ai 的 2.5 倍乘數並不是唯一讓 FlashX 相對於其基礎價格顯得昂貴的原因。由於基礎權重採用 MIT 授權,並由第三方託管,真正需要比單一供應商端點所能提供更高輸送量的工作負載,往往可以透過分散到數家提供相同權重、價格等於或接近基礎價的供應商來取得,而不必支付單一供應商的高階方案費用。那是 FlashX 價目表正在與之競爭的實際替代方案,而 Z.ai 也清楚這一點——這想必就是為什麼其推銷話術倚重峰值輸送量,而非獨特性。

Haiku 5.5 與 FlashX 分道揚鑣之處
把兩者放在決定實際工作負載的維度上一較高下,分界就會清楚到足以據此做出選擇:
• 100K 上下文以下的價格 — Haiku 5.5 $0.10 / $0.50 對比 FlashX $0.37 / $1.25;Haiku 兩邊都勝出
• 超過 100K 上下文的價格 — Haiku 5.5 $0.50 / $2.50 對比 FlashX $0.37 / $1.25;FlashX 在兩方面都勝出
• 吞吐量 — FlashX 的廠商峰值為 200 tok/s,對比 Anthropic 針對 Haiku 5.5 公布的服務數據,後者並未標榜這類峰值
• 獨立指數 — Haiku 5.5 43.395 對比 GLM-5.3-Flash 41.807(Artificial Analysis;FlashX 本身並無獨立數據)
• 權重 — FlashX 繼承 MIT 授權的開放權重;Haiku 5.5 為封閉式且僅提供 API
• 自架設——FlashX 可透過開放權重實現;Haiku 5.5 則不可行
• 工具/代理功能組合 — Haiku 5.5 具備可調式投入程度旋鈕,GLM Flash 系列則無
有趣的是第二個儲存格。Claude Haiku 5.5 在短請求上比 GLM-5.3-FlashX 便宜五倍,而在長請求上則略貴一些,因為 Haiku 的價格表在 100,000 個 token 時跳升為五倍,而 FlashX 則收取單一固定費率。如果你的流量以短請求為主,光就價格來看,Haiku 是顯而易見的選擇。如果以長請求為主,FlashX 根本不是在与 Haiku 的短請求級距價格競爭——它是在與 Haiku 的長請求級距競爭,而在這項比較中它大約勝出三分之一。
能力比較的結果,比兩家供應商所樂見的都更接近。在同一份獨立指標上,41.807 對上 43.395,差距不到百分之四,完全落在大多數應用層級評估的雜訊範圍內,也小得遠遠不足以單憑這點就做出選擇。在一般推理方面,兩個模型都沒有壓倒另一方;這項決定取決於價目表和吞吐量,而不是取決於哪一個更聰明。

授權差異是實實在在的差異。
FlashX 從一開始就是開放權重,這一點在某個軸向上比價格差距更重要:它可以自行託管,也可以由任何人提供服務。Claude Haiku 5.5 則兩者皆辦不到。對於有合規要求、必須在自己的硬體上進行推論的團隊,或是穩定用量大到攤提一顆 GPU 比按 token 付費更便宜的團隊而言,兩者之中只有 GLM 系列真正回答了這個問題。對其他所有人——也就是大多數人,他們想要的是 API 背後的一個模型,而不想自己跑服務層——授權條款只是附註,價格才是論點。
這也意味著,當供應商出狀況時,這兩個模型會有不同的故障模式。只由其供應商及該供應商的雲端合作夥伴提供服務的閉源模型,會在這些服務掛掉時也跟著掛掉。由多個獨立主機託管的開源模型,則可以在它們之間進行容錯移轉,前提是有某個機制負責執行移轉。那是真正的營運差異,而且這種事只有在真正重要的那一天才會顯現出來。
在無需第二份合約的情況下路由兩者
如果上述的判斷無法為你的流量收斂出單一贏家——通常也確實不會,因為這兩個模型在價目表的不同區段上互有勝負——那麼實務上的問題就是:如何在不必維護兩套整合的情況下同時運行兩者。OrcaRouter 提供z-ai/glm-5.3-flash,價格為供應商定價的每百萬 $0.15 與 $0.50,並涵蓋qwen/qwen3.8-flash以及 200 多個模型目錄中的其餘模型,全部共用一組金鑰與一份帳單。Anthropic 對 Claude Haiku 5.5 的價格調整,或 Z.ai 對 Flash 系列的價格調整,都會在當天以零加價直接反映,而不是落後於經銷商自家的價目表,因此上述數字始終是你實際支付的數字。
我們不提供 Claude Haiku 5.5,也不提供 GLM-5.3-FlashX——兩者都不在我們的型錄中;若要使用它們,請直接聯絡 Anthropic 與 Z.ai。我們有提供的是 GLM-5.3-Flash,也就是 FlashX 背後的基礎模型;對於許多工作負載而言,這才是正確的選擇,因為在那些情境中,2.5 倍的服務溢價換來的吞吐量根本沒有人要求。若某條生產路徑確實依賴我們未代管的這兩個模型之一,我們的故障轉移機制就是讓你在不把整條路徑押注其上的情況下先行試用的方法:把請求指向它,保留一個可運作的模型作為備援,讓路由層決定由哪一個來回應。
該選哪一個
每次請求低於 100,000 個 token 時,Claude Haiku 5.5 在價格上勝出,且在能力上與 FlashX 足夠接近,因此選擇很明確。超過 100,000 個 token 時,GLM-5.3-FlashX 比 Haiku 5.5 的長上下文層級更便宜,且如果請求大小是任務本身的屬性而非選擇,它就是應選擇的模型——儘管基礎版 GLM-5.3-Flash 更便宜,而支付 2.5 倍價格的唯一原因,是你特別需要 FlashX 所宣稱的吞吐量。
要丟棄的框架是:其中一個是預算選項,另一個是效能選項。它們都是中價位型號,有著固定且公開透明的價目表,而真正有趣的變數不是哪一個更好,而是對你的哪一半流量來說,各自在哪一半更便宜。先拉出你的請求大小分布;上方的雙欄價格比較會告訴你其餘答案。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
