
Claude Haiku 5.5 原本瞄準的是中國的 Flash 層級。但這個說法只有一半經得起嚴格檢視。
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
本週,一位以中文寫作的讀者提出了一個犀利的論點:Claude Haiku 5.5看起來是為了攻佔中國中階市場而打造,因為它在價格上低於DeepSeek V4.1 Flash與GLM 5.3 Flash,而且在 Terminal Bench 4.0 和 Artificial Analysis Intelligence Index 上的分數高於 GLM 5.3 Flash。這比大多數發布評論更敏銳。但這其實是兩個主張披著同一件外衣,而它們的真實程度並不相同。
Anthropic 於 2026 年 10 月 7 日推出 Claude Haiku 5.5——一場完整的公開發布,附有標明日期的公告、系統卡,以及對外公布的費率表。這讓該說法擁有二手市場評論鮮少能得到的東西:可供查核的數字。
下方的稽核發現,其中一半比讀者所說的更強,而另一半則在其引用的特定基準上出錯。這兩項發現都值得了解,因為它們指向相反的方向。
精確陳述的主張
剝除枝節後,這個論證包含三個部分。
• 價格 — Claude Haiku 5.5 比 DeepSeek V4.1 Flash 便宜,也比 GLM 5.3 Flash 便宜。
• 獨立分數——在 Artificial Analysis Intelligence Index 上,它比 GLM 5.3 Flash 高出約一分。
• 程式設計基準 — 它在 Terminal Bench 4.0 上的得分也比 GLM 5.3 Flash 高一分。
其中兩項可對照已發布的表格並經調整後加以核對。第三項則可對照同一份表格加以核對。

價格的那一半:為真,並且在一個方向上被低估,在另一個方向上被高估
Anthropic 公布的 Claude Haiku 5.5 費率為:輸入 token 每百萬 $0.10,輸出 token 每百萬 $0.50,適用於最高 100,000 token 的提示;超過此門檻後,分別調升至 $0.50 與 $2.50。快取輸入讀取為 $0.01,寫入為 $0.125。上下文視窗為一百萬 token;上限為 128,000。
GLM 5.3 Flash,由 Z.ai 推出,定價分別為 $0.15 和 $0.50,快取輸入為 $0.026。DeepSeek V4.1 Flash 定價分別為 $0.30 和 $1.20,快取輸入為 $0.006。
就掛牌費率而言,讀者說得沒錯。$0.10 的輸入費率比 GLM 5.3 Flash 低三分之一,比 DeepSeek V4.1 Flash 低三分之二;而 $0.50 的輸出費率則與 GLM 5.3 Flash 完全相同,同時遠低於 DeepSeek 的一半。這看起來像是刻意安排的定價落點:在輸出上與較便宜的對手持平,在輸入上勝過它,並讓這個比率自己說話。
對這個說法更有利的地方,在於每項完成任務的實測成本。在 Artificial Analysis 的 Intelligence Index v4.3.2 上,整體任務成本算下來,Claude Haiku 5.5 為 $0.21,GLM 5.3 Flash 為 $0.25,DeepSeek V4.1 Flash 為 $0.27。價目表上說,Claude Haiku 5.5 的輸入成本比 GLM 5.3 Flash 便宜 1.5 倍;但實測顯示,完成任務的成本大約便宜六分之一。它仍然是三者中最便宜的——只是沒有標價所暗示的那麼大的差距。
原因就在大多數價格比較所忽略的那一點。Claude Haiku 5.5 的輸出很冗長。Artificial Analysis 在執行該 Index 時,記錄到它產生了 162,164 個輸出 token,相較之下 GLM 5.3 Flash 為 68,673 個,DeepSeek V4.1 Flash 則為 88,574 個。Anthropic 自家的文件還指出第二個效應:該模型使用與 Claude 4.7 及後續版本共用的新版 tokenizer,因此同樣的文字會比它所取代的模型多算約 30% 的 token。較便宜的費率套用在更多 token 上,就是較便宜的費率套用在更多 token 上。
有一個只會在路由帳單上才顯現的細節:我們自家的價目表列出 DeepSeek V4.1 Flash 為輸入 $0.15、輸出 $0.60,並在每日兩個時段(01:00–04:00 與 06:00–10:00 UTC)套用 2× 乘數。一天當中有十八小時是基礎費率;有六小時輸出費率是 $1.20。可調開這些時段來排程的批次流量,取得 DeepSeek 的實際價格會明顯優於供應商公布的牌價所暗示的水準,而互動式流量則不然。如果你真的要為這項比較建立模型,行事曆的重要性不亞於費率卡。

分數的一半:「大約一分」是 1.6
在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Haiku 5.5 在其 Max 組態下測得 43.40。GLM 5.3 Flash 測得 41.81。DeepSeek V4.1 Flash 則為 39.46。
所以,這個說法中有關指數的那一半在方向上沒錯,而且會向下取整:差距是 1.59 分,不是 1 分。在一個數值會進入六十分區間的指數上,這是實實在在的領先,而且這個數字在每一份關於這場對決的摘要中都會被引用。
它不是針對底下那些基準測試的主張。兩家廠商各自發布自家的評估集,而這些並非同一套評估集——Anthropic 為 Claude Haiku 5.5 回報 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 與 FrontierCode;Z.ai 則為 GLM 5.3 Flash 回報自家的一套測試。獨立榜單是唯一可取得的同基準比較列,這正是為什麼那個指數差距會被如此大力援引,也是為什麼下一節很重要。
程式編寫的部分:這一項完全打成平手,不算勝利
Terminal Bench 4.0 在共用的獨立量測中,對 Claude Haiku 5.5 的讀數為 0.32828,對 GLM 5.3 Flash 的讀數也是 0.32828。兩者到小數點後五位完全相同。
那是這場對決中最常被引用的一個數字,而該說法對這個數字的理解是錯的。混淆的可能來源是隔壁那一列:完整版 GLM-5.3,也就是非 Flash 的兄弟版本,在同一項基準測試中得分 0.4192。如果你曾看過「GLM」和「Terminal Bench」出現在同一句話裡,旁邊的數字比 Claude Haiku 5.5 高出一個點,那是兄弟版本,不是 Flash。
Artificial Analysis 為這兩個模型公佈的其他三列比這項平手更有意思,而且它們並未指向同一個方向:
• SciCode — Claude Haiku 5.5 為 0.5498,GLM 5.3 Flash 則為 0.5162。Anthropic 以 3.4 分領先。
• Humanity's Last Exam — 0.4439 對上 0.3985。Anthropic 以 4.5 個百分點勝出。
• AutomationBench,部分分數 — 0.3541 對 0.6037。GLM 5.3 Flash 領先 25 個百分點,且是這組中迄今最大的差距。
最後一列是採購團隊最在意的一列,因為代理式自動化正是中階模型實際部署的所在。在衡量模型能否將多步驟任務完成到底的指標上,運行成本較低的開放權重模型勝出的幅度,讓反方向上那 1.6 點的指數差距相形見絀。
速度的差距和價格如出一轍,只是有過之而無不及。Artificial Analysis 測得 Claude Haiku 5.5 每項 Index 任務需時 424.6 秒,而 GLM 5.3 Flash 則為 1035.4 秒。Anthropic 的模型以不到一半的實際耗時就能完成,這在代理迴圈中,是比 token 速率更具營運意義的數字。
這項主張完全遺漏了什麼
這項比較被包裝成價格與分數的故事,卻悄悄略過了這兩個模型最不相像的層面。GLM 5.3 Flash 是開放權重,以 MIT 授權發布,總參數量為 3200 億,活躍參數為 180 億。DeepSeek V4.1 Flash 同樣是開放權重,總參數為 5520 億,活躍參數為 160 億。Claude Haiku 5.5 則是專有模型,僅提供 API,未公布參數量,也沒有公開的儲存庫。
對許多買家而言,那不是註腳,而是需求文件的第一行。一個需要在自家租用戶環境中執行推論、微調,或將某個模型版本固定使用多年的團隊,根本不是根據指標分數在這三者之間做選擇——三者之中有兩個在讀到價格欄之前就已經被淘汰。讀者的框架是一種市場定位觀察,而且相當合理;只不過,這個結構性差異恰好不利於該框架所捍衛的模式。
自行執行比較
GLM 5.3 Flash 與 DeepSeek V4.1 Flash 都已收錄在 OrcaRouter 目錄中,以供應商定價、0% 加價提供,這讓這場比較中的中國一方,成為你今天就能直接呼叫的對象,而不必先在試算表中建模。由於費率是原樣傳遞而非混合計算,供應商一調價,當天就會同樣反映到我們這一側——而且上述以日曆為基礎的 DeepSeek 時間窗口,會出現在你實際路由時所依據的同一個定價區塊中。一把金鑰、一套 SDK,自動容錯移轉,底下全都幫你處理好;如果你更想在路由中表達成本上限,而不是寫在應用程式碼裡,也可以使用路由 DSL。
Claude Haiku 5.5 並不在我們的目錄中。它能透過 Anthropic 自家的 API 使用,而明白說出這點,總比含糊帶過要好。

得到了什麼,以及該怎麼處理它
這個直覺沒錯。如果你想讓那一波便宜、能力不俗的中國中階模型顯得昂貴,這大概就是你會打出的牌:把輸出費率做到與較便宜的對手相同,把輸入費率砍半,以領先 1.6 個指數點之姿登場,並讓「每完成一項任務的價格」這個數字來撐起論點。Claude Haiku 5.5 正是這麼做,而且每項任務的速度還比它所瞄準的模型快上超過兩倍。
讀者弄錯的地方比較狹窄,卻也更有意思。Terminal Bench 4.0 並非勝出,而是完全打成平手。價格優勢——當你按整項工作而非按 token 計費時——約為六分之一,而不是價目表所顯示的 1.5 倍。而兩個模型差距最大的那項基準測試,是代理型(agentic)的那一項;在其中,GLM 5.3 Flash 領先 25 分。
所以,這項主張的誠實版本是這樣:Claude Haiku 5.5 瞄準的是中國的 flash 層級;就綜合指數、每完成一項任務的成本和延遲而言,它在這場比較中勝出,但在代理式自動化或開放性上則沒有勝出;而那個讓這項論點顯得具決定性的特定程式設計基準優勢,並不存在。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
