一張標題為「Claude Haiku 5.5 vs Gemini 3.7 Flash」的主視覺卡片,左側顯示 2026 年 10 月 7 日發布的 Claude Haiku 5.5,右側則是標記為已棄用的 Gemini 3.7 Flash,一列 Intelligence Index v4.3.2 顯示 43.40 對 39.06,以及一列 Terminal Bench 4.0 顯示 0.3283 對 0.1364。
Guides & Insights

Claude Haiku 5.5 對比 Gemini 3.7 Flash:這兩款之中已有一款退役

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一個尷尬的事實,潛藏在任何Claude Haiku 5.5與Gemini 3.7 Flash的比較底下,而這篇比較是在今天撰寫:Gemini 3.7 Flash 已遭棄用。廠商在 2026 年 8 月 13 日推出它,並於 9 月 2 日以 Gemini 3.8 Flash 取而代之;Artificial Analysis 現在在其 3.7 頁面上標有棄用標記。相較之下,Claude Haiku 5.5 於 2026 年 10 月 7 日推出,並帶有不早於 2027 年 10 月退役的承諾。

那並不會讓這項比較變得沒有用。它改變了問題。這不再是「這兩者之中我該呼叫哪一個」——對大多數團隊來說,答案是兩者皆非,因為 3.7 系列在自己的家族中已被取代。它真正的用處在於某種更細微、也可以說更有價值的東西:清楚看出 Google 的 flash 等級在三週內推進得多快,以及 flash 等級模型的規格表中,哪些部分才真正決定它會不會被採用。

你仍然可以測量什麼

兩款模型都已在同一個獨立排行榜上受測,而這是兩者唯一能真正並列比較的地方。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Haiku 5.5 在其 Max 配置下得分 43.40,相較之下 Gemini 3.7 Flash 在其 High 配置下為 39.06——差距達 4.33 分。

兩家廠商也各自發布自家的評估集,而這些評估集的重疊程度不足以進行直接比較。雙方共有的獨立資料列,是 Artificial Analysis 在兩者上皆執行過的那四項:

• Terminal Bench 4.0 — Claude Haiku 5.5 為 0.3283,對上 Gemini 3.7 Flash 的 0.1364。絕對差距達 19 個百分點,也是這組中最懸殊的不對稱。

• SciCode — 0.5498 對 0.5718。Gemini 3.7 Flash 以 2.2 分之差險勝。

• Humanity's Last Exam — 0.4439 對上 0.4787。Gemini 3.7 Flash 以 3.5 分領先。

• AutomationBench,部分分數 —— 0.3541 對 0.6203。Gemini 3.7 Flash 領先 27 分。

仔細閱讀那組結果,因為其中包含有趣的發現。Gemini 3.7 Flash 在四項共同基準測試中贏了三項,卻仍在綜合指數上輸了 4.3 分。指數是一種加權混合,而加權方式賦予終端機與程式碼列的權重——在那裡,差距以更大的幅度朝相反方向發展——高於其他項目的加總。這與其說是評分上的假象,不如說是在說明這個指數的用途:它試圖預測一個模型能否完成一項任務,而在這個問題上,3.7 系列表現疲弱,其相當不錯的科學基準測試分數並未掩蓋這一點。

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

3.7 系列實際上不擅長什麼

兩行資料比指數更能說明問題。

Terminal Bench 4.0 的 0.1364 是個偏低的數字,而它旁邊就是同一個模型在上一代 Terminal Bench 拿下的 0.8577。這並非模型變差了,而是這項基準改變了它衡量的東西,而 Gemini 3.7 Flash 沒能完成這個轉換。Claude Haiku 5.5 在同一套修訂後的基準上拿下 0.3283——以絕對值來說並不亮眼,但將近是 3.7 Flash 那個數字的兩倍半,而且就落在最能直接預測代理式編碼表現的那一列上。

第二列是 Tau-Bench Banking,其中 Gemini 3.7 Flash 得分為 0.3278。在結構化領域中,工具使用的可靠性正是廉價模型被部署來處理的任務,而低於 0.33 的分數,正是那種會悄悄扼殺試點計畫的數字。Claude Haiku 5.5 在同一張表中並沒有已公布的 Tau-Bench 數據,因此無法在那裡進行比較——誠實的做法是如實說明,而不是憑空推斷出一個數字。

Gemini 3.7 Flash 撐得住的地方,正是它一向撐得住的地方:GPQA 為 0.9455、MMMU-Pro 為 0.8549,兩者都是貨真價實的強項,而它的多模態輸入也從來不成問題。失敗之處在於規格表中決定 agent 迴圈能否運作的那一部分,而不是在排行榜上贏得名次的那一部分。

在那之後的三週裡,改變了什麼?

Gemini 3.8 Flash 於 2026 年 9 月 2 日登場,而對於任何規劃 2027 年管線的人來說,Google 自家 Flash 層級內部的演進是更有用的比較。

在同一項指標上,Gemini 3.8 Flash 測得 40.93,相較於 3.7 系列的 39.06——三週內提升了 1.87 分。Terminal Bench 4.0 從 0.1364 提升到 0.1970。Tau-Bench Banking 從 0.3278 提升到 0.4495。這些正是 3.7 模型表現最差的項目,這暗示後繼版本鎖定的正是這項弱點,而非整體能力的提升。

價格完全沒有變動。Gemini 3.7 Flash 的定價是每百萬個 token 輸入 $0.75、輸出 $3.75,而 Gemini 3.8 Flash 推出時也是同樣的 $0.75 與 $3.75——一模一樣的價目表,卻套用在一個在對代理程式至關重要的那些列上,指數還高出兩點的模型。

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

費率表才是這項比較真正出現轉折的地方

與 Claude Haiku 5.5 相比,Google 的價格就是決勝關鍵,而且差距一點都不小。

• 輸入 — Claude Haiku 5.5 每百萬個符元 0.10 美元,最高 100,000 個,超過部分為 0.50 美元;Gemini 3.7 Flash 一律 0.75 美元,相當於第一級距內 Anthropic 費率的七點五倍。

• 輸出 — 第一層級內 Claude Haiku 5.5 為 $0.50,超過則為 $2.50;Gemini 3.7 Flash 為 $3.75。

• 快取的輸入 — 適用於 Claude Haiku 5.5 為 $0.01 與 $0.125;適用於 Gemini 3.7 Flash 則為讀取 $0.075 與寫入 $0.75。

• 上下文 — 兩者皆為一百萬個詞元。最大輸出 — Claude Haiku 5.5 為 128,000 個詞元,Gemini 3.7 Flash 則為 65,536 個。

• 輸入模態——Claude Haiku 5.5 為文字與圖像;Gemini 3.7 Flash 為文字、圖像、語音與影片。這依然是 Google 的規格明顯較長的那一行,而且歷經傳承至 3.8 仍維持不變。

• 每完成一項 Index 任務的獨立成本——Claude Haiku 5.5 為 0.21 美元,而 Gemini 3.7 Flash 為 0.93 美元。這是 4.4 倍的差距,比 7.5 比 1 的輸入比率所暗示的還要大,因為 Anthropic 的模型在這裡是較冗長的一方:每個 Index 任務有 162,164 個輸出 token,而 Gemini 3.7 Flash 為 58,387 個。Anthropic 也記錄了一款與 Claude 4.7 及後續版本共用的分詞器,對相同文字會多計算約 30% 的 token,這也朝同一方向推升差距。

• 速度 — 在 Index 任務上,Gemini 3.7 Flash 為 212.3 秒,Claude Haiku 5.5 則為 424.6 秒。Google 的模型是兩者中較快的一個,速度是另一者的兩倍,而這是本節中唯一一處較便宜的模型並非同時也是較好的模型。

如果你今天就要做選擇,這代表什麼

實際解讀是,這兩者都不是正確答案,但原因各不相同。

Gemini 3.7 Flash 已遭淘汰,定價卻與其後繼者相同,而且在廉價生產模型真正需要的那些項目上,表現還不如後繼者。推薦它,等於推薦一張綁在被取代模型上的價目表——後繼者價格相同,卻做得更多。在 2026 年 10 月,任何在這兩者之間做選擇的人都不該落到 3.7 這條產品線上,而它的價目表至今未變,正是讓此事塵埃落定的關鍵。

Claude Haiku 5.5 是目前上線的模型,而在純文字輸入、文字輸出的工作上,它在各方面都更便宜、綜合評分更高,而且在兩項能預測代理式任務能否成功的指標上表現好得多。它同時也是較慢的那一個,而且無法接受語音或影片。這件事是否有影響,取決於你的流程,而不是這些模型。

第三個選項——3.8 與 3.7 之間的指數點差距讓它顯而易見——是 Google 的 Flash 層級推進得夠快,以至於三週前的比較已然成為歷史。要把任何 Flash 層級的正面交鋒,都視為保鮮期以週、而非以季來計算。

執行你最終落腳的那一方

Gemini 3.8 Flash——是後繼版本,而非已遭棄用的 3.7——已以 Google 的定價、零加成登上 OrcaRouter 目錄,因此 Google 公布的價格就是最終出現在你帳單上的價格,而他們那一端若有任何變動,我們這邊當天就會同步生效。Claude Sonnet 5.5 與 Claude Opus 5.5 同樣也在目錄中,這讓雙供應商的路由測試變成只是一項設定,而非一整個專案:一組 API 涵蓋 200 多個模型、一把金鑰,自動容錯移轉作為底層支撐,還有路由 DSL,讓你可以把升級處理留在路由裡,而不是寫在程式碼中。

Gemini 3.7 Flash 本身並未收錄在我們的型錄中,Claude Haiku 5.5 也不在。兩者仍可透過各自供應商自家的 API 取得;而就 Google 而言,還可經由數個第三方平台使用。這一點值得直接說清楚,而不是留給讀者自行發現。

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

要減去的數字

不是那 4.33 點的指數差距。而是 Gemini 3.7 Flash 在四項共同基準測試中贏了三項,卻仍在綜合分數上輸了四分,因為指數權重最重的那項基準測試,正是它只拿到 0.1364 分的那一項。Flash 級模型的科學分數可能看起來沒問題,卻在便宜模型被買來處理的事情上失手。

推論是,後繼者在三週內以不變的價格精確修正了那些列。根據這項證據,這個層級的競爭壓力並非價格,而是在於模型能否完成多步驟任務,而這一點現在的變化速度比價目表還快。