一張為「六倍成本,換兩點指數」生成的主視覺卡片,標上「每任務成本」徽章,並帶有引言「兩款 Flash 級模型,同一榜單」與副標「Claude Haiku 5.5 在 Intelligence Index v4.3.2 上以 43.40 對上 Gemini 3.8 Flash 的 40.93」。四枚標籤分別寫著「43.40 對 40.93」、「$0.21 對 $1.24」、「$0.10 對 $0.75」以及「2027 年 1 月 1 日調漲」。下方兩張卡片分別標示為「ANTHROPIC 的優勢」(「在共同榜單上排名更高,且每項完成任務的成本便宜六倍」)與「GOOGLE 的優勢」(「支援語音與影片輸入,且整個區間內維持固定費率」)。頁尾寫著「獨立測量數據來自 Artificial Analysis;定價為 2026 年 10 月 8 日讀取的牌價。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對比 Gemini 3.8 Flash:指數差距兩點,每項任務成本達六倍

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5與Gemini 3.8 Flash在這個價格帶中,實測能力之接近程度勝過任何其他組合——在 Artificial Analysis Intelligence Index v4.3.2 上分別為 43.40 與 40.93,兩者都名列 225 款模型榜單的前五十名。真正區隔兩者的,是那些指數分數每一點要付出多少代價。在同一項獨立量測中,完成一項 Intelligence Index 任務在 Claude Haiku 5.5 上要花 $0.21,在 Gemini 3.8 Flash 上則要 $1.24。

那是六倍的落差,換來的卻只是兩分半的分數差異,而這個數字才應該是決定這項比較的關鍵。其他一切——標價費率、模態清單、附加在 Google 定價上的期限——都只是關於邊緣的爭論。

兩款型號,在關鍵數字上

每百萬個 token,以美元計,資料來自 Anthropic 與 Google 自家的定價文件,並附上歸屬於 Artificial Analysis 的獨立測量數據。快取於 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.8 Flash - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.8 Flash reads input $0.75 now and $1.50 after January 1 2027, output $3.75 and $7.50, cached input $0.075 plus storage, maximum output 65,536 tokens, input modality text images speech and video, Intelligence Index v4.3.2 40.93, cost per task $1.24. A footer reads 'Vendors' published list rates; Google's lower rate runs through December 31, 2026; independent scores from Artificial Analysis.'

• 輸入 — Claude Haiku 5.5:100,000 個 token 以內 $0.10,超過則 $0.50;Gemini 3.8 Flash:均一價 $0.75,2027 年 1 月 1 日起調漲至 $1.50。

• 輸出 — Claude Haiku 5.5 每 10 萬個 token 以內 $0.50,超過則為 $2.50;Gemini 3.8 Flash 均一價 $3.75,同日調漲至 $7.50。

• 快取輸入 — Claude Haiku 5.5 $0.01 與 $0.05;Gemini 3.8 Flash $0.075,另加每百萬個詞元每小時 $0.50 的儲存費用。

• 上下文 — 兩者皆為 1M token。最大輸出 — Claude Haiku 5.5 為 128,000 token,Gemini 3.8 Flash 則為 65,536。

• 輸入模態 — Claude Haiku 5.5 支援文字與圖像;Gemini 3.8 Flash 支援文字、圖像、語音與影片。這是 Google 的清單唯一確實較長的一行。

• 獨立評分——Claude Haiku 5.5 (Max) 為 43.40,對上 Gemini 3.8 Flash (High) 的 40.93,依據 Intelligence Index v4.3.2。

• 獨立每項任務成本 — 在同一塊板上,$0.21 對比 $1.24。

• 速度 — 每秒輸出 241.9 個 token,對比 125.2,兩者皆由 Artificial Analysis 測量。

六倍數字從何而來

每項任務成本的差距比標價差距還大,而這正是有趣的地方,因為這表示單憑費率表並無法解釋這個差距。

標價上的算術再簡單不過:輸入端 $0.10 對上 $0.75,便宜七倍半;輸出端 $0.50 對上 $3.75,也是同樣的比例。如果兩個模型為同樣的工作產生相同的 token,那個比例就會直接反映到帳單上。

這並沒有成立,而且兩種效應都對 Google 有利。Claude Haiku 5.5 的冗長程度,連其自家廠商也承認:Artificial Analysis 在執行該 Index 時記錄到 4.4 億個輸出 token,而中位數為 1 億,並稱該模型非常冗長。Gemini 3.8 Flash 則產生了 1.7 億個,中位數為 8,100 萬——同樣被標記為冗長,但 token 數只有三分之一。Anthropic 自家的文件還補充了第二種效應:Claude Haiku 5.5 採用與 Claude 4.7 及後續版本共用的較新分詞器,因此同一段文字算出的 token 數,比它所取代的模型大約多 30%。

綜合來看,這項定價說法的誠實版本是:輸入費率上有十比一的優勢,輸出費率上有七點五比一的優勢,其中一部分被一個每次回答會寫出更多 token 的模型所抵銷,最後在以整體工作量計費的衡量方式中,得出六比一的優勢。這仍是一場壓倒性勝利,但比費率表所暗示的規模要小。

Google 的價格上標有日期

Google 定價頁面上最實用的一項資訊,是一句大多數比較表都略過的說明。

Gemini 3.8 Flash 的定價為輸入 $0.75、輸出 $3.75,「至 2026 年 12 月 31 日止」;而「自 2027 年 1 月 1 日起」則為 $1.50 與 $7.50。快取輸入也在同一天從 $0.075 調升至 $0.15。這是一種優惠初期費率,旁邊印著到期日,距離本文撰寫時間約十一週。

Anthropic 方案說明中的任何內容都不是那樣表述的。Claude Haiku 5.5 的費率就是按費率本身陳述,採用依提示長度而非日曆劃分的雙層結構,並承諾不早於 2027 年 10 月 7 日退役。如果你正在為一條會延續到明年的流程建立模型,Google 在一月的調整是翻倍,這應納入模型;Anthropic 並沒有可供規劃的對等事件。

這對雙方都成立,而公允的解讀並不是「某一家廠商誠實,另一家不誠實」。只要促銷價仍在有效期間內,它就是真實的價格,而 Google 有權以那種方式為新產品上市定價。一月數字中看起來較便宜的那一方,正是有截止期限的那一方,這不過是這項比較中的一項事實。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table beneath it, with the per-million-token input, output and cache rates and the prompt-length threshold at which the second tier begins.

指數的兩點值多少?

在一個分數可達六十幾分的指標上,2.47 分的差距既不是四捨五入誤差,也不是一道鴻溝。兩個模型都落在相同的工作區間,而實際的問題是:這個差距是否會出現在你真正執行的任務上。

就廠商自家公布的數字而言,這兩者並非以同一套測試框架衡量,因此無法直接對齊——Ant​hropic 為 Claude Haiku 5.5 公布了 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 與 FrontierCode 的結果,而 Google 則為 Gemini 3.8 Flash 公布了自己的一套結果,且兩家廠商都沒有跑對方的測試套件。唯一可得的對等比較是那個獨立排行榜,而在那裡,答案是 Ant​hropic 領先,差距可量測但不大。

對某些團隊而言,更重要的能力差異在於模態這條線。Gemini 3.8 Flash 接受語音與影片輸入;Claude Haiku 5.5 接受文字與圖像。一條原生接收通話錄音或螢幕擷取的管線,根本不是在價格上權衡這兩個模型——其中一個若不在前面加上轉錄或影格擷取步驟,就無法完成工作,而那個步驟有其自身的成本與自身的失敗模式。

操作這對中較便宜的一側

Gemini 3.8 Flash 已列於 OrcaRouter 目錄,以 Google 的定價提供,加成 0%,這一點在這裡比平常更重要:供應商的費率是直接轉嫁而非混合計算,所以如果你想看一月這一步實際上對帳單造成什麼影響,當 Google 的數字變動時,這個數字也會跟著變動。Claude Sonnet 5.5 和 Claude Opus 5.5 也在目錄中,這讓三方路由測試——Google 的 Flash 分支、一個 Ant​hropic 中階層,以及之後的一個 Ant​hropic 小階層——成為一項設定,而不是一個專案。一個金鑰、一個 SDK、底層自動容錯移轉,以及路由 DSL——如果你想在路由中而非在應用程式碼中表達升級。

Claude Haiku 5.5 本身尚未收錄於目錄中,與其含糊帶過,不如據實說明。這項比較中的 Anthropic 部分目前僅能透過 Anthropic 取得,而 Google 部分則可從今天起向我們以如上所示的價格呼叫。

A screenshot of the OrcaRouter catalogue page for Gemini 3.8 Flash, showing the model identifier in provider-slash-model form, the provider Google, the model description and a stat strip carrying the per-million-token input and output rates alongside the context window and maximum output.

哪一個,以及給誰?

如果你的工作是文字輸入、文字輸出,提示詞低於 100,000 個 token,而且是為了實際用量按 token 付費,那麼 Claude Haiku 5.5 在這篇文章的每一項衡量標準上都是較便宜的模型,也是在唯一共同評比榜上得分較高的那一個——但附帶條件是,這項優勢在每項任務成本上是六倍,而非標價所暗示的十倍。

如果你需要音訊或視訊輸入,或者你需要 65K 以上的回應,或者你的提示經常很長,那麼盤算就不同了:Gemini 3.8 Flash 能接受 Ant​hropic 的小型層級無法處理的輸入,而超過 100,000 個 token 之後,Ant​hropic 自家的第二層級定價遠高於 Google 的固定費率。

唯一要牢牢抓緊的就是那些日期。Google 的費率到年底前都很划算,之後就翻倍。Ant​hropic 的則是標示為固定費率,另有一個依長度分階的級距。無論你最後落在哪一邊,都要先把時程表建進試算表裡,再去建置流程。