為「每詞元更便宜,每個答案更貴」生成的主視覺卡片,標上「每個答案成本」徽章,引言標題為「兩個便宜等級,一個共用排行榜」,副標題是「在 Intelligence Index v4.3.2 上,Claude Haiku 5.5 為 43.40,對上 Gemini 3.5 Flash-Lite 的 22.2」。四個資訊晶片寫著「43.40 對 22.2」、「$0.21 對 $0.12」、「$0.10 對 $0.30」與「$0.50 對 $2.50」。下方兩張卡片標示為「ANTHROPIC 的優勢」(「在共用排行榜上高出二十一分,且在兩項指標上都更便宜」)與「GOOGLE 的優勢」(「完成一項任務更便宜,而且支援影片與音訊」)。頁尾寫著「獨立評分與每項任務成本來自 Artificial Analysis;定價讀取於 2026 年 10 月 8 日」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對上 Gemini 3.5 Flash-Lite:每個 Token 更便宜,每個答案更昂貴

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5 每百萬個輸入 token 收費 0.10 美元,每百萬個輸出 token 收費 0.50 美元。Gemini 3.5 Flash-Lite 在同樣這兩項計費標準上則收費 0.30 美元與 2.50 美元。Anthropic 這款模型的輸入價格只有三分之一,輸出價格只有五分之一,而且在 Artificial Analysis Intelligence Index v4.3.2 上拿下 43.40 分,對手僅有 22.2 分——在一個相差十分就代表世代躍進的領域裡,這是超過二十分的差距。就價目表而言,這不是一場勢均力敵的比較;就能力而言,同樣也不是。

在帳單上,兩者差距不大,而且結果正好相反。把兩個模型放上同一個獨立排行榜,並以完成的任務而非 token 向它們各自計費,Gemini 3.5 Flash-Lite 反而{{2}}每個答案更便宜{{/2}}。每個答案更便宜Artificial Analysis 將 Claude Haiku 5.5 列為每項 Intelligence Index 任務 $0.21,而 Gemini 3.5 Flash-Lite 為 $0.1235——對於每輸出一個 token 就得付五倍費用的模型來說,這是 1.7 比 1 的優勢。

這種反轉就是這項比較的全部。Claude Haiku 5.5 取代了 Ant​hropic 歷來推出過最便宜的一層,並在共享排行榜上擊敗了附近的所有對手。Gemini 3.5 Flash-Lite 於 2026 年 7 月 21 日發布,自夏季以來一直是這個區間的超值首選。買家真正要問的問題不是哪一個更好,因為這個答案已經塵埃落定。而是該把哪一個用來處理必須便宜回傳的請求。

以下所有內容均以每百萬個詞元計算,單位為美元。定價表中的價格是各供應商自行公布的費率。歸屬於 Artificial Analysis 的獨立評分、每項任務成本數據與速度測量結果,均為該評測機構所有。Gemini 3.5 Flash-Lite 的延遲數據來自我們自家計量流量。若某項數字是取自我們所持有的模型紀錄,而非當日從該評測機構頁面讀取,我們便將該評測機構視為來源,而非我們自己。

貼紙與發票不符

每項任務的成本差距無法用價目表解釋,而這個差距存在的原因,值得在任一模型接近正式環境之前先弄清楚。

Claude Haiku 5.5 很冗長,而評測者也明明白白地這麼說。在執行 Intelligence Index 時,Artificial Analysis 記錄到該模型產生了 4.4 億個輸出 token,而整體中位數為 1 億個,並將其標記為非常冗長。思考會以輸出計費,思考預設為開啟,且 effort dial 的起始值為中等,而低廉的輸入費率對帳單主要來自輸出的工作負載並沒有幫助。

Gemini 3.5 Flash-Lite 也不算簡潔,但以每項工作而言,其成本明顯較低。同一個看板記錄到,它每完成一個索引任務會輸出 17,507 個 token——其中 10,405 個是推理,7,102 個是答案。將此與 Ant​hropic 模型的 token 量相比,算術結果就清楚了:輸出速率上五比一的優勢,部分被一個會產生較大回應的模型所消耗,而在任務層面上留存下來的,是小幅劣勢而非大幅優勢。

還有第二個更隱晦、方向相同的效應正在發生。Anthropic 的文件指出,Claude Haiku 5.5 使用與 Claude 4.7 及後續版本共用的分詞器,因此同一段文字所計算出的 token 數,會比它所取代的模型大約多出 30%。相較於 Google 的方案層級,費率降為原本的三分之一。token 數量並沒有下降,而且在同一段文字上反而增加了。

兩款型號,在關鍵數字上

快取費率與定價來自 Anthropic 與 Google 自家文件;獨立數據引用自 Artificial Analysis;即時延遲則取自我們自家七天流量區間。快取於 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• 輸入 — Claude Haiku 5.5:$0.10,適用於最多 100,000 個 token,超出後為 $0.50;Gemini 3.5 Flash-Lite:在 1,048,576 個 token 的視窗內一律 $0.30。

• 輸出 — Claude Haiku 5.5:0.50 美元(100,000 個 token 以內),超過則為 2.50 美元;Gemini 3.5 Flash-Lite:一律 2.50 美元。

• 快取輸入 —— Claude Haiku 5.5 每百萬個 token 中,前 100,000 個為 $0.01,超過部分為 $0.05;Gemini 3.5 Flash-Lite 為 $0.03。Claude Haiku 5.5 的快取寫入費用為每百萬個 token $0.125 與 $0.625。

• 上下文與輸出 —— 各為一百萬個詞元。Claude Haiku 5.5 的最大輸出量為 128,000 個詞元,而 Gemini 3.5 Flash-Lite 為 65,536 個,因此 Anthropic 的上限大約是兩倍。

• 輸入模態 — Claude Haiku 5.5 支援文字與圖片;Gemini 3.5 Flash-Lite 支援文字、圖片、影片、音訊與檔案。兩者皆回傳文字。

• 獨立評分——Claude Haiku 5.5(Max)獲 43.40 分,在 Intelligence Index v4.3.2 的 182 個模型中排名第二;相較之下,Gemini 3.5 Flash-Lite 為 22.2 分,在 147 個中排名第九十六,位居該排行榜的第 34 百分位。

• 每項任務的獨立成本 — 在同一塊板上為 $0.21,相較之下為 $0.1235。

• 吞吐量 — Artificial Analysis 測得 Claude Haiku 5.5 為每秒 241.9 個輸出 token,而 Gemini 3.5 Flash-Lite 在我們自家測試平台上於過去七天測得 280.0。這是兩套不同的測試框架,而非同一套,因此請把它們視為數量級上的參考,而不是一場競速。

二十一點,以及它們由什麼構成

在一項分數可達六十幾分的指標上,二十一點的差距並不是小幅落差。這是能撐起代理迴圈的模型,與應該只交給單一規格明確呼叫的模型之間的差別。

這兩家廠商不會互相量測對方的測試框架,因此它們各自的測試套件無法直接對齊比較。Anthropic 公布了 Claude Haiku 5.5 在 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 與 FrontierCode 上的成績;Google 則針對 Flash-Lite 等級公布自家的一組結果;雙方都沒有跑對方的測試。唯一可得的同基準比較來自獨立排行榜,而在那裡,Anthropic 的模型領先的幅度一點也不小。

評估者對 Gemini 3.5 Flash-Lite 的子分數,將該層級的樣貌記錄在案。它在 GPQA Diamond 上取得 8.8%,在 SWE-Bench Pro 上 54.2%,Terminal-bench 2.1 上 54%,SciCode 上 41.3%,MLE-Bench 上 39.2%,Humanity's Last Exam 上 18.8%。這些數字屬於一個稱職、便宜、通用型層級——在知識性問題上表現強勁,但在最困難的推理與研究評估上明顯落後。Claude Haiku 5.5 在綜合分數上為 43.40,完全屬於另一個等級,而實際解讀是:需要在長遠時間跨度上進行多步驟規劃的工作,根本不是 Goo​gle 的差事。

視窗為一百萬個 token,答案為 65,536 個 token。

這兩個上下文視窗大小相同,但它們並非同一款產品。

在 Gemini 3.5 Flash-Lite 上,長脈絡會隨著距離衰減,而這種衰減值得在信任它之前先衡量其代價。在 GDM-MRCR v2 這項八針檢索評估中,當針位於 128,000 個 token 之內時,它平均為 72.2%,而在百萬 token 的逐點變體上則為 21.3%。其長脈絡召回率數字為 76%,而 CharXiv Reasoning 在沒有工具時為 74.5%,有工具時為 76.5%。百萬 token 的視窗是一項真實的能力;能從其最遠端可靠地檢索則是較小的一項能力,而上述兩個數字正是兩者之間的差距。Claude 模型的視窗尚未以同樣的方式在同一個評測板上測量過,因此沒有可用的對等數字,而本文不會憑空捏造一個。

輸出上限是更立即有用的差異。Claude Haiku 5.5 會在單一回應中輸出 128,000 個詞元;Gemini 3.5 Flash-Lite 則停在 65,536 個。如果你想拿回的成品是長檔案、完整的遷移、生成的測試套件,或逐字稿規模的改寫,這兩個模型中有一個能在單次呼叫中產出,另一個則辦不到——而把一項工作拆成兩次呼叫,成本會超過單次呼叫的兩倍,因為共用的前綴會被傳送兩次。

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

音訊與視訊不是價格問題

Gemini 3.5 Flash-Lite 以與文字相同的費率接受影片、音訊和檔案。Claude Haiku 5.5 接受文字和圖片。

對於一條會接收通話錄音、螢幕擷取或監控影片的管線而言,真正重要的能力差異並不是那二十一個指標分數,而在於:這兩個模型中,有一個直接接收輸入,另一個則需要在它前面加上轉錄或影格擷取階段——也就是第二個模型、第二筆帳單,以及一個卡在來源與答案之間的新失效模式。處於這種位置的團隊,並不是在兩個便宜等級之間做選擇。他們是在一個模型與一條管線之間做選擇。

圖像與文件的情況則恰好相反。兩個模型都能原生讀取圖像,而 Claude Haiku 5.5 在綜合指標上取得 43.40,因此,若某項工作負載是頁面圖像擷取或圖表理解、且其中完全不涉及音訊,那麼依數字來看,它該歸在 Anthropic 這一邊,而不是靠模態的論述來決定。

從這裡執行兩者之一

Gemini 3.5 Flash-Lite 已在 OrcaRouter 目錄上架,採用 Google 的標價、零加成,這代表供應商的費率是直接傳遞而非混合計算,Google 價目表的變動會在他們收到當天就反映到你的帳單上。對 Google 這個層級而言,只需一組金鑰與一套 SDK,就能與同樣在目錄中的 Claude Sonnet 5.5 和 Claude Opus 5.5 並用——因此要在 Google Flash-Lite 那一支與 Anthropic 那一支之間做 A/B 測試,已經是一項設定,而不是整合專案。自動容錯移轉就位於底層,因此任一支線都不是單點故障,而路由 DSL 會在路由中表達升級邏輯,如果那才是該邏輯該放置的地方。

那一段的延遲概況取決於我們自己的量測,而非供應商的。在過去七天的即時流量中,Gemini 3.5 Flash-Lite 在每秒 280 個輸出符元下,維持 p50 為 2,426 毫秒、p95 為 8,600 毫秒,錯誤率為 0.313%。請把它當成滾動視窗來解讀,而不是承諾:它會隨流量與供應商狀況變動,而對特定管線而言,真正值得信賴的數字,是你自己在一週後量測出來的那個。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 尚未收錄於目錄中。它於 2026 年 10 月 7 日發布——就在本文撰寫的前一天——而我們目前無法對其進行路由,因此這項比較中 Ant​hropic 那一邊,現階段只能透過 Ant​hropic 觸及。把這點明說,總比留給讀者自行意會來得好。模型發布與模型能透過我們呼叫之間存在時間差,這是常態,並不是對何時補上的承諾;而正在規劃遷移的讀者,應該依照他們看得見的時程來規劃,而不是依照他們偏好的那一個。

哪一個,以及給誰?

如果工作是文字進、文字出,如果提示詞在 100,000 個 token 以下,而且任務需要多步驟規劃或長時程代理,Claude Haiku 5.5 是更強的模型,領先二十一點,而且每 token 更便宜,便宜三到五倍。請以每項任務成本而非價目表來編列預算,對獨立評測委員會所衡量的那類工作預期約為 $0.21,並且在預測任何事之前重新計算你的提示詞,因為光是 tokenizer 的變更本身就會讓計數改變約百分之三十。

如果工作簡短、量大,而且成果就是答案形態——一個標籤、一個分類、一次擷取、一個護欄判斷——那麼這筆算術就會偏向 Gemini 3.5 Flash-Lite,而且理由一點也不光鮮。一次幾乎沒什麼輸出的呼叫,帳單主要由輸入主宰;兩個輸入費率是 $0.30 對上 $0.10,而 Google 模型的任務足跡短得多,這意味著較便宜的費率會贏下完成後的工作,即使它在標價上輸了。一旦加上影片、音訊或檔案輸入,選擇就完全不再與價格有關了。

這個組合真正確定的結論,比「新的 Haiku 很便宜」還要狹窄。它確定的是:便宜層級的宣傳費率,並不是那個層級實際會讓你花多少錢的好指標;而在定價頁面上看起來貴上三倍的模型,可能反而寄給你金額更低的帳單。無論你最後站在哪一邊,要衡量的是你輸出的 token,而不是你送出的 token,因為在這兩個模型上,帳單真正依據的計量器就是前者。