
Claude Haiku 5.5 對上 Gemini 3.5 Flash-Lite:每個 Token 更便宜,每個答案更昂貴
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Haiku 5.5 每百萬個輸入 token 收費 0.10 美元,每百萬個輸出 token 收費 0.50 美元。Gemini 3.5 Flash-Lite 在同樣這兩項計費標準上則收費 0.30 美元與 2.50 美元。Anthropic 這款模型的輸入價格只有三分之一,輸出價格只有五分之一,而且在 Artificial Analysis Intelligence Index v4.3.2 上拿下 43.40 分,對手僅有 22.2 分——在一個相差十分就代表世代躍進的領域裡,這是超過二十分的差距。就價目表而言,這不是一場勢均力敵的比較;就能力而言,同樣也不是。
在帳單上,兩者差距不大,而且結果正好相反。把兩個模型放上同一個獨立排行榜,並以完成的任務而非 token 向它們各自計費,Gemini 3.5 Flash-Lite 反而{{2}}每個答案更便宜{{/2}}。每個答案更便宜Artificial Analysis 將 Claude Haiku 5.5 列為每項 Intelligence Index 任務 $0.21,而 Gemini 3.5 Flash-Lite 為 $0.1235——對於每輸出一個 token 就得付五倍費用的模型來說,這是 1.7 比 1 的優勢。
這種反轉就是這項比較的全部。Claude Haiku 5.5 取代了 Anthropic 歷來推出過最便宜的一層,並在共享排行榜上擊敗了附近的所有對手。Gemini 3.5 Flash-Lite 於 2026 年 7 月 21 日發布,自夏季以來一直是這個區間的超值首選。買家真正要問的問題不是哪一個更好,因為這個答案已經塵埃落定。而是該把哪一個用來處理必須便宜回傳的請求。
以下所有內容均以每百萬個詞元計算,單位為美元。定價表中的價格是各供應商自行公布的費率。歸屬於 Artificial Analysis 的獨立評分、每項任務成本數據與速度測量結果,均為該評測機構所有。Gemini 3.5 Flash-Lite 的延遲數據來自我們自家計量流量。若某項數字是取自我們所持有的模型紀錄,而非當日從該評測機構頁面讀取,我們便將該評測機構視為來源,而非我們自己。
貼紙與發票不符
每項任務的成本差距無法用價目表解釋,而這個差距存在的原因,值得在任一模型接近正式環境之前先弄清楚。
Claude Haiku 5.5 很冗長,而評測者也明明白白地這麼說。在執行 Intelligence Index 時,Artificial Analysis 記錄到該模型產生了 4.4 億個輸出 token,而整體中位數為 1 億個,並將其標記為非常冗長。思考會以輸出計費,思考預設為開啟,且 effort dial 的起始值為中等,而低廉的輸入費率對帳單主要來自輸出的工作負載並沒有幫助。
Gemini 3.5 Flash-Lite 也不算簡潔,但以每項工作而言,其成本明顯較低。同一個看板記錄到,它每完成一個索引任務會輸出 17,507 個 token——其中 10,405 個是推理,7,102 個是答案。將此與 Anthropic 模型的 token 量相比,算術結果就清楚了:輸出速率上五比一的優勢,部分被一個會產生較大回應的模型所消耗,而在任務層面上留存下來的,是小幅劣勢而非大幅優勢。
還有第二個更隱晦、方向相同的效應正在發生。Anthropic 的文件指出,Claude Haiku 5.5 使用與 Claude 4.7 及後續版本共用的分詞器,因此同一段文字所計算出的 token 數,會比它所取代的模型大約多出 30%。相較於 Google 的方案層級,費率降為原本的三分之一。token 數量並沒有下降,而且在同一段文字上反而增加了。
兩款型號,在關鍵數字上
快取費率與定價來自 Anthropic 與 Google 自家文件;獨立數據引用自 Artificial Analysis;即時延遲則取自我們自家七天流量區間。快取於 2026-10-08。

• 輸入 — Claude Haiku 5.5:$0.10,適用於最多 100,000 個 token,超出後為 $0.50;Gemini 3.5 Flash-Lite:在 1,048,576 個 token 的視窗內一律 $0.30。
• 輸出 — Claude Haiku 5.5:0.50 美元(100,000 個 token 以內),超過則為 2.50 美元;Gemini 3.5 Flash-Lite:一律 2.50 美元。
• 快取輸入 —— Claude Haiku 5.5 每百萬個 token 中,前 100,000 個為 $0.01,超過部分為 $0.05;Gemini 3.5 Flash-Lite 為 $0.03。Claude Haiku 5.5 的快取寫入費用為每百萬個 token $0.125 與 $0.625。
• 上下文與輸出 —— 各為一百萬個詞元。Claude Haiku 5.5 的最大輸出量為 128,000 個詞元,而 Gemini 3.5 Flash-Lite 為 65,536 個,因此 Anthropic 的上限大約是兩倍。
• 輸入模態 — Claude Haiku 5.5 支援文字與圖片;Gemini 3.5 Flash-Lite 支援文字、圖片、影片、音訊與檔案。兩者皆回傳文字。
• 獨立評分——Claude Haiku 5.5(Max)獲 43.40 分,在 Intelligence Index v4.3.2 的 182 個模型中排名第二;相較之下,Gemini 3.5 Flash-Lite 為 22.2 分,在 147 個中排名第九十六,位居該排行榜的第 34 百分位。
• 每項任務的獨立成本 — 在同一塊板上為 $0.21,相較之下為 $0.1235。
• 吞吐量 — Artificial Analysis 測得 Claude Haiku 5.5 為每秒 241.9 個輸出 token,而 Gemini 3.5 Flash-Lite 在我們自家測試平台上於過去七天測得 280.0。這是兩套不同的測試框架,而非同一套,因此請把它們視為數量級上的參考,而不是一場競速。
二十一點,以及它們由什麼構成
在一項分數可達六十幾分的指標上,二十一點的差距並不是小幅落差。這是能撐起代理迴圈的模型,與應該只交給單一規格明確呼叫的模型之間的差別。
這兩家廠商不會互相量測對方的測試框架,因此它們各自的測試套件無法直接對齊比較。Anthropic 公布了 Claude Haiku 5.5 在 GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0 與 FrontierCode 上的成績;Google 則針對 Flash-Lite 等級公布自家的一組結果;雙方都沒有跑對方的測試。唯一可得的同基準比較來自獨立排行榜,而在那裡,Anthropic 的模型領先的幅度一點也不小。
評估者對 Gemini 3.5 Flash-Lite 的子分數,將該層級的樣貌記錄在案。它在 GPQA Diamond 上取得 8.8%,在 SWE-Bench Pro 上 54.2%,Terminal-bench 2.1 上 54%,SciCode 上 41.3%,MLE-Bench 上 39.2%,Humanity's Last Exam 上 18.8%。這些數字屬於一個稱職、便宜、通用型層級——在知識性問題上表現強勁,但在最困難的推理與研究評估上明顯落後。Claude Haiku 5.5 在綜合分數上為 43.40,完全屬於另一個等級,而實際解讀是:需要在長遠時間跨度上進行多步驟規劃的工作,根本不是 Google 的差事。
視窗為一百萬個 token,答案為 65,536 個 token。
這兩個上下文視窗大小相同,但它們並非同一款產品。
在 Gemini 3.5 Flash-Lite 上,長脈絡會隨著距離衰減,而這種衰減值得在信任它之前先衡量其代價。在 GDM-MRCR v2 這項八針檢索評估中,當針位於 128,000 個 token 之內時,它平均為 72.2%,而在百萬 token 的逐點變體上則為 21.3%。其長脈絡召回率數字為 76%,而 CharXiv Reasoning 在沒有工具時為 74.5%,有工具時為 76.5%。百萬 token 的視窗是一項真實的能力;能從其最遠端可靠地檢索則是較小的一項能力,而上述兩個數字正是兩者之間的差距。Claude 模型的視窗尚未以同樣的方式在同一個評測板上測量過,因此沒有可用的對等數字,而本文不會憑空捏造一個。
輸出上限是更立即有用的差異。Claude Haiku 5.5 會在單一回應中輸出 128,000 個詞元;Gemini 3.5 Flash-Lite 則停在 65,536 個。如果你想拿回的成品是長檔案、完整的遷移、生成的測試套件,或逐字稿規模的改寫,這兩個模型中有一個能在單次呼叫中產出,另一個則辦不到——而把一項工作拆成兩次呼叫,成本會超過單次呼叫的兩倍,因為共用的前綴會被傳送兩次。

音訊與視訊不是價格問題
Gemini 3.5 Flash-Lite 以與文字相同的費率接受影片、音訊和檔案。Claude Haiku 5.5 接受文字和圖片。
對於一條會接收通話錄音、螢幕擷取或監控影片的管線而言,真正重要的能力差異並不是那二十一個指標分數,而在於:這兩個模型中,有一個直接接收輸入,另一個則需要在它前面加上轉錄或影格擷取階段——也就是第二個模型、第二筆帳單,以及一個卡在來源與答案之間的新失效模式。處於這種位置的團隊,並不是在兩個便宜等級之間做選擇。他們是在一個模型與一條管線之間做選擇。
圖像與文件的情況則恰好相反。兩個模型都能原生讀取圖像,而 Claude Haiku 5.5 在綜合指標上取得 43.40,因此,若某項工作負載是頁面圖像擷取或圖表理解、且其中完全不涉及音訊,那麼依數字來看,它該歸在 Anthropic 這一邊,而不是靠模態的論述來決定。
從這裡執行兩者之一
Gemini 3.5 Flash-Lite 已在 OrcaRouter 目錄上架,採用 Google 的標價、零加成,這代表供應商的費率是直接傳遞而非混合計算,Google 價目表的變動會在他們收到當天就反映到你的帳單上。對 Google 這個層級而言,只需一組金鑰與一套 SDK,就能與同樣在目錄中的 Claude Sonnet 5.5 和 Claude Opus 5.5 並用——因此要在 Google Flash-Lite 那一支與 Anthropic 那一支之間做 A/B 測試,已經是一項設定,而不是整合專案。自動容錯移轉就位於底層,因此任一支線都不是單點故障,而路由 DSL 會在路由中表達升級邏輯,如果那才是該邏輯該放置的地方。
那一段的延遲概況取決於我們自己的量測,而非供應商的。在過去七天的即時流量中,Gemini 3.5 Flash-Lite 在每秒 280 個輸出符元下,維持 p50 為 2,426 毫秒、p95 為 8,600 毫秒,錯誤率為 0.313%。請把它當成滾動視窗來解讀,而不是承諾:它會隨流量與供應商狀況變動,而對特定管線而言,真正值得信賴的數字,是你自己在一週後量測出來的那個。

Claude Haiku 5.5 尚未收錄於目錄中。它於 2026 年 10 月 7 日發布——就在本文撰寫的前一天——而我們目前無法對其進行路由,因此這項比較中 Anthropic 那一邊,現階段只能透過 Anthropic 觸及。把這點明說,總比留給讀者自行意會來得好。模型發布與模型能透過我們呼叫之間存在時間差,這是常態,並不是對何時補上的承諾;而正在規劃遷移的讀者,應該依照他們看得見的時程來規劃,而不是依照他們偏好的那一個。
哪一個,以及給誰?
如果工作是文字進、文字出,如果提示詞在 100,000 個 token 以下,而且任務需要多步驟規劃或長時程代理,Claude Haiku 5.5 是更強的模型,領先二十一點,而且每 token 更便宜,便宜三到五倍。請以每項任務成本而非價目表來編列預算,對獨立評測委員會所衡量的那類工作預期約為 $0.21,並且在預測任何事之前重新計算你的提示詞,因為光是 tokenizer 的變更本身就會讓計數改變約百分之三十。
如果工作簡短、量大,而且成果就是答案形態——一個標籤、一個分類、一次擷取、一個護欄判斷——那麼這筆算術就會偏向 Gemini 3.5 Flash-Lite,而且理由一點也不光鮮。一次幾乎沒什麼輸出的呼叫,帳單主要由輸入主宰;兩個輸入費率是 $0.30 對上 $0.10,而 Google 模型的任務足跡短得多,這意味著較便宜的費率會贏下完成後的工作,即使它在標價上輸了。一旦加上影片、音訊或檔案輸入,選擇就完全不再與價格有關了。
這個組合真正確定的結論,比「新的 Haiku 很便宜」還要狹窄。它確定的是:便宜層級的宣傳費率,並不是那個層級實際會讓你花多少錢的好指標;而在定價頁面上看起來貴上三倍的模型,可能反而寄給你金額更低的帳單。無論你最後站在哪一邊,要衡量的是你輸出的 token,而不是你送出的 token,因為在這兩個模型上,帳單真正依據的計量器就是前者。
