
Claude Haiku 5.5 對比 Gemini 3.6 Flash:每次回答成本高出 7.5 倍,模型分數卻低九分
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Haiku 5.5與Gemini 3.6 Flash在各自產品線中屬於同一層級——小巧、快速、便宜的那一級——而相似之處也僅止於此。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Haiku 5.5 於其 Max 配置下得分 43.40,而 Gemini 3.6 Flash 於其 High 配置下為 33.98。在同一次測試中,Claude Haiku 5.5 完成一項 Index 任務的成本為 $0.21,Gemini 3.6 Flash 則為 $1.60。
要把這組數字一起看,因為單看任何一個都會造成誤解。較便宜的模型不是只便宜一點;它每完成一項任務便宜 7.5 倍。而它所擊敗的模型也不是只弱一點;它弱了 9.42 個指數點,而在一個有 182 個模型的排行榜上,這相當於上四分位與中段之間的距離。
這兩項事實都來自同一次獨立測試,這點很重要,因為這裡的廠商資料卡兩者都沒告訴你。Anthropic 於 2026 年 10 月 7 日推出 Claude Haiku 5.5;Google 則在 2026 年 7 月 21 日發布 Gemini 3.6 Flash。兩者之間相隔的三個月,才是真正耐人尋味的地方。
兩張卡片,並排放置
每百萬個 token 的美元價格。Anthropic 與 Google 的費率來自其各自的定價文件;共用的資料列為 Artificial Analysis Intelligence Index v4.3.2。快取於 2026-10-08。

• 輸入 — Claude Haiku 5.5 10 萬個 token 以內 $0.10,超過則 $0.50;Gemini 3.6 Flash 目前均一價 $0.75,2027 年 1 月 1 日起調漲至 $1.50。
• 輸出 — Claude Haiku 5.5 100,000 個 token 以內 $0.50,超過則 $2.50;Gemini 3.6 Flash 今日均一價 $3.75,同日調升至 $7.50。
• 快取輸入 — Claude Haiku 5.5 $0.01 與 $0.05;Gemini 3.6 Flash $0.075,另加每百萬個 token 每小時 $0.50 的儲存費用。
• 上下文與輸出上限——兩者皆為 100 萬個 token。Claude Haiku 5.5 的回應上限為 128,000 個 token;Gemini 3.6 Flash 則為 65,536 個。
• 模態 — Claude Haiku 5.5 接受文字與圖像。Gemini 3.6 Flash 接受文字、圖像、影片、音訊與檔案。這是 Google 一方明顯領先的唯一一列,而對媒體理解管線而言,這可能決定整個問題。
• 獨立評分 — Claude Haiku 5.5(Max)為 43.40,相較於 Gemini 3.6 Flash(High)的 33.98。
• 每完成一項任務的成本 — 在同一次評估執行中,$0.21 對比 $1.60。

為什麼每任務,而不是每詞元,才是該使用的數字
價目表倍數在輸入端看起來已經是 7.5,在輸出端也是 7.5,所以這裡每項任務的數字並不令人意外——但值得說明為什麼這兩個模型在一項指標上落在相同位置,在另一項上卻相差如此懸殊,因為同樣的算法在這批的其他對決中會得出相反的結果。
Gemini 3.6 Flash 是兩者中較不冗長的那一個。它在每個 Intelligence Index 任務中產生 41,606 個輸出 token——其中 20,061 個用於推理、21,545 個用於回答——而 Claude Haiku 5.5 則是 162,164 個,拆分為 129,047 個推理與 33,118 個回答。Anthropic 的模型做同樣的工作卻花費將近四倍的 token,而且它的輸出速率還是 Google 的七分之一,因此 token 差距與速率差距會相乘,而非互相抵消。
那個組合——低廉的計費乘上高強度使用——是對 Claude Haiku 5.5 經濟效益的誠實描述,而 Anthropic 自家的發布貼文也承認了它的另一面:這個模型「在用於提示最多 100,000 個 token 的任務時特別超值,而這類任務約占我們前一代 Haiku 模型請求的 90%。」超過 100,000 個 token 後,輸入計費會變成 $0.50,輸出計費變成 $2.50,此時相對 Gemini 3.6 Flash 的倍數就會縮小到約 1.5 倍。
在這項比較停滯不前之際,Google 自家的層級做了什麼?
這裡就是這篇文章不再只是兩款模型的比較,而成為一則警告的地方:你實際上是在跟哪個 Gemini 比較。
Google 已讓 Flash 的價格接連三代保持不變。Gemini 3.6 Flash、Gemini 3.7 Flash 和 Gemini 3.8 Flash 在 Google 自家定價文件中全都標示為輸入 $0.75、輸出 $3.75,快取費率同樣是 $0.075,並且同樣在 2027 年 1 月 1 日調漲至 $1.50 和 $7.50。Google 為 3.6 系列製作的說明卡將它描述為「我們前一代的 Flash 模型」,這是該廠商自己的說法。
變動的是分數,不是價格。在獨立排行榜上,Gemini 3.6 Flash 得分 33.98,Gemini 3.7 Flash 39.06,Gemini 3.8 Flash 40.93——全都採用其已公布的最高強度配置。六週內,Google 的 flash 等級中增加了九個指數點,而費率毫無變動。
對任何正在評估的人來說,後果很具體:如果你在三週前用 Gemini 3.7 Flash 測試這組對比,你的結果已經過時;而如果你改用 Gemini 3.8 Flash 測試,與 Claude Haiku 5.5 的差距會縮小到 2.47 分。Gemini 3.6 Flash 是這個比較中最能美化 Anthropic 的版本,也是 Google 最不可能販售的版本。
Artificial Analysis 將 3.6 這個項目標記為已棄用。Google 的定價文件仍公布該費率,其模型清單也仍導向 3.6 的章節,因此誠實的解讀並非「消失了」,而是「在十週內於自家家族中被取代了兩次」——而這是關於這個層級推進速度有多快的事實,不是跳過比較的理由。
這實際上是在替誰決定
Gemini 3.6 Flash 確實有值得選用的理由,而重點不在於分數。
如果你需要在提示中放入音訊或視訊,Claude Haiku 5.5 完全辦不到——它只讀文字和圖像,其他一概不行。Gemini 3.6 Flash 可讀取文字、圖像、視訊、音訊與檔案,而我們自家的產品目錄記錄到,它在過去一週測得的輸出速度為每秒 582 個 token,首個 token 的中位延遲為 4.1 秒,即使以 Flash 的標準來看也算快。對媒體理解流程而言,模態清單就是決策的全部,指數差距不過是附註。
如果你的工作是文字與圖像,這筆帳的差距大到沒什麼好爭的。在以輸入為主、比例為 7:2:1 的混合用量下——這正是大多數生產環境流量呈現的樣態——Claude Haiku 5.5 每百萬個 token 要 $0.077,而 Gemini 3.6 Flash 則是 $0.63。一天若用掉超過一百萬個混合 token,那就是 77 美分對上 $6.30,而且到了 2027 年 1 月 1 日,第二個數字會變得更糟,第一個卻文風不動。
10 萬個 token 的懸崖,是唯一能讓情勢翻轉的條件。一套例行會組出 15 萬個 token 提示的檢索或長文件流程,整個請求都得按 Anthropic 的 $0.50/$2.50 級距計費,而到了那個時候,兩個模型在價格上的差距已在 1.5 倍以內,而 Gemini 3.6 Flash 仍在模態支援上勝出,也在 Google 針對 128k 平均值下的多針檢索所公布的 91.8% 數字上勝出。那是廠商自行回報、且未經重現的數據,就該以這樣的限定框架來看待。

兩者都撥打,或撥打其中一個
Gemini 3.6 Flash 即日起已在 OrcaRouter 目錄上,位於 google/gemini-3.6-flash,以 Google 定價、0% 加價提供——分別為 $0.75 與 $3.75,快取讀取為 $0.075,完全依照供應商收費方式計算。這對這個特定模型格外重要,因為 Google 1 月 1 日的調漲屬於費率變動,而原價轉嫁的目錄會在變動當天就跟進,而不是等到下一次合約續約。一組 API 金鑰與一次 SDK 呼叫,即可使用這個模型或目錄上 200 多個其他模型,因此在 Google 路徑與 Anthropic 路徑之間做 A/B 測試,只需要更改模型字串,底下還有自動容錯移轉,而不必另外做第二套整合。
Claude Haiku 5.5 並不在產品目錄中。Anthropic 的模型可透過 Anthropic 自家的 API,以及 AWS、Google Cloud 和 Microsoft Azure 取得,這就是誠實答覆的全部。我們確實有在該系列中提供的是 Claude Sonnet 5.5 與 Claude Opus 5.5——這正是讓從便宜的分類呼叫升級到中階代理式呼叫的路徑成為一項路由決策、而非一個專案的原因。
這讓結論簡單到可以直說。在短提示長度下的文字與圖像工作上,Claude Haiku 5.5 除了回應上限之外,每個面向都勝出。只要涉及音訊或影片,Gemini 3.6 Flash 就是兩者中唯一還能夠回答的——而如果你打算為這項能力支付 Google 的費率,先問清楚你付費的是哪一款 Gemini,因為在這個層級上,同樣的錢可以從更新的同系列型號多拿到九個指標分數。
一個 API 就能取用 200 多款模型,一組金鑰,底層自動容錯移轉,因此在 Google 支線與 Anthropic 支線之間做 A/B 測試時,只需更改模型字串,而不必再串接第二套整合。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
