為「Claude Haiku 5.5 vs Gemma 4 12B」生成的主視覺卡片,以一條細線分隔成兩個面板:左側標示「Claude Haiku 5.5」,帶有「指數 43」與「專有 API」;右側標示「Gemma 4 12B」,帶有「指數 14」與「Apache 2.0 權重」。頁尾一行寫著「分數依 Artificial Analysis 計算」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對決 Gemma 4 12B:一款你能握在手中的權重模型,對抗供應商 API

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5 與 G​emma 4 12B 其實並非真正在爭奪同一個位置,而最快看出這一點的方法,只需一句話:其中一款以 Apache-2.0 權重形式發布,你可以下載、量化,並在自己的硬體上執行;另一款則只存在於 API 之後。Claude Haiku 5.5 於 2026 年 10 月 7 日問世,立刻重新定義了小型層級所能拿下的分數——在獨立的 Artificial Analysis Intelligence Index 上拿下 43 分。G​emma 4 12B 在同一份榜單上則是 14 分。這個差距極為巨大,而這並不是大多數團隊最終會在兩者之間做選擇的原因。

選擇通常在任何基準測試被參考之前就已經被迫確定:一條受監管、無法將權杖傳送給外部廠商的流程管線;一台沒有可靠對外連線的邊緣裝置;以毫秒為單位衡量的延遲預算;或是一項封閉式 API 永遠無法滿足的微調需求。如果這些情況沒有一項適用於你,那答案就毫無懸念。如果有一項適用,分數差距就不再重要,部署限制會決定一切。

董事會衡量了什麼,以及何時衡量

以下這些獨立數據來自 Artificial Analysis,而供應商費率則來自 A​nthropic 與 G​oogle 自家的文件。它們是兩種不同的數字,全文均如此標示。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemma 4 12B - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Gemma 4 12B column reads independent score 14 (AA, #21 of 142), weights Apache 2.0 12B dense, context 262,000 tokens, input price $0.10 / 1M, output price $0.30 / 1M and throughput 113.1 tok/s. A footer line reads 'Both columns per Artificial Analysis; pricing per each vendor.'

• 獨立評分 — Claude Haiku 5.5 在 Intelligence Index 上獲 43 分,於 182 個模型中排名第二。Gemma 4 12B (Reasoning) 獲 14 分,在同級 142 個模型中排名第 21。差距達 29 分。

• 每百萬個 token 的輸入價格 — Claude Haiku 5.5 為 $0.10(最多 100,000 個 token),超過後為 $0.50;G​emma 4 12B 為 $0.10。

• 每百萬個 token 的輸出價格 — Claude Haiku 5.5 為 $0.50(最多 100,000 個 token),超過則為 $2.50;Gemma 4 12B 為 $0.30。

• 上下文視窗 — Claude Haiku 5.5 為 1,000,000 個詞元;G​emma 4 12B 為 262,000 個。

• 吞吐量 — Claude Haiku 5.5 為每秒 240.4 個輸出 token;G​emma 4 12B 為 113.1,首個 token 時間為 2.48 秒。

• 每完成一項 Index 任務的成本 — Claude Haiku 5.5 為 $0.21。Gemma 4 12B 每 token 便宜到讓董事會的綜合數據落在每百萬個 token $0.12,但推導出的每項任務成本並不是應該用來決定這項比較的數字。

• 權重 — G​emma 4 12B 採 Apache 2.0,可下載,約 120 億參數的稠密模型。Claude Haiku 5.5 是專有軟體;沒有釋出權重,也沒有任何相關計畫。

• 年齡 — Gemma 4 12B 自 2026 年 6 月起推出。Claude Haiku 5.5 在本文撰寫時才推出兩天。

差距是 29 分,而價格差距幾乎沒有。

再看一次這兩列價格:輸入雙方都是 $0.10,輸出則是 $0.30 對上 $0.50。G​emma 4 12B 比較便宜,而且差距小到會被 token 數量淹沒——Claude Haiku 5.5 較新的 tokenizer 意味著同樣的文字會變成大約多 30% 的 token,所以 G​emma 這邊表面上 40% 的輸出費率優勢,反映在實際帳單上幾乎算是打平。

所以,你幾乎付一樣的價錢,買到的是在 Index 上落後 29 分的模型;或者,你幾乎付一樣的價錢,買到的是在 Index 上領先 29 分的模型——這取決於你先讀哪一欄。這才是誠實的定調,應該直白說清楚:在任何兩個模型都能完成的任務上,以定價來說,Claude Haiku 5.5 都是更划算的選擇,而且它勝出的幅度,絕非對較小的模型做再多提示工程就能追平。

因此,有趣的問題並不是「哪個比較好」。而是「我的佇列中,G​emma 4 12B 會在哪幾項任務上失敗」,而這個問題的答案,才是唯一決定這項比較的因素。

權重能帶給你什麼 API 無法做到的事

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Intelligence Index of 14 at rank 21 of 142, speed rank 19 of 142, input $0.10 and output $0.30, 113.1 output tokens per second, a summary noting text, image, speech and video input with text output and a 262k-token context window, and the note that the score places it well above the median of 8 for comparable models.

一個已下載的模型是一種不同類型的資產,其優勢是結構性的,而非漸進式的。

• 資料邊界——採用 Gemma 4 12B,整個流程中完全沒有供應商介入。對於醫療、法律、國防或金融類的工作負載而言,這往往正是唯一真正重要的條件,而再高的分數也無法讓 API 變得可接受。

• 固定成本而非變動成本——一個量化至四位元的 12B 稠密模型,能從容放進單一現代加速器。到了那個階段,每個 token 的邊際成本就是電力,而工作負載可以依機器規模來規劃,而不是依電錶。

• 沒有對外流量、沒有網路延遲——地端 12B 模型能在毫秒間給出答案,因為沒有任何東西離開這台機器。供應商 API 得付出往返傳輸與冷啟動尾延遲的代價,而邊緣部署根本沒有這些負擔。

• 微調與蒸餾——你可以用自己的資料調校 Gemma 4 12B,把 adapter 發布出去並將其凍結。至於 Anthropic 究竟會不會有一天讓你微調 Haiku 等級的模型,這可不是你能拿來規劃產品路線圖的依據。

• 為你的發展藍圖設下底線——權重不會在你腳下被淘汰。Anthropic 已承諾在 2027 年 10 月 7 日之前不會讓 Claude Haiku 5.5 退役,這很大方,但帶有日期的承諾終究還是帶有日期的承諾。

• 說來奇怪,多模態這點——排行榜記錄顯示 G​emma 4 12B 可接受文字、圖像、語音與影片輸入並輸出文字,輸入範圍比 Claude Haiku 5.5 的文字加圖像更廣。對於要在沒有獨立轉錄服務的情況下直接吃進音訊的本機處理流程而言,這是 API 那一側所不具備的實質能力。

A screenshot of the Hugging Face model card for gemma-4-12B, showing the Google uploader, the 'Any-to-Any' and 'Transformers / Safetensors' tags, the gemma4_unified_image-text-to-text identifier, 'Eval Results', 'Model card', 'Files and versions' and 'Community' tabs, a licence line reading 'License: Apache 2.0, Authors: Google DeepMind', and the opening of the card describing the Gemma 4 12B Unified model as sharing the multimodal functionality of Gemma 4 E2B and E4B with native audio and vision understanding and no separate encoders.

12B 經不起接觸考驗之處

同一個用來衡量那 29 分差距的評測板,也記錄了小型稠密模型無法做好的事情,而略過這些會是不誠實的:

• 長上下文 — 262,000 個 token,對比 1,000,000。一條把整個程式碼庫或一整年的紀錄塞進單一提示的管線,在 Gemma 4 12B 上根本行不通,而將它切塊丟進檢索迴圈,只會增加更大的視窗本來就能避免的工程負擔。

• 代理式與電腦操作類工作——這類任務的特點在於,小型模型一旦失手,往往是無聲且代價高昂的。Anthropic 自家廠商公布的數據顯示,Claude Haiku 5.5 在 OSWorld 2.1 上達到 72.4%,而前一代 Haiku 僅有 15.7%;一個索引分數只有 14 的 12B 模型,並不是勝任這份工作的工具,而即使考慮到目前尚無獨立測試重現這些數字,這裡的廠商數據仍是個有用的訊號。

• 在共享機群上的每美元吞吐量——在託管執行個體上每秒 113 個 token 是可以接受的,但自行架設的理由並不是速度,而且單 GPU 部署還會更慢。

• 沒有現成的備援——如果你在正式環境中執行 Gemma 4 12B,自家硬體故障就是你的服務中斷,除非你自己另建一套,否則沒有第二家供應商可以接手。

透過單一端點執行其中任一個

OrcaRouter 今日已在目錄中收錄 Gemma 4 31B 與 Gemma 4 26B-A4B,以 Google 的定價提供,零加成,但並未收錄 12B——這一點值得直說,而不是含糊暗示相反的情況。12B 可透過供應商自家的發布管道及數個第三方平台取得。Claude Haiku 5.5 同樣尚未登上目錄;它可透過 Anthropic 的 API 及各大雲端服務取得。

路由器真正提供的,正是這項比較實際所需的形態。將廉價本地模型與昂貴 API 模型做合理部署,並不是分岔——而是一條路線:G​emma 4 12B 或代管的 G​emma 4 變體負責回應大多數簡單的請求,而觸發品質或長度條件的請求則升級到 A​nthropic 路線。Claude Haiku 4.5、Claude Sonnet 5.5 與 Claude Opus 5.5 現在已在目錄中,因此即使小型層級的路線尚未可用,升級路徑也能先建置並進行負載測試。在 OrcaRouter 上,這種組合是一條路由 DSL 表達式與自動容錯移轉,而不是你得維護的服務;而且供應商標價以 0% 加成原樣傳遞,任何路線的價格變動都會在發生的當天即時生效。

規則

請選 Claude Haiku 5.5,除非有某項限制將它排除。它的 Index 分數領先 Gemma 4 12B 29 分,而兩者定價幾乎相同;它能處理一百萬個 token 的上下文,而且在兩者都能嘗試的每一項任務上,它都是更強的模型。這場比較無論怎麼看,12B 都不可能憑實力勝出。

當限制本身就是重點時,就選 G​emma 4 12B——當 token 不能離開你的內部環境,當預算是一台機器而不是一個計費錶,當你需要微調,或當你需要的是握在手中的權重,而不是一張費率表和一個退役日期。這些不是偏好,而是要求;而面對一項要求,29 分的差距根本不是決定性的數字。