
Kolibri 對上 Gemma 4 12B:780 億個參數對比 12,而只有其中一個有分數
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Kolibri與Gemma 4 12B是同一光譜上的兩個極端,而開放權重的發布通常不會讓你以對等條件比較這兩者。Aleph Alpha 的 Kolibri 於 2026 年 10 月 3 日發布:總參數 781 億,每個 token 啟用 34.6 億,經驗證的 1,048,576-token 上下文視窗,僅支援德語與英語,Apache 2.0。Gemma 4 12B 於 2026 年 6 月 3 日發布:119.5 億稠密參數,262,144-token 上下文視窗,支援文字、圖像、音訊與視訊輸入,Apache 2.0。其中一款擁有獨立且可公開重現的評分。另一款則只有供應商的基準測試表格。這種不對稱並非這項比較的附註;它就是這項比較本身,因為買方在意的其他一切——每項任務的成本、每瓦效能、它能否在你的文件上運作——都取決於這一點。
我們應該同樣直截了當地看待這場對決的格局,因為用標題把 78B 模型和 12B 模型配在一起,會引來錯誤的結論。這兩者不是競爭對手。一個是 78 GB 的部署,針對德國公部門與工業文件工作,運行在客戶自有的機架上;另一個是 120 億參數的統一多模態模型,可在筆電上運行,並帶有獨立的指數 14。接下來要說明的是,兩者各自實際上是為了什麼、已公布的數字在哪些地方能與不能讓你將它們排名,以及沒有獨立評分要付出什麼代價。
在這裡你可以信任的那個數字,以及你不能信任的那個數字
Artificial Analysis 已在其推理設定下測量 Gemma 4 12B。根據他們模型頁面所公佈的結果,我們應以此為依據:
• 智慧 — Artificial Analysis Intelligence Index 為 14,這使其在該比較的 142 個模型中排名第 21 位,位居最高等級區間,而可比較模型的中位數為 8。
• 速度 — 每秒 112.5 個輸出 token,在速度檢視中排名第 21(共 142 個),且高於同類模型的 91-token 中位數。
• 價格 — 每百萬個輸入 token 為 $0.10,每百萬個輸出 token 為 $0.30;他們的頁面指出,相較於類似規模與等級模型的中位數 $0.03 與 $0.15,這略嫌昂貴。
• 規格 — 262,144 個 token 的上下文,總參數 12B,Apache 2.0,文字、圖像、語音與視訊輸入,文字輸出。
Artificial Analysis 自家的摘要結論對一個排行榜頁面而言異常直白,而且值得重申:Gemma 4 12B 是智慧方面名列前茅的模型之一,但相較於其他規模相近的開放權重模型,價格稍嫌昂貴。那是來自與任一廠商都無利害關係的第三方,真實、獨立且可重現的評估。
Kolibri 並沒有任何對等的東西。Artificial Analysis 上沒有它的模型頁面,而且在撰寫本文時,尚未有第三方重現這套評估套件。現有的只有 Aleph Alpha 自家的比較表;在該表中,Kolibri 在其任務套件上的英文平均為 75.5,德文平均為 70.8。這些都是在廠商挑選的基準測試組合上、用廠商自己撰寫的測試框架、以推理強度 high 所取得的未加權百分比平均。它們不是 Intelligence Index,而這兩個數字既不能互相換算,也不能並列比較。任何人把「Kolibri 75.5 對上 Gemma 14」當成排名來呈現,都是在把某一個量尺上的百分比,拿來跟另一個量尺上的分數相比。誠實的立場是:Gemma 4 12B 的品質經過實測,而 Kolibri 的品質僅屬宣稱。
廠商表格真正能讓你做的,是橫向讀取各列。Gemma 4 26B-A4B IT 是 Google 自家、與 12B 同屬混合專家架構的兄弟版本,出現在 Aleph Alpha 的表格中,英文 71.9、德文 66.3,兩項都低於 Kolibri。這是目前可取得、最接近交叉檢查的東西,而且附帶同樣的但書:廠商自建測試框架、廠商自家數字。這是微弱訊號,不是證據。

稠密 12B 對上稀疏 78B,並不像表面上看起來那樣不成比例
一旦把每個 token 實際計算的內容納入考量,架構差距就會比參數差距更大。
• 每個 token 的計算量——Gemma 4 12B 在每個 token 上啟用全部 119.5 億個參數。Kolibri 則啟用其 78,103,074,560 個參數中的 3,457,573,120 個,約為整個模型的二十二分之一;每層 384 個專家中,使用 1 個共享專家和 6 個路由專家。
• 記憶體——取捨則往另一個方向發展,而且非常殘酷。Gemma 4 12B 以 bfloat16 格式儲存時,權重大約在 24 GB 之譜。Kolibri 的模型卡則將 FP8 權重標示為約 78 GB,最低需要兩張 A100 80 GB、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300。
• 注意力 — Gemma 4 使用局部滑動視窗注意力與完整全域注意力的混合,且最後一層始終為全域。Kolibri 在 50 個全 MoE 層中,以 4:1 的比例拆分滑動視窗注意力與分組查詢注意力。
• 上下文 — Gemma 4 12B 為 262,144 個 token;Kolibri 原生為 262,144,在無位置縮放的情況下已驗證可達 1,048,576。
所以,對「78B 對上 12B」最誠實的說法是:Kolibri 在啟用成本上勝出,卻在權重佔用上吃虧,而且這兩項優勢都不是白來的。一個每個 token 只啟用 34.6 億個參數的稀疏模型,仍然必須把全部 780 億個參數留在記憶體中,這就是為什麼它的部署門檻是一對 80 GB 加速器,而不是一張消費級顯卡。Gemma 4 12B 則做出相反的取捨:每次生成 token 時,模型有更大比例會被觸發,但它能裝在一般人買得到的硬體上。
在 Kolibri 這一側有個德國特有的細節,改變的是算術,而非排名。根據 Aleph Alpha 自家的測量,其分詞器在德語網頁文本上平均每個詞元為 4.90 位元組,相較之下 Gemini 為 4.13、Qwen3.5–3.8 系列為 4.17、GPT-5 為 4.35。每份德語文件使用更少詞元,可直接降低推論成本;而對於以百萬計的德語行政文本這類工作負載而言,這個效果可能比幾個指數點更有價值。而這也完全是廠商自行回報的數據。

每一個實際上能看到什麼
這裡正是雙方比較不再勢均力敵的地方,而這是一項規格上的事實,而非品質上的主張。Gemma 4 12B 是一個統一的多模態模型:其模型卡描述了一種免編碼器架構,能將原始影像區塊與音訊波形直接投射到語言模型的嵌入空間中,輸入為文字、影像、語音與影片,輸出則為文字。它的設計目標是在消費級裝置上運行,無需另外配置獨立的編碼器。
Kolibri 只讀取兩種語言的文字,其他一概不碰。Aleph Alpha 刻意將此定位為深度重於廣度:兩種語言、經過高度精選,而不是廣泛的多語言混合。它沒有視覺塔、沒有音訊路徑、沒有視訊。如果你的工作負載包含掃描表單、通話錄音或設備照片,那麼 Gemma 4 12B 是候選方案,而 Kolibri 不是,無論基準測試的數據列怎麼說。如果你的工作負載是一批德文與英文文件,且這些文件絕不能離開這棟大樓,那麼反過來才更接近事實——但請注意,「絕不能離開這棟大樓」這項要求,Gemma 4 12B 也同樣能滿足,因為其權重是 Apache 2.0 且可下載。
哪一個比較便宜取決於你買的是什麼
這兩款模型是以無法換算的貨幣計價。Gemma 4 12B 有市場費率:根據 Artificial Analysis 在多家供應商之間的實測,每百萬個 token 分別為 $0.10 與 $0.30,而在路由端點上的 MoE 層級還更便宜。Kolibri 則完全沒有費率,因為 Aleph Alpha 並未為其販售推論服務——這次發布的是權重、技術報告與模型卡。
• Gemma 4 12B 在託管路由上——根據 Artificial Analysis 的數據,每百萬輸入為 $0.10、每百萬輸出為 $0.30。在我們自家的目錄中,MoE 同系列模型 Gemma 4 26B-A4B IT 標價為輸入 $0.06、輸出 $0.33,並具備 262,144 個 token 的視窗;而較大的稠密模型 Gemma 4 31B IT 則為 $0.13 與 $0.38;那些是供應商牌價直接轉嫁,也是我們唯一不會加價的數字。
• 在自己的硬體上跑 Kolibri——78 GB 的權重、來自廠商 aleph-alpha-inference 套件的 vLLM 外掛,以及最低需求為一台 H200 或 B200,或一對 H100 SXM5。成本是一筆資本購置、一個機架槽位,以及一位能執行 vLLM 部署的人力,並依你產生多少 token 來攤提。
那些不是同一種採購,比較的重點也不是「哪個比較便宜」。重點在於工作負載的型態是否足以正當化自行擁有硬體。一個以高流量處理固定、敏感文件語料庫的團隊,在自架方案上可能大幅勝出。一個打造產品功能、每天呼叫模型幾百萬個 token 的團隊,幾乎從來不會如此。
一條實用的中間路線:Gemma 這一層目前已在 OrcaRouter 上,與其他所有服務共用同一個 OpenAI 相容端點,並具備跨供應商的容錯切換,且按供應商定價原價傳遞,每一 token 都不加收任何費用。這讓它成為一種低成本的方法,可在託管路線上實測你實際的 token 用量,再決定 78 GB 的主權部署是否值得。也該坦白說清楚它不是什麼:我們並沒有路由 Kolibri。我們用供應商名稱與模型名稱的各種拼法徹底搜尋過整個目錄,就是找不到它。目前要呼叫它,自行架設是唯一途徑。

誰應該選哪個
決策規則簡短到能用三行陳述。
如果你需要德文和英文以外的任何文字,如果你需要一個經過衡量的品質數字才投入,如果模型必須在你擁有的硬體上執行,或者如果你寧願租用 token 而不是擁有自己的機架,就選擇 Gemma 4 12B。它是兩者中唯一具有獨立評分、已公布速度和市場價格的模型。
如果你的需求是這樣一個 780 億參數的推理模型:其權重、訓練資料來源、能源消耗與授權條款都有完整文件記錄,部署在你自己的防禦邊界內,配備專為德語行政文書打造的分詞器,並具備受監管工作流程可依賴的棄權行為,那就選擇 Kolibri。這是個狹窄的目標,而 Aleph Alpha 是刻意瞄準它的。
不要因為你在某篇發布貼文裡看到的某一列基準測試數據,就選擇其中任何一個。Gemma 4 12B 的 14 是別人做出的測量值,你可以查證。Kolibri 的 75.5 是其作者提出的主張,而目前唯一能推翻它的人,是擁有兩張 H100 和一份文件語料庫的客戶。
