
Kolibri 對上 MiniCPM5-2B:780 億參數對上 2.5,以及為何小尺寸版本不是便宜選項
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 217 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
將 Kolibri 與 MiniCPM5-2B 並列,直覺的解讀會是:這是一場規模比較,而這個 25 億參數的模型是經濟實惠的選擇。這種解讀錯了,而且錯得很有啟發性。Kolibri 是 Aleph Alpha 的 781 億參數混合專家模型,於 2026 年 10 月 3 日發布,每個 token 啟用 34.6 億個參數,FP8 佔用約 78 GB,最低服務配置為兩張 A100 80 GB 顯示卡。MiniCPM5-2B 是 ModelBest 與 OpenBMB 的 25.2 億參數稠密模型,於 2026 年 7 月 19 日在世界人工智能大會亮相,權重於 9 月 6 日上架 Hugging Face。以參數數量計,MiniCPM5-2B 只有其三十一分之一。它也是那個在你信任它之前,需要先編列評測預算的模型,因為它最常被引用的數字是由廠商自行執行且未經重現——這恰恰與「小模型」通常暗示的風險相反。
兩者都悄然推出;其中只有一個是最近推出的。
他們有著相似的起源故事,但年齡相差極大,而年齡很重要。Aleph Alpha 的 Kolibri 儲存庫建立於 2026 年 10 月 2 日,宣稱的發布日期是 10 月 3 日,而廠商自家的新聞室公告也在當天早上發布,正好是德國統一日。一般 AI 媒體當天大多漏掉了這則消息,「低調發布」的說法正是由此而來,但模型卡、技術報告和廠商貼文並不算是無聲上架。MiniCPM5-2B 確實安靜得多:七月的 WAIC 公告只是在大會上揭露一份宣傳說帖與規格,實際權重直到 9 月 6 日才出現,發布時沒有發表活動,同時還附上 GGUF、MLX、GPTQ、base、SFT 與 draft 檢查點,以及它們背後的訓練語料庫。
公告與權重之間那五週的空檔值得記住,因為這正是這個模型會有兩套不同數字流傳的原因。七月的資料標榜 512K token 的上下文視窗。實際出貨的設定則設為 131,072。實際釋出的成品才算數。
每個模型實際上是用來做什麼的
Kolibri 是為德語與英語文件工作而打造,而 Aleph Alpha 格外具體地說明了為何這需要真正的工程投入。小型的代理模型實驗設定了訓練混合資料中約 20% 為德語的目標,而對一趟 20 兆詞元的訓練而言,這意味著要找到 4 兆個德語詞元。經過去重與篩選的開放德語資料集只產出 3,900 億個——差了整整一個數量級——因此該實驗室特別針對德語重新調校了 Common Crawl 篩選器,產出 1.3 兆個獨特的自然生成詞元,並把既有的德語文件改寫成百科條目、對話與段落,又得到大約 1 兆個,這成為最大的單一德語來源。前身 Kolibri Origin 所使用的翻譯,在 Kolibri 中已被捨棄。最值得記住的是篩選器的那個細節:標準的語言資料處理管線會丟棄長詞過多的文件,而德語行政文書的平均詞長經常超過英語設定的上限,因此預設設定會悄悄刪掉公共行政書寫所用的語域。
MiniCPM5-2B 則是為另一端——裝置端代理——而打造。其模型卡描述了一個稠密 transformer,總參數量 25.2 億,非嵌入參數 19.8 億,42 層、隱藏層大小 2048,採用分組查詢注意力,有 16 個查詢頭與 2 個 KV 頭,並採用標準的 LlamaForCausalLM 架構,沒有自訂核心。訓練流程偏向代理式:2000 億規模的代理中介訓練、大型代理 SFT 資料集、代理 RL 對齊,以及最後的 On-Policy Distillation 階段,將十六個 RL 專家模型折疊回一個小型稠密網路。它內建 SGLang 解析器,支援 XML 樣式的工具呼叫,且其釋出的設定將上下文視窗設為 131,072 個 token。
• 參數 — Kolibri:總計 78,103,074,560,啟用 3,457,573,120,稀疏度 22.6:1。MiniCPM5-2B:總計 2,516,756,480,非嵌入 1.98B,稠密。
• 已發布 — Kolibri:2026 年 10 月 3 日。MiniCPM5-2B:於 2026 年 7 月 19 日宣布,權重於 2026 年 9 月 6 日。
• 上下文 — Kolibri:16,384 已訓練,65,536 中等訓練,262,144 原生,1,048,576 已驗證。MiniCPM5-2B:出貨配置中為 131,072;七月所稱的 512K 並未包含在內。
• 資源佔用 — Kolibri:FP8 約 78 GB;至少需兩張 A100 80 GB、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300。MiniCPM5-2B:單一 BF16 分片,筆電等級。
• 語言 — Kolibri:德語與英語,設計上僅此二者,別無其他。MiniCPM5-2B:英語與中文,所有已發表的評估套件均為英語。
• 工具呼叫 — Kolibri:Hermes 風格,隨附 vLLM 解析器。MiniCPM5-2B:XML 風格,搭配 SGLang 解析器。
• 授權條款 — 兩者皆為 Apache 2.0,且皆未附可接受使用附加條款。

計分板,以及其背後的採購
無論查遍哪一家廠商的資料,都找不到這組搭配的正面對決數字;而我們也不會把兩套不同測試框架的數據拼湊起來,就稱之為比較。雙方各自公布的內容值得仔細區分,因為這兩組數字所承載的證據份量相差極大。
Kolibri 的數據來自 Aleph Alpha 自家的十四模型比較表,該表在同一套測試框架上執行,並將 Kolibri 的推理強度設為高:英文平均 75.5,德文平均 70.8。該表並未美化其主角——Qwen3.8 27B 在同樣兩項平均值上分別拿下 80.2 與 79.9,並在 GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified 及兩項長上下文基準測試上領先,而其啟用的參數量約為 Kolibri 的八分之一。廠商對這個差距的說法,是品質對上每顆 GPU 每秒解碼 token 數的帕雷托前緣,而所有受比較的模型都無法超越它。這是服務經濟學的論點,而非能力論點,且沒有第三方進行過測量:Artificial Analysis 沒有 Kolibri 的條目,也沒有對該測試框架的複製。
MiniCPM5-2B 的數字來自它自己的模型卡:在廠商挑選的比較集中取得 53.9 的內部平均,AIME 2025/2026 為 86.5,MATH-500 為 94.6,以及廠商自行在 SWE-bench Verified 上跑出的 46.4——若這個成績能通過獨立測試,對一個 25 億參數的稠密模型來說會相當驚人。在那張模型卡上,IBM 的 Granite 4.2 3B 為 42.7,對上 MiniCPM5-2B 的 53.9——同一家廠商在它自己選擇的同一套測試上跑這兩個模型。不同的測試套件、不同的測試框架、不同的廠商。這些都無法對這個配對下結論。
MiniCPM5-2B 這一邊真正有價值的地方,在於它揭露了資訊。OpenBMB 在釋出權重的同時一併公開了 UltraData 訓練語料集——Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math,以及 agent SFT 與 RL 資料集——全部採用 Apache 2.0 授權,這讓一個黑箱變成一份可供檢視、並能延伸到你自身領域的配方。這款模型也在推出首日就透過 ModelBest 的 FlagOS 社群,完成橫跨九個晶片家族的調適,從華為昇騰到 NVIDIA 與 ARM,這是一項部署層面的宣示,而非跑分層面的宣示。相對地,IBM 公開了 Granite 4.2 3B 的權重與詳盡的建構技術說明,卻未公開其訓練資料;而 Aleph Alpha 公開了 Kolibri 的資料處理流程與能源核算——20 兆個預訓練 token、9.5×10² MWh(含資料中心的間接開銷,不含監督式微調與強化學習)——但未公開語料本身。
尺寸差距真正顯現的地方
把這兩者並列對照,最實用的方式,是從決定實際部署的兩條軸線來看:現場必須具備什麼,以及當模型出錯時會發生什麼事。
在硬體方面,MiniCPM5-2B 勝出,而且差距不小。一個 25.2 億參數的稠密模型,以單一 BF16 分片就能跑在筆電、邊緣裝置或單張消費級 GPU 上,而 FlagOS 支援橫跨九個晶片家族,意味著它能在完全不是 NVIDIA 加速器的硬體上運行。Kolibri 的最低門檻是兩張 A100 80 GB 或一張 B200,約 78 GB 的 FP8 權重,透過 aleph-alpha-inference vLLM 外掛或已發佈的容器提供服務。對於智慧座艙或手機相關的工作負載,2B 是兩者中唯一合格的,而 Kolibri 從設計之初就從來不是為了在那個領域競爭。
就可驗證性而言,Kolibri 勝出的原因較為微妙。它最常被引用的說法——服務經濟性——未經測試,但其品質數據至少是在同一套測試框架上,與十三個具名競爭對手比較後公布的,且設定參數公開揭露,而廠商自家的表格在大多數列上都把勝利讓給了對手。MiniCPM5-2B 的主打數字出自廠商自家,在廠商自家的測試套件上,且未揭露任何比較測試框架;此外,該模型還背負著額外的不確定性——其檢查點已是數週前而非數天前的版本。兩個模型都沒有經過獨立基準測試。差別在於:一家廠商寫下的比較結果讓自家模型落敗,另一家寫下的則讓自家模型大幅勝出。
刻意如此,這完全不是一場較量。Kolibri 是為了在本地端處理德語文件而存在,搭配一個雙語分詞器,Aleph Alpha 回報其在德語網頁文本上平均每個 token 為 4.90 位元組,而 GPT-5 為 4.35、Kimi K3 為 3.28——這些全由廠商自行量測,且屬於每 token 成本效應,而非品質主張。MiniCPM5-2B 則是為了在資源受限的硬體上,以英文和中文運作的工具呼叫代理而存在。一個持有德文合約、且有合規要求的團隊,並不是在兩者之間做選擇。

路由的現實,以及值得進行的實驗
目前兩者都沒有上架於代管目錄,而我們是實際查證過兩者,而不是憑假設。Kolibri 沒有供應商 API SKU——其發布內容是權重、技術報告和容器映像——而且它並未收錄於 OrcaRouter:我們以供應商前綴和模型名稱的各種拼法探查該目錄,結果都回傳找不到。MiniCPM5-2B 同樣沒有 ModelBest 提供的代管端點,也沒有在我們這裡提供路由。兩者都屬於自架部署的方案,我們寧可如實說明,也不願暗示我們有提供其中任何一個。
有趣的地方在於這個實驗。一個 25 億參數的代理式模型和一個 780 億參數的文件模型解決的是不同問題,而要知道你的工作負載需要哪一種,唯一的方法就是讓兩者都實際跑一遍——這正是路由層存在的意義,即使它本身並不承載這兩個模型。把測試路徑指向自架的 MiniCPM5-2B 建置版本,透過 一個與 OpenAI 相容的端點並具備自動容錯移轉,正式環境則維持在經過驗證的路由模型上,這樣一來,新堆疊就算卡住或產出胡言亂語,也不會拖垮任何東西。你拿來比較的模型,其供應商定價會以 零加成原樣傳遞,因此 A/B 測試既便宜又可回復。而如果實驗真正揭示的是,你的德語工作負載並不需要這兩個自架模型,同一把金鑰就能觸及一個已經在路由之中的小型混合專家層級——也就是 Gemma 4 26B-A4B 變體,每百萬輸入 token 0.06 美元、每百萬輸出 token 0.33 美元,具備 262,144 token 的視窗,並支援文字、圖像與影片輸入——這是在你買下兩張 GPU 之前最便宜的確認方式。
哪一個,以及什麼會改變答案
若限制在裝置端,就執行 MiniCPM5-2B。它擁有 25.2 億個參數,是兩者中唯一能塞進筆電、座艙或邊緣運算盒的模型;而如果你的工作負載是英文或中文的互動式工具呼叫代理,那它就是為此而生的模型。請先預留時間重現它的數據——53.9 的平均分與 46.4 的 SWE-bench 宣稱僅出自 ModelBest,而訓練語料庫開放,讓這樣的重現真正可行,而非僅止於理論。
如果語料庫是德語、硬體存在,且權重不得離開這棟大樓,就執行 Kolibri。262,144 個 token 的原生視窗、FP8 KV 快取、四種推理投入程度,以及 Hermes 工具呼叫,正適合受監管的文件工作;而 Apache 2.0 條款加上資料,則是能通過採購審查的那一部分。
有兩件事能比任何爭論更快地解決這個問題。在 MiniCPM5-2B 上進行一次獨立的 SWE-bench Verified 測試,將能證實或推翻兩張卡中任一者所提出的、最令人意外的那項主張。而對 Kolibri 在其建議的雙 H100 配置下進行獨立吞吐量測量——或一份目前尚不存在的 Artificial Analysis 收錄項目——將使「780 億個參數」從一項規格變成一個成本,而這正是任何把這項比較與硬體一併權衡的人真正在尋找的數字。在那之前,規模差距確實存在,用途差距更大,而看似便宜的選項正是背負未經證實主張的那一方。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
