
MiniCPM5-2B 對決 Gemma 4 12B:4B 以下排行榜霸主 vs Google 的 12B 通用模型
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
MiniCPM5-2B 的發布資料裡有一句話,聽起來像是在任何爭論開始前就先定調:在 7 月 19 日的世界人工智慧大會上,ModelBest 與 OpenBMB 稱這款模型在 Artificial Analysis 的排行榜中位居 4B 參數以下的第一名,而其開放權重如今也已悄然上線 Hugging Face。Gemma 4 12B 則是 Google 從完全不同重量級給出的回應——一款於 6 月 3 日發布的 11.95B 稠密、無編碼器多模態通用模型,接受文字、圖像、音訊與影片輸入,並且背後已有數個月的社群部署經驗。拿兩者相比不是規格表上的練習,而是對你要出貨到哪種裝置的決策;因為一款在自身尺寸級別中領先的模型,與一款只是更大的模型,回答的是不同的硬體問題。
時機正是這場對決之所以存在的原因。MiniCPM5-2B 於七月在 WAIC 以產品之姿亮相——既是晶片故事,也是模型故事,加上來自其 FlagOS 社群的九家首發晶片合作夥伴——並承諾權重「在不久的將來」釋出。七週後,openbmb/MiniCPM5-2B 儲存庫出現在 Hugging Face 上(OpenBMB 的變更日誌將發布日期標記為 9 月 7 日),採用 Apache-2.0 授權、無須核准即可取用,BF16 檢查點、GGUF、MLX、GPTQ、基礎與 SFT 檢查點,以及訓練資料集,全部收錄在同一個集合中。沒有新聞稿,也沒有發布活動。截至本文撰寫之際,模型卡本身就是發布聲明,目前尚無任何獨立的基準測試結果發布——下方關於 2B 的所有量化數據,不是 ModelBest 自身的複現結果,就是取自其所引用的 Artificial Analysis 快照。相較之下,Gemma 4 12B 透過 Google 的常規機制發布,已被下載數百萬次。這項證據缺口本身就是比較的一部分,而非附註。
每一邊剛剛發生了什麼變化?
MiniCPM5-2B 是 MiniCPM5 系列中的第二個模型,繼 OpenBMB 於 5 月 19 日開源的 MiniCPM5-1B 之後推出。該模型卡描述了一個稠密 Transformer,總參數量為 2,516,756,480(非嵌入參數為 1,981,982,720——正是這個數字讓其獲得「2B 級」標籤),共 42 層,隱藏大小為 2048,採用分組查詢注意力,有 16 個查詢頭和僅 2 個 KV 頭,詞彙表大小為 130,560。它是一個純粹的 LlamaForCausalLM 架構——模型卡明確指出無需自訂核心,也無需分叉模型程式碼——整個檢查點以單一 BF16 safetensors 分片形式發布。其有趣的設計選擇在於後訓練:先在 400B tokens 的深度思考資料上進行 SFT,然後透過 On-Policy Distillation(在策略蒸餾)將十六個 RL 專家模型(其中五個是代理型)蒸餾回一個小型稠密網路。模型卡將 RL + OPD 歸功於在推理和一般任務上平均提升 10.96 分、在代理型任務上提升 6.96 分——這些是內部增量,但它們解釋了此模型的形態:一個專為設備端代理而建的 2B 模型,原生產生 XML 風格的工具呼叫。

Gemma 4 12B 在 Google 的產品陣容中有著不同的定位。它是 Gemma 4 家族中排行中間的成員——位於鎖定邊緣應用的 E2B 與 E4B 之上、26B MoE 與 31B 前沿模型之下;而且它是唯一採用無編碼器(encoder-free)設計的成員:原始影像區塊與音訊波形直接投影至 token 空間,讓單一稠密模型就能處理文字、影像、音訊與視訊輸入,無需另行部署獨立的編碼器塔。它具備 256K 上下文視窗、開箱即用的工具呼叫、可選的推理過程,以及從檢查點內部加速解碼的多 token 預測草稿模型。它採用 Apache-2.0 授權,在 16GB 等級的硬體上即可實際運行(4-bit 量化下約需 8GB),其 Hugging Face 頁面也顯示每月下載量達數百萬次。

該排名主張,以及它所遺漏的尺寸等級
ModelBest 對 MiniCPM5-2B 的宣傳重點是 Artificial Analysis Intelligence Index 17,在發布時位居 4B 參數以下模型之首。但旁邊需要加上兩點但書。該分數反映的是 AA 的 v4.1 快照,不能與先前快照的指數值直接比較;而且這是廠商在獨立重跑之前引用的發布時數據。更誠實的解讀範圍較窄,但依然令人印象深刻:在該模型發布時,按照當時 AA 的方法論,這款 2.5B 模型領先其整個尺寸級別。Gemma 4 12B 不在該級別中,而且根據 Artificial Analysis 現今的頁面,它的指數更高——推理版本約 22,非推理的 instruct 模型約 13,兩者在各自同儕群組中都「遠高於平均」。不同快照的指數無法整齊對齊,因此應將其視為方向而非精確數值:12B 通用型模型測試出來是能力較強的模型,而 2B 則測試出來是同尺寸中最強的模型。這兩者是不同的主張,且兩者都可能成立。
記分板,如實標示。
以來源出處的角度來看這些數據列——MiniCPM5-2B的數據是ModelBest規格卡片的宣稱,僅一週之齡且未經複現驗證;Gemma 4 12B的數據則由Google公布,且已長期暴露於社群廣泛使用之中:
• 規模 — MiniCPM5-2B:2.52B 總參數 / 1.98B 非嵌入參數,dense。Gemma 4 12B:11.95B,dense。
• 模態 — MiniCPM5-2B:僅文字。Gemma 4 12B:文字、圖像、音訊和視訊輸入,無編碼器。
• 上下文 — MiniCPM5-2B:出廠配置中為 131,072 個 token。Gemma 4 12B:原生 256K(部分伺服推論配置會鎖定為 128K)。
• 語言 — MiniCPM5-2B:以英文和中文為中心的卡片與資料。Gemma 4 12B:140+ 種語言。
• {{1}}發布—MiniCPM5-2B:於2026年7月19日宣布;權重於9月6日至7日低調上線。{{/1}} {{2}}Gemma 4 12B:於2026年6月3日推出,並附有完整的發布評測。{{/2}}
• 證據 — MiniCPM5-2B:供應商模型卡加上 AA v4.1(索引 17,4B 以下級別第一名);尚無獨立評測。Gemma 4 12B:發佈評測加上數月社群部署,以及每月約 330 萬次下載量。

上方的計分板是同一幅畫像分為六列:這兩個模型幾乎在每個維度上都有分歧,而決定選擇的欄位——模態、語言、裝置類別——是任何基準平均值都無法捕捉的。
12B 勝出的地方:純文字 2B 無法偽裝的事
先談模態。Gemma 4 12B 原生支援音訊、圖片與影片;MiniCPM5-2B 則為純文字。任何需要做語音轉錄、檢視螢幕或觀看影片的產品,都必須在 2B 之外另建一條管線;到了那個地步,「小型模型」的優勢就大打折扣了。語言是第二道牆:140 多種語言,對上以英語/中文為中心的產品。對要服務長尾語言的產品而言,2B 根本不在候選之列。再來是實際證據。Gemma 4 12B 已被下載數百萬次,歷經量化、微調,並在生產環境中上線三個月;其失敗模式有文件記錄,生態系涵蓋 llama.cpp、Ollama、LM Studio、MLX、vLLM 與 SGLang。MiniCPM5-2B 則是一個發布才一週的儲存庫,它標榜的數字——包括廠商在 SWE-bench Verified 上測得的 46.4 分(這個成績若經得起獨立測試,對 2.5B 稠密模型來說將相當驚人)——至今還沒有實驗室以外的任何人驗證過。光憑成熟度,這個選擇就已毫無懸念。
當2B是唯一選擇
在12B根本放不下的裝置類別上,這些都無關緊要。手機、智慧座艙板或僅有數GB DRAM的小型邊緣盒,都無法以實用的速度將11.95B模型的權重透過記憶體匯流排移動——而這正是會使其窒息的瓶頸。MiniCPM5-2B就是為了這樣的世界而打造:能放進裝置端記憶體的權重、可應付長時間代理工作階段的128K窗口、設計用於互動式執行的原生工具呼叫,以及在九大晶片系列加上ARM之間提供首日適配。如果你的目標是手機等級的NPU或嵌入式板卡,Gemma 4 12B根本不會與MiniCPM5-2B競爭;它在那裡根本無法部署。如果你的目標剛好能承載12B——例如一台16GB的筆電——那麼2B為你換來更大的餘裕:更快的每token延遲、更低的功耗,以及在相同占用空間內執行第二個模型的選項。
如何找出哪些索賠仍然有效
既然雙方都是開放權重且可自行託管,接下來最誠實的一步,就是先在自家硬體上實測,而不是再讀一次規格卡。如果你正拿 MiniCPM5-2B 與 Gemma 4 12B 來比較一個你已經在服務的工作負載,這裡也正是路由層體現價值之處:透過單一 API 把測試路徑指向新的自架 checkpoint,並具備自動故障轉移,代表尚未驗證的技術堆疊就算卡住或迴圈,也不會拖垮正式環境;而你拿來對照的供應商列表牌價,則會以 0% 加價直接轉傳。這個模型本身只是個一天大的 repo,所以預設態度是把它當作實驗——但這實驗跑起來很便宜,而花兩小時在 2B 上重現 SWE-bench,或自己評測集的一部分,正是這場較量目前所欠缺的證據。
裁決
當您的硬體餘裕充足、且工作負載涵蓋的不只是文字——例如多模態產品、多語言受眾,或任何「三個月社群實證表現比排行榜桂冠更重要」的應用——請選擇 Gemma 4 12B。當您的裝置根本無法承載 12B,或者手機級晶片上的 2.5B 文字型、代理導向模型,能讓您推出更大模型無法實現的產品時,請選擇 MiniCPM5-2B。低於 4B 的排行榜領導者是一項實至名歸的成就,其開放權重版本也讓它今天即可測試;但根據現有證據,在任何 12B 確實能運行的環境中,它都稱不上是 12B 通用模型的替代品。
