「MiniCPM5-2B vs Gemma 4 12B」的主視覺標題卡,副標題為「sub-4B 排行榜霸主對上 Google 的 12B 多模態通才」,三個標籤為「2.5B vs 11.95B」、「128K vs 256K 上下文」和「AA Index 17 — sub-4B 第一名」,頂部還有「開放權重對決 · 2026 年 9 月」的橫幅。
Guides & Insights

MiniCPM5-2B 對決 Gemma 4 12B:4B 以下排行榜霸主 vs Google 的 12B 通用模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

MiniCPM5-2B 的發布資料裡有一句話,聽起來像是在任何爭論開始前就先定調:在 7 月 19 日的世界人工智慧大會上,ModelBest 與 OpenBMB 稱這款模型在 Artificial Analysis 的排行榜中位居 4B 參數以下的第一名,而其開放權重如今也已悄然上線 Hugging Face。Gemma 4 12B 則是 Google 從完全不同重量級給出的回應——一款於 6 月 3 日發布的 11.95B 稠密、無編碼器多模態通用模型,接受文字、圖像、音訊與影片輸入,並且背後已有數個月的社群部署經驗。拿兩者相比不是規格表上的練習,而是對你要出貨到哪種裝置的決策;因為一款在自身尺寸級別中領先的模型,與一款只是更大的模型,回答的是不同的硬體問題。

時機正是這場對決之所以存在的原因。MiniCPM5-2B 於七月在 WAIC 以產品之姿亮相——既是晶片故事,也是模型故事,加上來自其 FlagOS 社群的九家首發晶片合作夥伴——並承諾權重「在不久的將來」釋出。七週後,openbmb/MiniCPM5-2B 儲存庫出現在 Hugging Face 上(OpenBMB 的變更日誌將發布日期標記為 9 月 7 日),採用 Apache-2.0 授權、無須核准即可取用,BF16 檢查點、GGUF、MLX、GPTQ、基礎與 SFT 檢查點,以及訓練資料集,全部收錄在同一個集合中。沒有新聞稿,也沒有發布活動。截至本文撰寫之際,模型卡本身就是發布聲明,目前尚無任何獨立的基準測試結果發布——下方關於 2B 的所有量化數據,不是 ModelBest 自身的複現結果,就是取自其所引用的 Artificial Analysis 快照。相較之下,Gemma 4 12B 透過 Google 的常規機制發布,已被下載數百萬次。這項證據缺口本身就是比較的一部分,而非附註。

每一邊剛剛發生了什麼變化?

MiniCPM5-2B 是 MiniCPM5 系列中的第二個模型,繼 OpenBMB 於 5 月 19 日開源的 MiniCPM5-1B 之後推出。該模型卡描述了一個稠密 Transformer,總參數量為 2,516,756,480(非嵌入參數為 1,981,982,720——正是這個數字讓其獲得「2B 級」標籤),共 42 層,隱藏大小為 2048,採用分組查詢注意力,有 16 個查詢頭和僅 2 個 KV 頭,詞彙表大小為 130,560。它是一個純粹的 LlamaForCausalLM 架構——模型卡明確指出無需自訂核心,也無需分叉模型程式碼——整個檢查點以單一 BF16 safetensors 分片形式發布。其有趣的設計選擇在於後訓練:先在 400B tokens 的深度思考資料上進行 SFT,然後透過 On-Policy Distillation(在策略蒸餾)將十六個 RL 專家模型(其中五個是代理型)蒸餾回一個小型稠密網路。模型卡將 RL + OPD 歸功於在推理和一般任務上平均提升 10.96 分、在代理型任務上提升 6.96 分——這些是內部增量,但它們解釋了此模型的形態:一個專為設備端代理而建的 2B 模型,原生產生 XML 風格的工具呼叫。

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B 在 Google 的產品陣容中有著不同的定位。它是 Gemma 4 家族中排行中間的成員——位於鎖定邊緣應用的 E2B 與 E4B 之上、26B MoE 與 31B 前沿模型之下;而且它是唯一採用無編碼器(encoder-free)設計的成員:原始影像區塊與音訊波形直接投影至 token 空間,讓單一稠密模型就能處理文字、影像、音訊與視訊輸入,無需另行部署獨立的編碼器塔。它具備 256K 上下文視窗、開箱即用的工具呼叫、可選的推理過程,以及從檢查點內部加速解碼的多 token 預測草稿模型。它採用 Apache-2.0 授權,在 16GB 等級的硬體上即可實際運行(4-bit 量化下約需 8GB),其 Hugging Face 頁面也顯示每月下載量達數百萬次。

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

該排名主張,以及它所遺漏的尺寸等級

ModelBest 對 MiniCPM5-2B 的宣傳重點是 Artificial Analysis Intelligence Index 17,在發布時位居 4B 參數以下模型之首。但旁邊需要加上兩點但書。該分數反映的是 AA 的 v4.1 快照,不能與先前快照的指數值直接比較;而且這是廠商在獨立重跑之前引用的發布時數據。更誠實的解讀範圍較窄,但依然令人印象深刻:在該模型發布時,按照當時 AA 的方法論,這款 2.5B 模型領先其整個尺寸級別。Gemma 4 12B 不在該級別中,而且根據 Artificial Analysis 現今的頁面,它的指數更高——推理版本約 22,非推理的 instruct 模型約 13,兩者在各自同儕群組中都「遠高於平均」。不同快照的指數無法整齊對齊,因此應將其視為方向而非精確數值:12B 通用型模型測試出來是能力較強的模型,而 2B 則測試出來是同尺寸中最強的模型。這兩者是不同的主張,且兩者都可能成立。

記分板,如實標示。

以來源出處的角度來看這些數據列——MiniCPM5-2B的數據是ModelBest規格卡片的宣稱,僅一週之齡且未經複現驗證;Gemma 4 12B的數據則由Google公布,且已長期暴露於社群廣泛使用之中:

• 規模 — MiniCPM5-2B:2.52B 總參數 / 1.98B 非嵌入參數,dense。Gemma 4 12B:11.95B,dense。

• 模態 — MiniCPM5-2B:僅文字。Gemma 4 12B:文字、圖像、音訊和視訊輸入,無編碼器。

• 上下文 — MiniCPM5-2B:出廠配置中為 131,072 個 token。Gemma 4 12B:原生 256K(部分伺服推論配置會鎖定為 128K)。

• 語言 — MiniCPM5-2B:以英文和中文為中心的卡片與資料。Gemma 4 12B:140+ 種語言。

• {{1}}發布—MiniCPM5-2B:於2026年7月19日宣布;權重於9月6日至7日低調上線。{{/1}} {{2}}Gemma 4 12B:於2026年6月3日推出,並附有完整的發布評測。{{/2}}

• 證據 — MiniCPM5-2B:供應商模型卡加上 AA v4.1(索引 17,4B 以下級別第一名);尚無獨立評測。Gemma 4 12B:發佈評測加上數月社群部署,以及每月約 330 萬次下載量。

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

上方的計分板是同一幅畫像分為六列:這兩個模型幾乎在每個維度上都有分歧,而決定選擇的欄位——模態、語言、裝置類別——是任何基準平均值都無法捕捉的。

12B 勝出的地方:純文字 2B 無法偽裝的事

先談模態。Gemma 4 12B 原生支援音訊、圖片與影片;MiniCPM5-2B 則為純文字。任何需要做語音轉錄、檢視螢幕或觀看影片的產品,都必須在 2B 之外另建一條管線;到了那個地步,「小型模型」的優勢就大打折扣了。語言是第二道牆:140 多種語言,對上以英語/中文為中心的產品。對要服務長尾語言的產品而言,2B 根本不在候選之列。再來是實際證據。Gemma 4 12B 已被下載數百萬次,歷經量化、微調,並在生產環境中上線三個月;其失敗模式有文件記錄,生態系涵蓋 llama.cpp、Ollama、LM Studio、MLX、vLLM 與 SGLang。MiniCPM5-2B 則是一個發布才一週的儲存庫,它標榜的數字——包括廠商在 SWE-bench Verified 上測得的 46.4 分(這個成績若經得起獨立測試,對 2.5B 稠密模型來說將相當驚人)——至今還沒有實驗室以外的任何人驗證過。光憑成熟度,這個選擇就已毫無懸念。

當2B是唯一選擇

在12B根本放不下的裝置類別上,這些都無關緊要。手機、智慧座艙板或僅有數GB DRAM的小型邊緣盒,都無法以實用的速度將11.95B模型的權重透過記憶體匯流排移動——而這正是會使其窒息的瓶頸。MiniCPM5-2B就是為了這樣的世界而打造:能放進裝置端記憶體的權重、可應付長時間代理工作階段的128K窗口、設計用於互動式執行的原生工具呼叫,以及在九大晶片系列加上ARM之間提供首日適配。如果你的目標是手機等級的NPU或嵌入式板卡,Gemma 4 12B根本不會與MiniCPM5-2B競爭;它在那裡根本無法部署。如果你的目標剛好能承載12B——例如一台16GB的筆電——那麼2B為你換來更大的餘裕:更快的每token延遲、更低的功耗,以及在相同占用空間內執行第二個模型的選項。

如何找出哪些索賠仍然有效

既然雙方都是開放權重且可自行託管,接下來最誠實的一步,就是先在自家硬體上實測,而不是再讀一次規格卡。如果你正拿 MiniCPM5-2B 與 Gemma 4 12B 來比較一個你已經在服務的工作負載,這裡也正是路由層體現價值之處:透過單一 API 把測試路徑指向新的自架 checkpoint,並具備自動故障轉移,代表尚未驗證的技術堆疊就算卡住或迴圈,也不會拖垮正式環境;而你拿來對照的供應商列表牌價,則會以 0% 加價直接轉傳。這個模型本身只是個一天大的 repo,所以預設態度是把它當作實驗——但這實驗跑起來很便宜,而花兩小時在 2B 上重現 SWE-bench,或自己評測集的一部分,正是這場較量目前所欠缺的證據。

裁決

當您的硬體餘裕充足、且工作負載涵蓋的不只是文字——例如多模態產品、多語言受眾,或任何「三個月社群實證表現比排行榜桂冠更重要」的應用——請選擇 Gemma 4 12B。當您的裝置根本無法承載 12B,或者手機級晶片上的 2.5B 文字型、代理導向模型,能讓您推出更大模型無法實現的產品時,請選擇 MiniCPM5-2B。低於 4B 的排行榜領導者是一項實至名歸的成就,其開放權重版本也讓它今天即可測試;但根據現有證據,在任何 12B 確實能運行的環境中,它都稱不上是 12B 通用模型的替代品。