
MiniCPM5-2B 對決 Granite 4.2 3B:3B 推理專家 vs 全新 2.5B 代理技術棧
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest 在沒人要求的情況下,就把 Granite 4.2 3B 放上了 MiniCPM5-2B 自家的記分板。OpenBMB 在權重低調上線 Hugging Face 時發布的 MiniCPM5-2B 模型卡,將 IBM 最小的推理模型列入其對比基準;在該評測套件中,MiniCPM5-2B 平均得分 53.9,而 Granite 4.2 3B 為 42.7。這是兩家廠商針對這組配對唯一公布的直接對比分數,因此它既是理所當然的起點,也是理所當然需要謹慎的地方。兩款模型都是小型、Apache-2.0、可自行部署的開放權重版本,瞄準的是同一個 2026 年底的任務;只是它們從相反的出發點切入——一個為推理而訓練,一個為行動而訓練。
這兩次發佈的相互呼應,比各自廠商的行銷說法所暗示的更深。MiniCPM5-2B 於7月19日舉行的世界人工智慧大會上亮相,是 ModelBest 與 OpenBMB 的裝置端旗艦——一款定位為手機、PC 與智慧座艙 Agent 基礎的 2B 級稠密模型——其權重於9月6日和7日悄悄上線,未伴隨任何發佈活動,採用 Apache-2.0 授權,同時也提供 GGUF、MLX、GPTQ、base、SFT 與 draft 檢查點,以及它們背後的訓練資料。Granite 4.2 3B 是 IBM 的筆電級推理模型,其權重在8月初便已上傳至 Hugging Face,模型卡與技術部落格則於8月25日釋出。兩者至今都尚未經任何獨立基準測試評估,這正是下方來源標籤的重要性超過數字的原因。
兩個押韻的發布
Granite 4.2 3B 是一個獨立的稠密推理模型,由 Granite-4.1-3B-Base 後訓練而成。它採用 40 層分組查詢注意力架構,原生上下文長度為 128K,IBM 在第五個預訓練階段將其擴展至 512K,並提供三種每次查詢的思考模式——預設為完整思考、低強度模式與非思考路徑。其模型卡明確說明它「不是」什麼:與 8B 和 30B 的 Granite 4.2 同門型號不同,3B 刻意跳過了在 SWE-agent、終端及搜尋環境中訓練的專門代理式強化學習區塊,因此 IBM 沒有列出任何 SWE-bench 結果,並將此模型定位為推理專家,而非代理。該模型可透過 vLLM、SGLang、Transformers、GGUF 與 Ollama(granite4.2:3b)提供服務;以 bfloat16 執行約需 6–8GB 記憶體,量化後低於 2GB,且沒有託管 API。其重點數據——AIME 2025 為 78.33、GPQA 為 54.80、LiveCodeBench v6 為 69.71、MMLU-Pro 為 67.84——皆為 IBM 內部報告,截至目前尚未有第三方複現。

MiniCPM5-2B 反而是個已完成的 agent 導向模型。該卡片描述了一個稠密 transformer,總參數 2.52B(非嵌入層 1.98B),42 層、隱藏層大小 2048,採用分組查詢注意力(grouped-query attention),16 個 query 頭和 2 個 KV 頭,並使用標準的 LlamaForCausalLM 架構,沒有自訂 kernel。發布時的宣傳主軸強調其智能體能力——200B 規模的智能體中間訓練、大型智能體 SFT 資料集,以及智能體 RL 對齊,最後透過 On-Policy Distillation 將十六個 RL 專家模型折疊回單一小型稠密網路——此外還有原生長上下文及混合快速/深思回應模式。其出廠 config 設定 131,072 token 的上下文視窗(七月資料宣稱 512K;正式釋出的 config 並未包含該設定),卡片宣稱具備 XML 風格工具呼叫,並內建 SGLang parser。在其自身評測表中,它回報在該卡片供應商自選的比較組合上內部平均為 53.9,AIME 2025/2026 為 86.5,MATH-500 為 94.6,以及供應商自跑的 SWE-bench Verified 46.4——對一個 2.5B 稠密模型來說,若能挺過獨立測試,會是相當出色的成績。

某人已經印好的那場正面交鋒
由於跨供應商的評比看板大多像是拿蘋果比橘子,這場對決中最有參考價值的單一文件,是 ModelBest 自己印製的那份:MiniCPM5-2B 的模型卡將 granite-4.2-3B 列為基準之一,並報告 MiniCPM5-2B 在該套件上平均 53.9 分,而 Granite 為 42.7 分。請如實解讀它——一家廠商在自己選定的套件上執行兩種模型,未經重現,而且有充分動機讓自家模型勝出。這不是最終定論。它確實告訴你的是:ModelBest 有信心到把競爭對手的 3B 模型放上自己的模型卡,而它所宣稱的差距最大的地方,恰好落在自家訓練投入最深的領域:代理式與長上下文這幾列。請將它視為一個方向性的宣稱,並在據此做出任何決定之前,先權衡 IBM 自己另行提出的模型卡宣稱。
記分板,如實標示。
• 發布 — MiniCPM5-2B:於 2026 年 7 月 19 日宣布;權重於 9 月 6 日至 7 日低調上線。Granite 4.2 3B:權重於 8 月初發布;模型卡與技術部落格於 2026 年 8 月 25 日發布。
• 角色 — MiniCPM5-2B:強調裝置端代理與工具使用(據 ModelBest 所述)。Granite 4.2 3B:推理專家,刻意非代理導向(據 IBM 所述)。
— 尺寸 — MiniCPM5-2B:2.52B 總參數 / 1.98B 非嵌入參數,42 層。Granite 4.2 3B:約 3B 稠密參數,40 層。
• 上下文 — MiniCPM5-2B:出廠配置中為 131,072 個 token。Granite 4.2 3B:原生 128K,可擴展至 512K。
• 後期訓練 — MiniCPM5-2B:深度思考SFT、專業化RL、在策略蒸餾。Granite 4.2 3B:推理SFT、GRPO RL與RLHF;沒有agentic-RL區塊。
• 證據 — MiniCPM5-2B:ModelBest 卡片宣稱,無獨立運行。Granite 4.2 3B:IBM 卡片宣稱,未經複現;AIME 2025 78.33,GPQA 54.80,LiveCodeBench v6 69.71。

上方的計分板與內文採用相同來源:上面的每一項數字皆為廠商自行回報,而兩家廠商各自發布的唯一同套件比較,就只有 ModelBest 自家卡片上的那一份。
推理專家 vs Agent 技術棧
在看分數之前,先決定你的工作負載需要哪一種小型模型,因為這兩者回答的是不同的問題。Granite 4.2 3B 是為了在受限硬體上進行推理與長上下文而打造:原生 128K 的上下文窗口可延伸至 512K、三種思考模式、小到足以放進筆電的佔用面積,以及明確選擇跳過代理式(agentic)訓練。如果你的工作是長文件分析、儲存庫規模的上下文,或是在小機器上進行可靠的多步驟推理,那是很合理的搭配;而 IBM 決定不讓 3B 背負代理式宣稱,這反而是信賴其規格卡的理由,而非缺陷。MiniCPM5-2B 則是針對相反的側重點打造:在裝置上展現代理式行為與工具使用——其訓練流程讀起來就像一份 Granite 4.2 3B 刻意遺漏之事的清單。如果你的工作是裝置上的代理迴圈,需要呼叫工具、維持長時間對話,並在快速回應與深思熟慮的回應之間切換,那麼這套技術棧就是為你打造的;而它也帶來了額外的不確定性:一個才問世一週、規格卡尚未驗證的 checkpoint。
OpenBMB 開放的資料,IBM 並未開放。
最不引人注目的差異,正是對想要微調模型的團隊最為關鍵的一點。OpenBMB 在釋出 MiniCPM5-2B 權重的同時,也公開了其訓練語料庫——即 UltraData 系列,包括 Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math,以及 agent 的 SFT 與 RL 資料集——全部採用 Apache-2.0 授權。這讓這款 2B 模型不再是黑箱,而是一份可重現的配方:你可以了解 agentic 後期訓練的建構基礎,並在自己的領域中接續發展。IBM 開源了 Granite 4.2 3B 的權重,並詳細說明了模型的建構方式,卻未提供訓練資料。對於想要「擁有」模型而非「租用」模型的組織來說,這種不對稱性是實際存在的。此外,MiniCPM5-2B 還具備 Granite 在此尺寸下無法比擬的部署優勢:透過 ModelBest 的 FlagOS 社群,實現涵蓋九大晶片家族的 day-zero 適配,從華為昇騰(Huawei Ascend)、NVIDIA 到眾多國產加速器,再加上 ARM——這透露出一個訊號:ModelBest 預期這款 2B 模型會運行在 NVIDIA GPU 以外的硬體上。
路由的現實
這兩個模型目前都不在任何託管目錄中,所以這份比較落在自架的世界裡——但這正是路由層依然有其價值之處:與其說它是交付機制,不如說它是一道安全網。當一個團隊想在已經由現有模型服務的工作負載上,拿剛滿一週的代理式 2B 模型去對比推理型 3B 模型時,可逆的作法是將測試路徑指向一個透過單一 API、具備自動故障轉移的自架 MiniCPM5-2B 建置,同時正式環境繼續沿用經過驗證的模型——就算新技術棧卡住,也不會讓任何服務下線;而且你所對比的託管模型,供應商的牌價會以 0% 加成轉傳,所以 A/B 測試依然便宜。該路由層並不託管其中任何一個模型;它只是讓實驗安全可跑、也容易回復。
你實際上應該運行哪個小型模型?
執行 Granite 4.2 3B 的前提是:你的工作負載是在筆電級裝置上進行長上下文推理,而且你希望有三種思考模式、512K 的上下文上限,以及一張老實的說明卡,清楚告訴你 3B 模型沒有被訓練來做什麼。{{1}}如果你的工作負載是在長上下文推理的筆電級裝置上執行,且你需要三種思考模式、512K 上限,以及一張誠實的說明卡、明確指出 3B 未受訓的能力範圍,那就選 Granite 4.2 3B。{{/1}}執行 MiniCPM5-2B 的前提是:你的工作負載是互動式、具工具呼叫能力的端側代理,而 2.5B 剛好符合你的記憶體預算——但在信任它之前,請先撥出時間重現它對外宣稱的標竿數據,{{2}}如果你的工作負載是互動式、可呼叫工具的端側代理,而 2.5B 參數規模符合你的記憶體預算,那就選 MiniCPM5-2B——但在相信它之前,請先規畫時間重現其宣傳的頭條數據,{{/2}}因為 53.9 的平均分數與 46.4 的 SWE-bench 宣稱目前僅來自廠商、尚無第三方驗證。{{3}}53.9 的平均分數和 46.4 的 SWE-bench 宣稱,目前都只是廠商的說法,還沒有任何其他人證實。{{/3}}有兩件事會比任何意見更快定調這場對決:一是獨立執行 MiniCPM5-2B、以證實或推翻其代理能力的宣稱;二是 IBM 的推理分數能否通過社群重現。{{4}}獨立執行 MiniCPM5-2B 以證實或推翻其代理能力的宣稱,以及 IBM 的推理分數能否通過社群重現,{{/4}}在這些結果出爐之前,Granite 4.2 3B 是現今更穩妥、文件更完備的小型模型,而 MiniCPM5-2B 則是更有趣的賭注。{{5}}在這些結果落地之前,Granite 4.2 3B 是當下更安全、文件更齊全的小型模型,而 MiniCPM5-2B 則是更有趣的押注。{{/5}}
