「MiniCPM5-2B 對決 Granite 4.2 3B」的主視覺標題卡,副標題為「一個經 Agent 訓練的 2.5B 模型,與 IBM 的 3B 推理專家正面交鋒」,三個標籤內容分別為「Agent 技術棧 vs 推理模型」、「雙方皆為 Apache-2.0」與「權重於 9 月 6–7 日上線」,頂部還有一條寫著「開放權重對決 · 2026 年 9 月」的緞帶。
Guides & Insights

MiniCPM5-2B 對決 Granite 4.2 3B:3B 推理專家 vs 全新 2.5B 代理技術棧

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

ModelBest 在沒人要求的情況下,就把 Granite 4.2 3B 放上了 MiniCPM5-2B 自家的記分板。OpenBMB 在權重低調上線 Hugging Face 時發布的 MiniCPM5-2B 模型卡,將 IBM 最小的推理模型列入其對比基準;在該評測套件中,MiniCPM5-2B 平均得分 53.9,而 Granite 4.2 3B 為 42.7。這是兩家廠商針對這組配對唯一公布的直接對比分數,因此它既是理所當然的起點,也是理所當然需要謹慎的地方。兩款模型都是小型、Apache-2.0、可自行部署的開放權重版本,瞄準的是同一個 2026 年底的任務;只是它們從相反的出發點切入——一個為推理而訓練,一個為行動而訓練。

這兩次發佈的相互呼應,比各自廠商的行銷說法所暗示的更深。MiniCPM5-2B 於7月19日舉行的世界人工智慧大會上亮相,是 ModelBest 與 OpenBMB 的裝置端旗艦——一款定位為手機、PC 與智慧座艙 Agent 基礎的 2B 級稠密模型——其權重於9月6日和7日悄悄上線,未伴隨任何發佈活動,採用 Apache-2.0 授權,同時也提供 GGUF、MLX、GPTQ、base、SFT 與 draft 檢查點,以及它們背後的訓練資料。Granite 4.2 3B 是 IBM 的筆電級推理模型,其權重在8月初便已上傳至 Hugging Face,模型卡與技術部落格則於8月25日釋出。兩者至今都尚未經任何獨立基準測試評估,這正是下方來源標籤的重要性超過數字的原因。

兩個押韻的發布

Granite 4.2 3B 是一個獨立的稠密推理模型,由 Granite-4.1-3B-Base 後訓練而成。它採用 40 層分組查詢注意力架構,原生上下文長度為 128K,IBM 在第五個預訓練階段將其擴展至 512K,並提供三種每次查詢的思考模式——預設為完整思考、低強度模式與非思考路徑。其模型卡明確說明它「不是」什麼:與 8B 和 30B 的 Granite 4.2 同門型號不同,3B 刻意跳過了在 SWE-agent、終端及搜尋環境中訓練的專門代理式強化學習區塊,因此 IBM 沒有列出任何 SWE-bench 結果,並將此模型定位為推理專家,而非代理。該模型可透過 vLLM、SGLang、Transformers、GGUF 與 Ollama(granite4.2:3b)提供服務;以 bfloat16 執行約需 6–8GB 記憶體,量化後低於 2GB,且沒有託管 API。其重點數據——AIME 2025 為 78.33、GPQA 為 54.80、LiveCodeBench v6 為 69.71、MMLU-Pro 為 67.84——皆為 IBM 內部報告,截至目前尚未有第三方複現。

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B 反而是個已完成的 agent 導向模型。該卡片描述了一個稠密 transformer,總參數 2.52B(非嵌入層 1.98B),42 層、隱藏層大小 2048,採用分組查詢注意力(grouped-query attention),16 個 query 頭和 2 個 KV 頭,並使用標準的 LlamaForCausalLM 架構,沒有自訂 kernel。發布時的宣傳主軸強調其智能體能力——200B 規模的智能體中間訓練、大型智能體 SFT 資料集,以及智能體 RL 對齊,最後透過 On-Policy Distillation 將十六個 RL 專家模型折疊回單一小型稠密網路——此外還有原生長上下文及混合快速/深思回應模式。其出廠 config 設定 131,072 token 的上下文視窗(七月資料宣稱 512K;正式釋出的 config 並未包含該設定),卡片宣稱具備 XML 風格工具呼叫,並內建 SGLang parser。在其自身評測表中,它回報在該卡片供應商自選的比較組合上內部平均為 53.9,AIME 2025/2026 為 86.5,MATH-500 為 94.6,以及供應商自跑的 SWE-bench Verified 46.4——對一個 2.5B 稠密模型來說,若能挺過獨立測試,會是相當出色的成績。

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

某人已經印好的那場正面交鋒

由於跨供應商的評比看板大多像是拿蘋果比橘子,這場對決中最有參考價值的單一文件,是 ModelBest 自己印製的那份:MiniCPM5-2B 的模型卡將 granite-4.2-3B 列為基準之一,並報告 MiniCPM5-2B 在該套件上平均 53.9 分,而 Granite 為 42.7 分。請如實解讀它——一家廠商在自己選定的套件上執行兩種模型,未經重現,而且有充分動機讓自家模型勝出。這不是最終定論。它確實告訴你的是:ModelBest 有信心到把競爭對手的 3B 模型放上自己的模型卡,而它所宣稱的差距最大的地方,恰好落在自家訓練投入最深的領域:代理式與長上下文這幾列。請將它視為一個方向性的宣稱,並在據此做出任何決定之前,先權衡 IBM 自己另行提出的模型卡宣稱。

記分板,如實標示。

• 發布 — MiniCPM5-2B:於 2026 年 7 月 19 日宣布;權重於 9 月 6 日至 7 日低調上線。Granite 4.2 3B:權重於 8 月初發布;模型卡與技術部落格於 2026 年 8 月 25 日發布。

• 角色 — MiniCPM5-2B:強調裝置端代理與工具使用(據 ModelBest 所述)。Granite 4.2 3B:推理專家,刻意非代理導向(據 IBM 所述)。

— 尺寸 — MiniCPM5-2B:2.52B 總參數 / 1.98B 非嵌入參數,42 層。Granite 4.2 3B:約 3B 稠密參數,40 層。

• 上下文 — MiniCPM5-2B:出廠配置中為 131,072 個 token。Granite 4.2 3B:原生 128K,可擴展至 512K。

• 後期訓練 — MiniCPM5-2B:深度思考SFT、專業化RL、在策略蒸餾。Granite 4.2 3B:推理SFT、GRPO RL與RLHF;沒有agentic-RL區塊。

• 證據 — MiniCPM5-2B:ModelBest 卡片宣稱,無獨立運行。Granite 4.2 3B:IBM 卡片宣稱,未經複現;AIME 2025 78.33,GPQA 54.80,LiveCodeBench v6 69.71。

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

上方的計分板與內文採用相同來源:上面的每一項數字皆為廠商自行回報,而兩家廠商各自發布的唯一同套件比較,就只有 ModelBest 自家卡片上的那一份。

推理專家 vs Agent 技術棧

在看分數之前,先決定你的工作負載需要哪一種小型模型,因為這兩者回答的是不同的問題。Granite 4.2 3B 是為了在受限硬體上進行推理與長上下文而打造:原生 128K 的上下文窗口可延伸至 512K、三種思考模式、小到足以放進筆電的佔用面積,以及明確選擇跳過代理式(agentic)訓練。如果你的工作是長文件分析、儲存庫規模的上下文,或是在小機器上進行可靠的多步驟推理,那是很合理的搭配;而 IBM 決定不讓 3B 背負代理式宣稱,這反而是信賴其規格卡的理由,而非缺陷。MiniCPM5-2B 則是針對相反的側重點打造:在裝置上展現代理式行為與工具使用——其訓練流程讀起來就像一份 Granite 4.2 3B 刻意遺漏之事的清單。如果你的工作是裝置上的代理迴圈,需要呼叫工具、維持長時間對話,並在快速回應與深思熟慮的回應之間切換,那麼這套技術棧就是為你打造的;而它也帶來了額外的不確定性:一個才問世一週、規格卡尚未驗證的 checkpoint。

OpenBMB 開放的資料,IBM 並未開放。

最不引人注目的差異,正是對想要微調模型的團隊最為關鍵的一點。OpenBMB 在釋出 MiniCPM5-2B 權重的同時,也公開了其訓練語料庫——即 UltraData 系列,包括 Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math,以及 agent 的 SFT 與 RL 資料集——全部採用 Apache-2.0 授權。這讓這款 2B 模型不再是黑箱,而是一份可重現的配方:你可以了解 agentic 後期訓練的建構基礎,並在自己的領域中接續發展。IBM 開源了 Granite 4.2 3B 的權重,並詳細說明了模型的建構方式,卻未提供訓練資料。對於想要「擁有」模型而非「租用」模型的組織來說,這種不對稱性是實際存在的。此外,MiniCPM5-2B 還具備 Granite 在此尺寸下無法比擬的部署優勢:透過 ModelBest 的 FlagOS 社群,實現涵蓋九大晶片家族的 day-zero 適配,從華為昇騰(Huawei Ascend)、NVIDIA 到眾多國產加速器,再加上 ARM——這透露出一個訊號:ModelBest 預期這款 2B 模型會運行在 NVIDIA GPU 以外的硬體上。

路由的現實

這兩個模型目前都不在任何託管目錄中,所以這份比較落在自架的世界裡——但這正是路由層依然有其價值之處:與其說它是交付機制,不如說它是一道安全網。當一個團隊想在已經由現有模型服務的工作負載上,拿剛滿一週的代理式 2B 模型去對比推理型 3B 模型時,可逆的作法是將測試路徑指向一個透過單一 API、具備自動故障轉移的自架 MiniCPM5-2B 建置,同時正式環境繼續沿用經過驗證的模型——就算新技術棧卡住,也不會讓任何服務下線;而且你所對比的託管模型,供應商的牌價會以 0% 加成轉傳,所以 A/B 測試依然便宜。該路由層並不託管其中任何一個模型;它只是讓實驗安全可跑、也容易回復。

你實際上應該運行哪個小型模型?

執行 Granite 4.2 3B 的前提是:你的工作負載是在筆電級裝置上進行長上下文推理,而且你希望有三種思考模式、512K 的上下文上限,以及一張老實的說明卡,清楚告訴你 3B 模型沒有被訓練來做什麼。{{1}}如果你的工作負載是在長上下文推理的筆電級裝置上執行,且你需要三種思考模式、512K 上限,以及一張誠實的說明卡、明確指出 3B 未受訓的能力範圍,那就選 Granite 4.2 3B。{{/1}}執行 MiniCPM5-2B 的前提是:你的工作負載是互動式、具工具呼叫能力的端側代理,而 2.5B 剛好符合你的記憶體預算——但在信任它之前,請先撥出時間重現它對外宣稱的標竿數據,{{2}}如果你的工作負載是互動式、可呼叫工具的端側代理,而 2.5B 參數規模符合你的記憶體預算,那就選 MiniCPM5-2B——但在相信它之前,請先規畫時間重現其宣傳的頭條數據,{{/2}}因為 53.9 的平均分數與 46.4 的 SWE-bench 宣稱目前僅來自廠商、尚無第三方驗證。{{3}}53.9 的平均分數和 46.4 的 SWE-bench 宣稱,目前都只是廠商的說法,還沒有任何其他人證實。{{/3}}有兩件事會比任何意見更快定調這場對決:一是獨立執行 MiniCPM5-2B、以證實或推翻其代理能力的宣稱;二是 IBM 的推理分數能否通過社群重現。{{4}}獨立執行 MiniCPM5-2B 以證實或推翻其代理能力的宣稱,以及 IBM 的推理分數能否通過社群重現,{{/4}}在這些結果出爐之前,Granite 4.2 3B 是現今更穩妥、文件更完備的小型模型,而 MiniCPM5-2B 則是更有趣的賭注。{{5}}在這些結果落地之前,Granite 4.2 3B 是當下更安全、文件更齊全的小型模型,而 MiniCPM5-2B 則是更有趣的押注。{{/5}}