一張 MiniCPM5-2B-DSpark 對比 Granite 4.2 3B 的英雄標題卡,副標題為「兩個安靜的 Apache-2.0 發布,適合輕量快速部署」,畫面呈現兩個並排的開放紙箱——左側紙箱發出閃電,標示為 DSpark 草稿;右側紙箱顯示齒輪,標示為推理模式——底部橫跨一條 Apache-2.0 緞帶,右下角並有 OrcaRouter 標誌。
Guides & Insights

MiniCPM5-2B-DSpark 對比 Granite 4.2 3B:兩款低調的 Apache-2.0 模型發布,專為小型、快速、自架部署而生

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月及9月初,出現了兩個低調的Apache-2.0釋出版本,目標相同——都是供你自行架設的小型模型——但切入角度完全相反。Granite 4.2 3B是IBM專為筆電大小的推理模型,其權重於8月初上架Hugging Face,模型卡與技術部落格則在2026年8月25日發布。MiniCPM5-2B-DSpark嚴格來說並非同類意義下的模型:它是OpenBMB於2026年9月6日未經任何公告便發布的323.8M參數DSpark草稿檢查點,目的是透過推測解碼(speculative decoding)讓MiniCPM5-2B——ModelBest於2026年7月19日在WAIC發表的2.52B稠密型裝置端模型——更快生成token。其中一個版本是獨立的輕量推理模型;另一個則是輕量模型的加速配件。兩者皆以Apache-2.0授權釋出,都僅限自行架設,且至今皆尚未有獨立基準測試觸及。

剝掉行銷包裝後,團隊實際要面對的問題很直接:在 2026 年末的小型自架推論服務工作負載上,你想要 IBM 的 3B 推理專家,還是 ModelBest 以代理導向為主、再外掛免費草稿模型的 2B 技術堆疊?證據比任何一家廠商規格表所暗示的還更單薄,因此本文將梳理發布的事實、唯一實際存在的同套件數據,以及應該驅動這個選擇的工作負載差異。

這兩個版本可知的部分

Granite 4.2 3B 是 IBM 最小的推理模型,由 Granite-4.1-3B-Base 進行後續訓練而成。它屬於稠密型且僅處理文字的模型——具備 40 層、分組查詢注意力(GQA)、128K 原生上下文(於第五階段預訓練擴展至 512K),以及三種推理模式:預設的完整思考模式、低耗能模式與非思考路徑。IBM 的模型卡明確指出,3B 版本刻意跳過了較大的 Granite 4.2 同系列模型所採用的智能體強化學習(agentic reinforcement learning)區塊,因此未列出任何 SWE-Bench 結果;它屬於推理模型,而非代理模型。此模型可透過 vLLM、SGLang、Transformers、GGUF 以及 Ollama(granite4.2:3b)提供服務,且沒有代管 API。其主打模型卡數據——AIME 2025 分數 78.33、GPQA 54.80、LiveCodeBench v6 69.71——皆為廠商自行回報,截至今日尚未獲得獨立複現。

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

上方 ibm-granite/granite-4.2-3b 的卡片是該版本的公開門面:一個經推理調校的 3B 模型,主打長上下文,且未做出任何代理(agentic)宣稱。

相比之下,MiniCPM5-2B-DSpark 只是為了服務其目標模型而存在。草稿模型由五個全注意力層組成,參數量為 323,776,001,每次前向傳播的區塊大小為七個候選 token,並在 MiniCPM5-2B 生成的 70.5 億個 token 上訓練了六個 epoch。儲存庫報告了接受長度——在貪婪解碼下,總體平均每次驗證步驟接受 5.52 個 token,程式碼方面為 6.11——但沒有提供每秒 token 數的數據。它所加速的目標模型 MiniCPM5-2B 才是更有趣的產品:這是一個密集的 2.52B、42 層、128K 上下文模型,其發布資料強調 agent 能力——根據 ModelBest 七月的公告,包括 200B 規模的 agent 中期訓練、大型 agent-SFT 資料集,以及 agent RL 對齊——此外還具備原生長上下文與快速/深思混合模式。在 ModelBest 自家的比較套件中,該目標模型對比同類開源模型的平均得分為 53.9。這些數字全部來自供應商。

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

上方的 openbmb/MiniCPM5-2B-DSpark 卡片即為完整的發布內容:模型卡、config、一個 Safetensors 檔案,且沒有公告。

唯一存在的同套件比較

跨供應商的評測看板多半是拿蘋果比橘子,但有一個地方確實把 Granite 4.2 3B 和 MiniCPM5-2B 放在一起量測:ModelBest 自家為 MiniCPM5-2B 公布的評測表,其中把 granite-4.2-3B 列為基準模型之一。在那套測試上,MiniCPM5-2B 平均 53.9 分,而 Granite 4.2 3B 是 42.7 分。請把這個數字精確地當作它原本的意義——由同一家廠商在同一套測試上跑兩個模型、未被複現、而且是挑選來讓自家模型看起來更好的結果。它不是最終裁決。它真正告訴你的是:ModelBest 有信心把對手的 3B 模型放上評測卡,而它所宣稱的差距,正好在自家訓練最投入的地方最大:長上下文與 agentic 相關的項目。把它當作一個方向性的宣稱,用你自己的資料驗證,並且在據此下任何結論前,也把 IBM 自家那份獨立的評測卡宣稱一併納入考量。

記分板,如實標示。

{{1}}• 推出哪些模型 — MiniCPM5-2B-DSpark:為 MiniCPM5-2B(2.52B 密集目標模型)設計的 324M 草稿模型,並非獨立模型。{{/1}}{{2}}Granite 4.2 3B:獨立的約 3B 密集推理模型。{{/2}}

• 角色 — MiniCPM5-2B 技術棧:著重裝置端代理與工具使用,據 ModelBest 所述。Granite 4.2 3B:推理專家,刻意非代理導向。

• 上下文 — MiniCPM5-2B 目標:128K 原生。Granite 4.2 3B:128K 原生,可擴展至 512K。

• 加速 — MiniCPM5-2B-DSpark:外部 DSpark 草稿,每次通過七個 token,貪婪接受率約每步 5.5(依 repo 報告)。Granite 4.2 3B:此版本未隨附任何加速功能。

• 授權 — 兩者皆為 Apache-2.0。

• 證據 — MiniCPM 的數據為 ModelBest 模型卡片的宣稱(其套件:53.9 對比 Granite 的 42.7);Granite 的數據為 IBM 模型卡片的宣稱(AIME 2025 78.33、GPQA 54.80)。兩者皆無任何獨立運行驗證。

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

上方的計分板與內文使用相同來源:上面每個數字皆由廠商回報,而任一廠商所公布的同套件數字,只有 ModelBest 自家數據。

超越所有標竿的差異

在分數公布之前,先決定你的工作負載需要哪一種小型模型,因為這兩個發行版本回答的是不同的問題。Granite 4.2 3B 是為了在受限硬體上進行推理與長上下文而打造:原生 128K 的視窗可擴展至 512K、提供三種每次查詢的思考模式、體積小到能在筆電上運行,且明確選擇略過 agentic 訓練。如果你的任務是長文件分析、倉儲規模的上下文,或是在小型裝置上進行可靠推理,那就是一個貼合的選擇。MiniCPM5-2B 則以相反的強調來打造:裝置端的 agentic 行為與工具使用——光是草稿的存在本身,就顯示 ModelBest 預期這個目標會以互動方式提供服務,並想拿回每秒 token 數。如果你的任務是一個在裝置端運行的 agent 迴圈,需要呼叫工具並維持長時間對話,那麼這套技術堆疊就是為你而設的。

{{1}}這份草案改變了第二種選擇的經濟效益,而 Granite 的發行版並未解決這點。{{/1}}{{2}}MiniCPM5-2B 是密集模型,而投機解碼(speculative decoding)恰恰在密集、記憶體受限的情境下收益最大——由一個小型固定模型向一個略大的固定模型提出 token。{{/2}}{{3}}外部草稿模型(external drafter)為約 5GB 的目標模型增加約 650MB 的 BF16 權重,具備有文件記載的 SGLang 服務路徑,且貪婪接受率(greedy acceptance rate)約為每次驗證步驟 5.5 個 token——對於以單請求並發(single-request concurrency)服務的模型而言,這是可信的吞吐量槓桿。{{/3}}{{4}}但前提條件無可迴避:OpenBMB 尚未公布任何端到端加速數據,因此這個槓桿未經校準。{{/4}}{{5}}IBM 在此次發行中並未為 Granite 4.2 3B 提供同等的外部草稿模型——你只能以密集模式運行它,而它的速度賣點僅止於 3B 本身夠小。{{/5}}

誰應該執行哪個

• 若您的工作負載是在筆記型電腦等級的裝置上進行長上下文推理——例如文件、程式庫、深度的單執行緒分析——而且您想要一個完全由您掌控的 Apache-2.0 模型,具備三種思考模式和 512K 上限,請執行 Granite 4.2 3B。請接受它背後沒有代理式訓練,也沒有託管 API。

• 如果您的工作負載是互動式、需呼叫工具的裝置端代理程式,且目標模型落在您的記憶體預算內,同時您希望獲得草稿能換回的吞吐量,請執行 MiniCPM5-2B 堆疊搭配其 DSpark 草稿。請編列時間,在您自己的 SGLang 建置上測量草稿的實際加速效果,因為目前尚無任何已發布的相關數據。

• 如果你真的不確定,就把兩者都放在路由層之後。目前這兩個模型都不在託管目錄中,OrcaRouter 的也不例外——兩者都是自架方案——但一個位於你自己的端點之前、具備自動容錯移轉的路由器,可以讓新的草稿堆疊放在測試路徑上,而正式環境繼續採用經過驗證的那一套;它對其周遭託管模型採用 0% 加價轉傳,讓 A/B 比較成本保持低廉。重點在於可逆性:換掉模型名稱、進行量測,如果一天前的檢查點卡住了,就切換回來。

接下來要看什麼

有兩件事會比任何意見更快決定這場勝負。第一,獨立執行 MiniCPM5-2B,確認或推翻 53.9 的平均分數與代理式能力的宣稱;一個 2B 模型能在 SWE-Bench 這類任務上拿到這種成績,對終端裝置等級會是真正的新數據點。第二,IBM 自家推理模型的數據必須通過社群複現;3B 在 AIME 2025 的 78.33 分,正是那種換人跑一次就會浮動的宣稱。在兩者之一塵埃落定之前,誠實的立場是:Granite 4.2 3B 是當前較安全、文件也更完備的小型模型,而 MiniCPM5-2B 整組則是有趣得多的賭注——如果其宣稱成立,就是更快的裝置端代理,只是它還帶有一個連自家廠商都尚未估算效益的草稿模型。