
MiniCPM5-2B-DSpark 對比 Granite 4.2 3B:兩款低調的 Apache-2.0 模型發布,專為小型、快速、自架部署而生
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年8月及9月初,出現了兩個低調的Apache-2.0釋出版本,目標相同——都是供你自行架設的小型模型——但切入角度完全相反。Granite 4.2 3B是IBM專為筆電大小的推理模型,其權重於8月初上架Hugging Face,模型卡與技術部落格則在2026年8月25日發布。MiniCPM5-2B-DSpark嚴格來說並非同類意義下的模型:它是OpenBMB於2026年9月6日未經任何公告便發布的323.8M參數DSpark草稿檢查點,目的是透過推測解碼(speculative decoding)讓MiniCPM5-2B——ModelBest於2026年7月19日在WAIC發表的2.52B稠密型裝置端模型——更快生成token。其中一個版本是獨立的輕量推理模型;另一個則是輕量模型的加速配件。兩者皆以Apache-2.0授權釋出,都僅限自行架設,且至今皆尚未有獨立基準測試觸及。
剝掉行銷包裝後,團隊實際要面對的問題很直接:在 2026 年末的小型自架推論服務工作負載上,你想要 IBM 的 3B 推理專家,還是 ModelBest 以代理導向為主、再外掛免費草稿模型的 2B 技術堆疊?證據比任何一家廠商規格表所暗示的還更單薄,因此本文將梳理發布的事實、唯一實際存在的同套件數據,以及應該驅動這個選擇的工作負載差異。
這兩個版本可知的部分
Granite 4.2 3B 是 IBM 最小的推理模型,由 Granite-4.1-3B-Base 進行後續訓練而成。它屬於稠密型且僅處理文字的模型——具備 40 層、分組查詢注意力(GQA)、128K 原生上下文(於第五階段預訓練擴展至 512K),以及三種推理模式:預設的完整思考模式、低耗能模式與非思考路徑。IBM 的模型卡明確指出,3B 版本刻意跳過了較大的 Granite 4.2 同系列模型所採用的智能體強化學習(agentic reinforcement learning)區塊,因此未列出任何 SWE-Bench 結果;它屬於推理模型,而非代理模型。此模型可透過 vLLM、SGLang、Transformers、GGUF 以及 Ollama(granite4.2:3b)提供服務,且沒有代管 API。其主打模型卡數據——AIME 2025 分數 78.33、GPQA 54.80、LiveCodeBench v6 69.71——皆為廠商自行回報,截至今日尚未獲得獨立複現。

上方 ibm-granite/granite-4.2-3b 的卡片是該版本的公開門面:一個經推理調校的 3B 模型,主打長上下文,且未做出任何代理(agentic)宣稱。
相比之下,MiniCPM5-2B-DSpark 只是為了服務其目標模型而存在。草稿模型由五個全注意力層組成,參數量為 323,776,001,每次前向傳播的區塊大小為七個候選 token,並在 MiniCPM5-2B 生成的 70.5 億個 token 上訓練了六個 epoch。儲存庫報告了接受長度——在貪婪解碼下,總體平均每次驗證步驟接受 5.52 個 token,程式碼方面為 6.11——但沒有提供每秒 token 數的數據。它所加速的目標模型 MiniCPM5-2B 才是更有趣的產品:這是一個密集的 2.52B、42 層、128K 上下文模型,其發布資料強調 agent 能力——根據 ModelBest 七月的公告,包括 200B 規模的 agent 中期訓練、大型 agent-SFT 資料集,以及 agent RL 對齊——此外還具備原生長上下文與快速/深思混合模式。在 ModelBest 自家的比較套件中,該目標模型對比同類開源模型的平均得分為 53.9。這些數字全部來自供應商。

上方的 openbmb/MiniCPM5-2B-DSpark 卡片即為完整的發布內容:模型卡、config、一個 Safetensors 檔案,且沒有公告。
唯一存在的同套件比較
跨供應商的評測看板多半是拿蘋果比橘子,但有一個地方確實把 Granite 4.2 3B 和 MiniCPM5-2B 放在一起量測:ModelBest 自家為 MiniCPM5-2B 公布的評測表,其中把 granite-4.2-3B 列為基準模型之一。在那套測試上,MiniCPM5-2B 平均 53.9 分,而 Granite 4.2 3B 是 42.7 分。請把這個數字精確地當作它原本的意義——由同一家廠商在同一套測試上跑兩個模型、未被複現、而且是挑選來讓自家模型看起來更好的結果。它不是最終裁決。它真正告訴你的是:ModelBest 有信心把對手的 3B 模型放上評測卡,而它所宣稱的差距,正好在自家訓練最投入的地方最大:長上下文與 agentic 相關的項目。把它當作一個方向性的宣稱,用你自己的資料驗證,並且在據此下任何結論前,也把 IBM 自家那份獨立的評測卡宣稱一併納入考量。
記分板,如實標示。
{{1}}• 推出哪些模型 — MiniCPM5-2B-DSpark:為 MiniCPM5-2B(2.52B 密集目標模型)設計的 324M 草稿模型,並非獨立模型。{{/1}}{{2}}Granite 4.2 3B:獨立的約 3B 密集推理模型。{{/2}}
• 角色 — MiniCPM5-2B 技術棧:著重裝置端代理與工具使用,據 ModelBest 所述。Granite 4.2 3B:推理專家,刻意非代理導向。
• 上下文 — MiniCPM5-2B 目標:128K 原生。Granite 4.2 3B:128K 原生,可擴展至 512K。
• 加速 — MiniCPM5-2B-DSpark:外部 DSpark 草稿,每次通過七個 token,貪婪接受率約每步 5.5(依 repo 報告)。Granite 4.2 3B:此版本未隨附任何加速功能。
• 授權 — 兩者皆為 Apache-2.0。
• 證據 — MiniCPM 的數據為 ModelBest 模型卡片的宣稱(其套件:53.9 對比 Granite 的 42.7);Granite 的數據為 IBM 模型卡片的宣稱(AIME 2025 78.33、GPQA 54.80)。兩者皆無任何獨立運行驗證。

上方的計分板與內文使用相同來源:上面每個數字皆由廠商回報,而任一廠商所公布的同套件數字,只有 ModelBest 自家數據。
超越所有標竿的差異
在分數公布之前,先決定你的工作負載需要哪一種小型模型,因為這兩個發行版本回答的是不同的問題。Granite 4.2 3B 是為了在受限硬體上進行推理與長上下文而打造:原生 128K 的視窗可擴展至 512K、提供三種每次查詢的思考模式、體積小到能在筆電上運行,且明確選擇略過 agentic 訓練。如果你的任務是長文件分析、倉儲規模的上下文,或是在小型裝置上進行可靠推理,那就是一個貼合的選擇。MiniCPM5-2B 則以相反的強調來打造:裝置端的 agentic 行為與工具使用——光是草稿的存在本身,就顯示 ModelBest 預期這個目標會以互動方式提供服務,並想拿回每秒 token 數。如果你的任務是一個在裝置端運行的 agent 迴圈,需要呼叫工具並維持長時間對話,那麼這套技術堆疊就是為你而設的。
{{1}}這份草案改變了第二種選擇的經濟效益,而 Granite 的發行版並未解決這點。{{/1}}{{2}}MiniCPM5-2B 是密集模型,而投機解碼(speculative decoding)恰恰在密集、記憶體受限的情境下收益最大——由一個小型固定模型向一個略大的固定模型提出 token。{{/2}}{{3}}外部草稿模型(external drafter)為約 5GB 的目標模型增加約 650MB 的 BF16 權重,具備有文件記載的 SGLang 服務路徑,且貪婪接受率(greedy acceptance rate)約為每次驗證步驟 5.5 個 token——對於以單請求並發(single-request concurrency)服務的模型而言,這是可信的吞吐量槓桿。{{/3}}{{4}}但前提條件無可迴避:OpenBMB 尚未公布任何端到端加速數據,因此這個槓桿未經校準。{{/4}}{{5}}IBM 在此次發行中並未為 Granite 4.2 3B 提供同等的外部草稿模型——你只能以密集模式運行它,而它的速度賣點僅止於 3B 本身夠小。{{/5}}
誰應該執行哪個
• 若您的工作負載是在筆記型電腦等級的裝置上進行長上下文推理——例如文件、程式庫、深度的單執行緒分析——而且您想要一個完全由您掌控的 Apache-2.0 模型,具備三種思考模式和 512K 上限,請執行 Granite 4.2 3B。請接受它背後沒有代理式訓練,也沒有託管 API。
• 如果您的工作負載是互動式、需呼叫工具的裝置端代理程式,且目標模型落在您的記憶體預算內,同時您希望獲得草稿能換回的吞吐量,請執行 MiniCPM5-2B 堆疊搭配其 DSpark 草稿。請編列時間,在您自己的 SGLang 建置上測量草稿的實際加速效果,因為目前尚無任何已發布的相關數據。
• 如果你真的不確定,就把兩者都放在路由層之後。目前這兩個模型都不在託管目錄中,OrcaRouter 的也不例外——兩者都是自架方案——但一個位於你自己的端點之前、具備自動容錯移轉的路由器,可以讓新的草稿堆疊放在測試路徑上,而正式環境繼續採用經過驗證的那一套;它對其周遭託管模型採用 0% 加價轉傳,讓 A/B 比較成本保持低廉。重點在於可逆性:換掉模型名稱、進行量測,如果一天前的檢查點卡住了,就切換回來。
接下來要看什麼
有兩件事會比任何意見更快決定這場勝負。第一,獨立執行 MiniCPM5-2B,確認或推翻 53.9 的平均分數與代理式能力的宣稱;一個 2B 模型能在 SWE-Bench 這類任務上拿到這種成績,對終端裝置等級會是真正的新數據點。第二,IBM 自家推理模型的數據必須通過社群複現;3B 在 AIME 2025 的 78.33 分,正是那種換人跑一次就會浮動的宣稱。在兩者之一塵埃落定之前,誠實的立場是:Granite 4.2 3B 是當前較安全、文件也更完備的小型模型,而 MiniCPM5-2B 整組則是有趣得多的賭注——如果其宣稱成立,就是更快的裝置端代理,只是它還帶有一個連自家廠商都尚未估算效益的草稿模型。
