
MiniCPM5-2B-DSpark 對決 Qwen3-8B:全新 2.5B 裝置端技術棧,對上開放權重的可靠主力
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
每一次模型比較背後都藏著一個硬體問題,而 MiniCPM5-2B-DSpark 對上 Qwen3-8B,正是這個問題穿上評測基準外衣的樣貌。Qwen3-8B 是阿里巴巴於 2025 年 4 月推出的開源權重主力——約 82 億個稠密參數、支援 119 種語言、原生 32K 脈絡可擴展至 131K、具備混合思考模式,背後還有十六個月的社群實證。MiniCPM5-2B-DSpark 並非可與之並列的獨立模型:它是 OpenBMB 於 2026 年 9 月 6 日悄悄發布到 Hugging Face、用以加速 MiniCPM5-2B 的 3.238 億參數 DSpark 草稿檢查點(checkpoint);MiniCPM5-2B 則是 ModelBest 於 2026 年 7 月 19 日在 WAIC 發表的稠密 25.2 億參數裝置端模型。把兩者放在一起,真正的問題便浮現:目前跑在 8B 上的工作負載,是否應該改在只能承載 2B 的硬體上執行——而一個配備免費草稿模型的 2.5B,又是否足以支撐這項轉移?
對大多數工作負載來說,簡短的回答是:還沒有。但原因比規模差距所暗示的更為狹窄,而且有一類部署情境中,8B 完全沒有答案。本文中所有量化數據皆為廠商自行回報——MiniCPM 的數字是 ModelBest 自己的、未經複現;Qwen3-8B 的數字則是 Alibaba 的,且長期暴露於社群使用之下——因此,標籤比數字本身更重要。
在記憶曲線不同位置上的兩個模型
MiniCPM5-2B 是一個密集因果 Transformer,規模約為 8B 模型的三分之一——42 層、分組查詢注意力(grouped-query attention)、Apache-2.0 授權——專為大型模型無法觸及的裝置類型而打造:手機、智慧座艙,以及記憶體匯流排會因八十億個權重而不堪負荷的小型邊緣設備。其發布資料將重點放在代理型(agentic)任務與長上下文,而非單純的廣度:原生 128K 上下文,且 ModelBest 宣稱在其自家評測套件上,模型平均得分為 53.9——依廠商所述,這是 2B 級開源模型的 SOTA,另外還包括在 SWE-bench Verified 上由廠商執行所得的 46.4 分;若該成績能經得起獨立測試,對一個 2B 模型而言將相當亮眼。DSpark 草稿正是針對一個顯而易見的質疑所提出的吞吐量解答:小型密集模型載入雖快,生成卻慢,因為每個 token 都必須把權重拖過記憶體匯流排。該草稿一次提出多達七個 token 供目標模型驗證,repo 回報在整體上每個驗證步驟的貪婪接受量平均為 5.52 個 token——程式碼任務則為 6.11。這個數字體現了草稿的品質;其加速效果尚未被實際測量,也未公布任何每秒 token 數的數據。

上述的 openbmb/MiniCPM5-2B-DSpark 模型卡,就是 9 月 6 日低調發布的對外全部內容:一個回報接受長度的服務附件,既無發布公告,也未帶來實際耗時上的加速。
「Qwen3-8B 同屬一個架構家族,規模為其三倍,發布時間也早了十六個月。這款採用分組查詢注意力的稠密因果 Transformer,以 36 兆 token 的多語言語料庫訓練而成,以 Apache-2.0 授權釋出,也是開放權重世界中最廣為自行托管與部署服務的 8B 模型之一。它的招牌特色是 Qwen3 混合推理模式——每個請求皆可選擇開啟或關閉思考——能力輪廓則刻意鋪得寬廣:MMLU 落在 70 分後段,GSM8K 與程式撰寫表現強勁,支援 119 種語言。它需要一張真正的 GPU 或一台效能夠強的邊緣裝置:在實用級量化下,記憶體占用僅數 GB,一張中階顯示卡即可輕鬆運行,手機則辦不到。」

上述阿里巴巴的 Qwen3-8B 模型卡就是在位者的門面:十六個月以來,在 119 種語言中經記錄且經社群測試的行為表現。
8B 仍然勝出的地方
往下降一個重量級,你就會放棄三樣具體的東西。首先是語言:Qwen3-8B涵蓋119種語言;MiniCPM5-2B的模型卡與資料集以英文和中文為重心,並未宣稱任何多語言廣度。對一個要服務長尾語言的產品來說,這是道硬牆,不是軟牆。第二是證據:Qwen3-8B的成績在十六個月裡被檢驗、被量化、被微調,也已大規模提供服務;它的失敗模式為人所知,量化版本俱已存在,生態系統無所不在。MiniCPM5-2B則是一個2026年7月的版本,由廠商自辦記分板,沒有任何獨立複現,而且這份草案才一天大。第三是服務技術棧:所有早已能與Qwen3-8B對接的一切——vLLM、SGLang、llama.cpp、上千種微調模型——對接的是一個成熟的標的;而MiniCPM這份草案則需要建構推測解碼引擎(SGLang的DSPARK演算法),儲存庫中雖有文件說明,但更廣大的生態系統尚未將其吸收。
當 2B stack 是唯一選項時
在根本裝不下 8B 模型的裝置類別中,那些都不重要。在只有幾 GB DRAM 的手機或邊緣板上,Qwen3-8B 根本不是在跟 MiniCPM5-2B 競爭——它完全無法以可用的速度部署。這正是 2B 技術棧存在的全部原因,也是為什麼草稿模型是這次發佈中承重的部分,而不是點綴。推測解碼最有效的場合,恰好就是小型模型在小型晶片上運作時那種密集、記憶體受限的環境:一個精簡的草稿模型提出一個區塊,目標模型一次性驗證,權重載入成本變成每個區塊付一次,而不是每個 token 付一次。源自 DeepSeek 的 DSpark 方法(arXiv 2607.05147)是為高並發伺服系統設計的,但其機制——以及這個 repo 上的接受率數據——才是讓 2B 在受限硬體上仍能保有互動感的關鍵槓桿。只要記得這個誠實的提醒:OpenBMB 測量的是草稿的接受率,而不是加速效果,所以在你目標裝置上實際的每秒 token 增益,仍然必須由你自己來測量。
記分板,如實標示。
「發布 — MiniCPM5-2B:2026年7月19日(公布);MiniCPM5-2B-DSpark:2026年9月6日,低調發布。Qwen3-8B:2025年4月,公布。」
• 大小 — MiniCPM5-2B:2.52B 密集參數,加上 324M 草稿模型。Qwen3-8B:約 8.2B 密集參數。
• 上下文 — MiniCPM5-2B:原生 128K。Qwen3-8B:原生 32K,透過 YaRN 可達 131K。
• 語言 — MiniCPM5-2B:以英語/中文為中心。Qwen3-8B:119種語言。
• 推理 — MiniCPM5-2B:根據發布資料,具備混合快速/深思模式。Qwen3-8B:可依請求開啟或關閉思考模式。
• {{1}}證據 — MiniCPM 數據為 ModelBest 官方卡片宣稱(自家測試套件平均 53.9 分;未經獨立評測驗證)。Qwen3-8B 數據為阿里巴巴官方公布,且已歷經社群十六個月的檢驗。{{/1}}

上面的對照表如實呈現了這種落差:除了開源的 Apache-2.0 授權之外,各欄幾乎在所有方面都各不相同;而你出貨的目標裝置類別,甚至會決定你究竟能選哪一欄。
路由的現實
目前這兩個模型都還未進駐 OrcaRouter 的託管目錄,因此這番比較完全發生在自架設的世界裡——但這正是路由層依然能發揮價值的地方。Qwen3-8B 由其供應商與數家第三方平台提供服務;MiniCPM5-2B 及其 draft 模型則是你自行運行的東西。當團隊想測試一套 2.5B 架構能否承載部分 8B 工作負載時,可逆的做法是透過單一 API(具備自動容錯移轉)將測試路徑指向自架設的 MiniCPM5-2B-plus-draft SGLang 建置——正式環境仍留在既有模型上,新架構就算卡住也不會拖垮任何系統,而各家供應商在整個比較過程中的列表價格會以 0% 加價直接穿透,所以這個 A/B 測試既便宜又可逆,而非一場賭注。該層本身並不託管任何模型;它只是讓這項實驗能安全進行。
誰應該移動,誰應該等待
留在 Qwen3-8B 上應對所有多語言需求、任何需要十六個月已知行為的工作負載,或任何已經在能輕鬆承載 8B 的硬體上運行的任務──參數量差距不是遷移的理由,而證據缺口更是反對遷移。只有在你的目標裝置完全無法承載 8B,或者一個能在 agentic 與長上下文任務上跟得上的 2.5B 模型,可以讓你在既有出貨硬體上削減記憶體與功耗時,才認真測試搭載 DSpark draft 的 MiniCPM5-2B 技術棧。而在你投入 draft 之前,先跑一遍 OpenBMB 沒有公布的測量:接受長度不等於延遲,真正決定 Hugging Face 上那個低調小 checkpoint 是否值得下載的數字,是你裝置上的每秒 token 增益。
