
MiniCPM5-2B 權重已上線:奪下 Sub-4B 王座的小型模型正式開源
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
這個模型本身才七週大。MiniCPM5-2B 於7月19日在2026年世界人工智慧大會上首次亮相,當時 ModelBest 與 OpenBMB 稱其為 Artificial Analysis 排行榜上4B參數以下排名第一的模型,並承諾權重「在不久的將來」釋出。這個週末發生的事情是,那個「不久的將來」就這樣到來了,卻沒有任何發表時的宣傳排場:MiniCPM5-2B 儲存庫於9月6日在 Hugging Face 上線,而 OpenBMB 的更新日誌將發布日期標記為9月7日,採用 Apache-2.0 授權,並附上完整套件——BF16 權重、GGUF、MLX 與 GPTQ 量化版本、基礎與 SFT 檢查點、用於推測解碼的 DSpark 草稿模型,以及其背後的訓練資料集。
沒有伴隨的新聞稿,也沒有發布活動。它就這樣出現了:某天冒出一個 Hugging Face 儲存庫,隔天多了一則變更日誌條目。這使得本文成為一篇「目前已知資訊」性質的報導——並附帶一則早期更新。該儲存庫透露了大量訊息:模型如今確實可以下載並運行,規格表也已公開。此外,一項外部評分已經出爐:Artificial Analysis 在 Intelligence Index v4.2 上將 MiniCPM5-2B 評為 15 分,是該指數上總參數量低於 4B 的開放權重模型中得分最高者;因此,sub-4B 的排名不再僅憑廠商單方面的說法。仍未獲得證實的是模型卡上的主打數據——OpenBMB 在自己的測試框架中重現了這些數據,但實驗室以外還沒有任何人重新跑過。以下整理:從儲存庫能得知什麼、目前已有哪些獨立量測結果,以及在依賴它進行開發之前,還有哪些地方需要驗證。
剛才發生了什麼事?
MiniCPM5-2B 是 MiniCPM5 系列中繼 MiniCPM5-1B 之後的第二款模型,OpenBMB 於 5 月 19 日將其開源。當 2B 模型作為產品在 WAIC 亮相時,這個故事既是晶片故事,也是模型故事——ModelBest 將其定位為手機、PC 與智慧座艙的端側 Agent 基礎,並透過其 FlagOS 社群公布了九款首日支援的晶片,從華為昇騰到 NVIDIA,再到一眾國產加速器。當時開源被形容為「即將到來」。七週過去了。
9月6日,出现了openbmb/MiniCPM5-2B仓库。截至撰写本文时,模型卡即为发布公告,且对于一次低调的发布而言,其完整程度非同寻常:
• 權重 — 最終 RL + OPD 後訓練的 BF16 檢查點,採用 Apache-2.0 授權,且未設門控 — 任何人都可以下載。
• 配套檢查點 — MiniCPM5-2B-SFT、-Midtrain 與 -Base,供想在 RL/OPD 之前取得模型的人使用;外加 -GGUF、-MLX、-GPTQ 及一個 -DSpark 草稿模型,全部列在 Hugging Face 的 MiniCPM5 collection 中。
• 資料 — 訓練語料庫同樣公開釋出,作為 UltraData 系列的一部分:Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math、UltraData-SFT-Agent-2609 與 UltraData-RL-2609。
• 鏡像 — README 同時指向 Hugging Face 和 ModelScope。
卡片中有一行的重要性遠比表面看來更高:「不支援自訂核心,也不允許模型程式碼分支。」MiniCPM5-2B 使用標準的 LlamaForCausalLM 架構,因此任何已能服務 Llama 系列模型的引擎,都能直接載入它,無需等待特製的實作。
為什麼 2.5B 模型值得再看一眼
WAIC 的宣傳重點在於排名。ModelBest 表示 MiniCPM5-2B 在 Artificial Analysis Intelligence Index 取得 17 分,推出時在 AA 排行榜上名列 4B 參數以下模型中第一位。這個數字旁需要附上兩個注意事項。第一,指數分數只能在同一個方法論版本內互相比較;MiniCPM5-1B 先前在舊版 AA 快照中得到的 17.9 分,並不能證明較小的模型「分數更高」;同理,在新方法論下取得的新分數也不代表效能退步。第二,AA 的數據會提供給模型卡,但模型卡上的標題平均分是 OpenBMB 自己的數字,是在 OpenBMB 自家評測框架中重現的。這個區別很重要,因為 AA 後來已改用更新的方法論並發布了新分數——這是開放權重發布以來,外界首次檢驗這項說法。
在權重發布的同一週,一個外部評分也出爐了。9月4日,Artificial Analysis 發布了 Intelligence Index v4.2,這是一次方法論修訂:將私有保留測試的權重提高到40%,並新增兩項內容——AA-Briefcase(代理式評測)與 Surge 的 GDP.pdf(長上下文文件推理任務)。AA 指數中,MiniCPM5-2B 現在獲得 v4.2 的15分——在總參數低於4B的開放權重模型中表現最佳,也是 AA 榜單上該尺寸類別47個開放模型中的第一名。這使模型保持在七月宣傳時所處的位置;只是這次的方法論更難被操弄,且權重任何人都能下載並重新檢查。這個15分不能與推出初期由 v4.1 所得的17分相比——是方法論變嚴格,而非模型變弱——而且這個綜合分數並未重新驗證模型卡上的各項數據列,其中大部分 OpenBMB 已用自己的測試框架重現。它真正做到的,是落在 OpenBMB 聲稱其優化的兩個維度上:v4.2 更側重代理式任務,而 AA 的冗長度追蹤顯示,MiniCPM5-2B 在指數任務中輸出5700萬個 token,是同級中最簡潔的模型,對比中位數為7200萬。OpenBMB 感謝 AA 進行這項評測,並恰好以這些說法來定位:它表示,2.6B 規模下的代理式效能與 token 效率,正是這個模型所優化的目標。
真正的核心主張是小巧封裝下的代理能力:原生工具呼叫、深度搜尋與程式碼生成——這些能力是從零開始訓練出來的,而不是事後外掛。模型卡描述了一條三階段管線:基礎訓練、中期訓練,接著是以 400B tokens 的深度思考資料進行 SFT、專門的強化學習(RL)教師模型,以及同策略蒸餾(OPD)的後期訓練;OPD 將十六個 RL 專家模型(其中五個具代理能力)合併回單一的小型稠密網路。OpenBMB 將 RL + OPD 階段視為推理與一般任務平均提升 10.96 分、代理任務平均提升 6.96 分的功臣——這些是內部測得的增量數據,但它們解釋了此模型不尋常的樣貌:一個以 2.5B 參數打造的網路,以推理模型的架構成形,並瞄準工具使用。

此儲存庫實際包含的內容
規格表毫無歧義,因為它本身就是設定檔。MiniCPM5-2B 擁有 2,516,756,480 個參數,其中 1,981,982,720 個為非嵌入參數——廠商所稱的「2B 等級」正是以非嵌入參數數量來計算。它是一個稠密 Transformer,共 42 層,隱藏層維度為 2048,採用分組查詢注意力機制,配備 16 個查詢頭與僅 2 個 KV 頭,詞彙表大小為 130,560,並使用 BF16 張量。整體模型以單一 safetensors 分片形式發布,檔案大小足以在筆電網路連線下輕鬆下載,並能在單張中階 GPU 或手機等級的 NPU 上運行。
• 參數 — 總計 2,516,756,480;非嵌入 1,981,982,720。
• 架構 — 密集 LlamaForCausalLM,42 層,隱藏層 2048,GQA 16 個查詢頭/2 個 KV 頭,詞彙量 130,560。
• 上下文 — 已配置 131,072 個 tokens(max_position_embeddings),配置中未設定 RoPE 縮放。
• 授權 — Apache-2.0,適用於模型與已發布的訓練資料。
• 格式 — BF16;GGUF、MLX 與 GPTQ 配套版本另行發布。

July deck 中的一個數字並未出現在 checkpoint 中。WAIC 資料宣稱支援 512K token 的上下文窗口;但釋出的 config 將 max_position_embeddings 設為 131,072(128K),而且沒有 rope_scaling 條目。512K 這個數字有可能是打算透過推論時擴展來達成,就像幾個小型模型拉伸其上下文的方式一樣——但就釋出內容而言,repo 記載的是 131,072,在 OpenBMB 發布擴展配方之前,這就是設計時應依循的數字。
按測量者排序的數字
模型卡對來源出處非常審慎,腳註也值得細讀。它用劍號標記的分數「來自官方 Artificial Analysis 發布版本」——例如 GPQA-Diamond 70.2、HLE 8.9、AA-LCR 59.0、Terminal-Bench v2.1 8.6 與 GDPval-AA v2 19.6 等列。其餘項目則被描述為「內部重現」,也就是說 OpenBMB 是在自己的評測框架中執行這些評估。該類別包含了那些引人注目的數字:在模型卡比較組合中的內部平均 53.9、AIME 2025/2026 的 86.5、MATH-500 的 94.6、LiveCodeBench v6 的 69.1、SWE-bench Verified 的 46.4、BFCL v4 的 66.6、τ²-Bench Telecom 的 97.1、GAIA(Text-103)的 88.7,以及 MMLU-Pro 的 70.8。
有三件事使這些數字讀起來真實可靠。53.9 這個平均分是相對分數,而非絕對分數——該卡對每個雷達軸進行標準化,使比較中最佳的模型得分為 100。比較集合由供應商選定:其他 2B-4B 開放模型,包括 Qwen3.5-2B、Qwen3.5-4B、Gemma-4-E2B-it、granite-4.2-3B、LFM2.5-2.6B 和 LFM2.5-8B-A1B。在該集合內,該卡顯示 MiniCPM5-2B 超越次佳的 Qwen3.5-4B(51.1)——對一個尺寸僅其一半的模型而言,這是真正令人矚目的結果,而且正是那種需要獨立複現、之後才能讓任何人據以發展的結果。此外,有幾個個別列難以與行銷說法相符:一個 2.5B 稠密模型在 SWE-bench Verified 上取得 46.4,若能複現將相當非凡;而 HLE 為 8.9 則提醒我們,「sub-4B 領先者」與「frontier」是不同級別。這些說法都未被該 repo 反駁,且 AA 的 v4.2 綜合指數後來也確認了該模型在 sub-4B 開放權重類別中整體位居頂端——但這些特定列是 OpenBMB 自己的數據,仍未經實驗室以外的任何人驗證。
今天執行 MiniCPM5-2B
{{1}}由於架構是純粹的 Llama{{/1}},主流引擎可直接載入。{{2}}OpenBMB 的 README 提供了 vLLM(0.21 或更新版本)、SGLang(0.5.16 或更新版本)與 Transformers(5.6 或更新版本)的快速入門指南,建議取樣參數為 temperature 1.0、top-p 0.95,而當你需要推理過程時,則開啟 enable_thinking。{{/2}}{{3}}GGUF 與 MLX 的配套涵蓋 llama.cpp、Ollama、LM Studio 與 Apple Silicon;該卡片也列出了 ArcLight 執行環境與常見的微調技術棧(TRL + PEFT、LLaMA-Factory、ms-swift、unsloth)。{{/3}}
在開始之前,有兩個部署細節值得你先了解。就工具與函式呼叫而言,SGLang 是建議使用的後端:模型會輸出 XML 風格的工具呼叫,而 SGLang 內建的 minicpm5 解析器會將這些呼叫原生轉換為與 OpenAI 相容的 tool_calls,這表示標準的工具呼叫用戶端無需自訂 shim 即可正常運作。此外,DSpark 草稿模型是為了讓推理階段更省成本而存在:在 SGLang 中以 DSPARK 投機解碼(speculative decoding)演算法啟動後,它能加速解碼過程,同時維持目標模型的輸出不變——這正是決定在筆電上執行 128K 上下文的智能體迴圈究竟「可用」還是「僅屬可能」的關鍵。

如果你比較想評估一批小型開放模型,而非手動微調單一模型,路由層在此就值得它的成本:當某家供應商列出 MiniCPM5-2B 時,路由器是在同一任務上,與 Qwen3.5-2B 及其他 4B 以下的開放模型進行 A/B 測試的廉價方式,且不需要第二次整合。在 OrcaRouter 上,這代表一個 API 就能存取 200+ 個模型、供應商牌價以 0% 加成直接轉傳,而且一旦全新檢查點在生產路徑上停滯或迴圈,就會自動進行故障轉移。該儲存庫才剛成立不到兩天,目前我們也還無法指出任何已列出 MiniCPM5-2B 的託管 API——因此現階段誠實的預設做法,是把它視為自架實驗,而非一項依賴。
這些重量該由誰來拉?
今天就拉取它們吧,如果你的工作涉及裝置端代理、邊緣工具呼叫,或是小型模型的編碼與推理實驗,而且你想要的是目前市場上訓練最激進的 2B 等級選項。Apache-2.0 授權與開放訓練資料,消除了多數團隊對中國實驗室小型模型猶豫不決的兩個理由——沒有商業使用限制,也沒有黑箱語料庫。但如果你只是因為基準測試表格亮眼,就要挑選一個生產環境模型,那就謹慎拉取:該模型卡上的主打數據列是 OpenBMB 自己的重現結果,而 AA 的 v4.2 綜合分數——目前唯一的外部衡量——並未替這些數據背書。一個據稱超越 Qwen3.5-4B 的 2.5B 模型,這種說法值得你花兩小時親自重現 SWE-bench 來驗證。
接下來該關注什麼。這個儲存庫才剛成立約兩天,因此短期內的訊號仍屬機械性:llama.cpp 與 Ollama 模型庫是否會收錄這個 GGUF、ModelScope 鏡像站與 FlagOS 晶片構建能否順利上線,以及是否有託管 API 將 MiniCPM5-2B 列入——那一刻起,它就不再僅能自行託管。本文先前標記為尚付闕如的實質訊號——由 Artificial Analysis 或大學實驗室進行的獨立評測——如今以 v4.2 指數分數的形式到來,而這讓 MiniCPM5-2B 在 4B 參數以下的開放權重模型中維持第一。仍未補上的是逐列驗證:除了 OpenBMB,還沒有任何人重現模型卡上的內部數據,最值得注意的是 SWE-bench Verified 的 46.4 分,以及 53.9 的內部平均。在這些特定數據列被重新跑過之前,請以你對待任何低調發布、卻附有亮眼模型卡之模型的方式來看待 MiniCPM5-2B:它是個你今晚就能在本地端執行的、非常有前景的假說;而對於它最引人注目的那些數字,在你信任它處理實際工作之前,應該先親自驗證。
