
Intern-Decision-2B 對上 MiniCPM5-2B:兩個相隔二十天的 2B 檢查點,以截然相反的方式運用參數
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
internlm/Intern-Decision-2B與openbmb/MiniCPM5-2B兩者大小相同、相隔二十天發布、採用相同的授權方式,卻是為了毫不相似的任務而打造。InternLM 的檢查點是 2,213,241,664 個參數的決策評分器:它接收一個狀態與帶型別的題目,執行一次前向傳遞,回傳校準後的機率,而不生成任何 token,並拒絕任何超過 8,192 個 token 的輸入。OpenBMB 的則是 2,516,756,480 個參數的稠密通才模型:一個衍生自 MiniCPM5 配方的 42 層 Llama,可吃下 131,072 個 token 的上下文,能撰寫程式碼、呼叫工具並進行數學運算,Artificial Analysis 智慧指數為 12.5,上個月下載量達 726,518 次。兩者下載成本相同,卻能換到截然不同的東西。
這個配對有趣的地方不在於基準測試差距——幾乎沒有重疊的基準測試可供比較。而在於 22 億與 25 億參數的預算各自能花在什麼地方,以及這個選擇能告訴你哪一個已經完成。MiniCPM5-2B 是該系列的第二個模型,接續五月的 MiniCPM5-1B,而且問世時帶著完整的發布配套。Intern-Decision-2B 是 InternLM 於 2026 年 9 月 26 日 05:36 UTC 無預警推送至 Hugging Face 的三種尺寸中的中間款,而它的發布配套——訓練程式碼庫、經雜湊驗證的評估套件、96 個案例的校準基準——直到今天早上 08:58 UTC 才公開。
那兩筆預算去了哪裡
這兩個模型都是對他人架構進行微調的成果,且兩者都佔據約 25 億個參數。相似之處僅止於此。

MiniCPM5-2B 是一個稠密 Transformer,具有 42 層、隱藏層大小 2,048、16 個注意力頭、中間大小 6,144、130,560 個 token 的詞彙表,以及 131,072 個 token 的上下文,並以 OpenBMB 隨其一同發布的開放語料庫混合物進行訓練:UltraX 用於網頁預訓練,UltraData-Code 具備 L0–L3 分層程式碼管理,UltraData-Math,以及 UltraData-RL-2609 中的 500,000 個代理 SFT 樣本與超過 80,000 個 RL 樣本。它的後訓練先執行 SFT,接著在數學、程式碼與代理式任務中由專業化的 RL 教師模型進行訓練,然後再透過同策略蒸餾整合回單一模型。它是一個通用模型,其全部參數預算都被展露為你可以透過提示使用的能力。
Intern-Decision-2B 是一個 Qwen3_5ForConditionalGeneration,具有 24 層——三層線性注意力對一層全注意力的重複模式——隱藏大小 2,048,8 個查詢頭對 2 個鍵值頭,頭維度 256,一個保留的多詞元預測層,以及 262,144 位置的嵌入上限。它隨附一個 612.5 MB 的視覺塔和一個 50.3 MB 的投影器。那筆預算中幾乎沒有一絲能作為提示供你使用:該模型回答一組固定綱要的問題,而它的架構是 softmax 的傳遞機制,而非文字生成器。
InternLM 新發布的儲存庫中有一個細節值得特別提出來,因為它重新詮釋了模型卡上的多模態標籤。決策調校「微調 Qwen3.5 的語言骨幹,同時凍結視覺塔與投影器」。2B 和 4B 的決策檢查點都帶有一個大小恰好為 612,517,440 位元組的視覺分片——兩者大小相同——這與這些元件是從 Qwen 基礎模型繼承而來、而非經過訓練的情況一致。影像路徑是真實的,而且可以使用,但這並不是 InternLM 的決策調校投入心力之處。如果你的工作負載是純文字的決策評分,那麼那次 4.46 GB 下載中約有 660 MB 對你毫無用處。
計分板

• 參數量 — Intern-Decision-2B 為 2,213,241,664,以 BF16 格式儲存,加上約 660 MB 的視覺塔與投影器,儲存庫約 4.46 GB;MiniCPM5-2B 為 2,516,756,480,以 BF16 格式儲存,單一 5.03 GB 的 safetensors 檔案。
• 上下文 — Intern-Decision-2B 為 8,192 個 token,超過此數即直接拒絕,不進行截斷;MiniCPM5-2B 則為 131,072 個 token。
• 輸出 —— 每個欄位一個校準分佈加上一個 argmax,完全沒有文字;生成的文字,逐個 token 產生。
• 訓練 —— 對 Qwen3.5-2B 主幹進行決策調校,視覺塔凍結,訓練資料未公開;完整預訓練、中期訓練,以及 4000 億詞元的深度思考 SFT 階段,隨後進行強化學習與同策略蒸餾,語料集亦一併公開。
• 已發表的證據 — 一張七套件供應商表平均為 84.68,Brier 為 0.437,ECE 為 0.100,未經任何第三方重現,一個讚與零次下載;一張 OpenBMB 卡片在其自身比較集中平均為 53.9,以及獨立的 Artificial Analysis Intelligence Index 為 12.5,過去一個月有 726,518 次下載。
• 授權條款 — Apache-2.0,並將上游 Qwen 條款保留為 LICENSE-QWEN,而程式碼儲存庫完全未載明任何授權條款;全面皆為 Apache-2.0,程式碼亦包含在內。
它們各自實際上更擅長什麼,而且差距不小
這個比較不對稱到成了範疇錯誤的地步,因此更有用的是指名具體的工作。
MiniCPM5-2B 在所有涉及產生答案而非選擇答案的任務上都勝出。它能撰寫程式碼;Intern-Decision-2B 則沒有程式碼路徑。它能處理 131,072 個 token 的上下文;Intern-Decision-2B 僅支援到 8,192,且會大聲報錯。它能呼叫工具,在 OpenBMB 自家的表格中 BFCL v4 得分為 66.6;並且它能進行數學運算,MATH-500 得分為 94.6,GPQA-Diamond 為 70.2——這些數字來自廠商的規格卡,其中 GPQA 那一行帶有規格卡本身提供的註腳。它在 MMLU-Pro 上達到 70.8,在 MMLU-Redux 上達到 84.7。它能在 llama.cpp 和 MLX 中運行,以 GGUF、GPTQ 和 DSpark 變體形式發布,並且在 Hub 上有一個公開的示範 Space,不像 Intern-Decision 的規格卡所指的 401。
Intern-Decision-2B 只贏得兩件事,而這兩件事正是它存在的理由。首先,一個由你撰寫 schema 的封閉集合決策,會在單次前向傳遞中、約 33 毫秒內回傳一個你可以設定閾值的機率,不需剖析器、也不需取樣——這種形態是 MiniCPM5-2B 除非生成文字並指望其中的數字表現良好,否則無法產生的。其次,它是一項可重現的產物:該儲存庫現在包含訓練目標、七個附有 SHA-256 雜湊與各套件列數的準確度套件、評分程式碼、溫度擬合與重播腳本,以及一個擁有自身生成器與離線評分器的 96 案例分布校準基準。InternLM 的評估指南指出,發布的預設集綁定於 XTuner 後端,而 HF 結果應回報為不同的執行設定——這正是重現套件存在的目的:讓這類但書變得可檢核。

誰應該下載哪一個
如果你有一項任務涉及閱讀長篇內容、撰寫某些東西,或回答一個你沒有事先列舉選項的問題,那麼 MiniCPM5-2B 就是那個模型,沒有什麼好決定的。它是一個成熟的 2B 級別通用模型,擁有真實的生態系、背後的開放資料以及獨立評測清單,而且嘗試它不需任何成本——GGUF 與 MLX 版本已經在 Hub 上。
如果你有一項任務,本質上是在已知答案中做選擇——轉派工單、分類支援電子郵件、標註候選項、以序數尺度為意圖評分——那麼生成模型就是錯誤的工具,而 Intern-Decision-2B 是兩者中更有趣的那個,儘管幾乎沒有人跑過它。一個可以設閾值的機率,操作成本更低、更容易審核,而且不可能產生幻覺;而這個檢查點附帶的是重現套件,而不是排行榜貼文,這使得它在真正重要的那個軸線上——當你必須為選擇辯護時——是兩者中文檔記錄更完善的那個。
這兩個模型都不在 OrcaRouter 上。我們針對 Intern-Decision-2B 的模型頁面會回傳 404,而且也沒有 MiniCPM5-2B 的路由;這裡沒有任何內容是在宣稱可用性,而兩者都意味著你得自行執行推論。實務上真正存在替代方案的地方,在於託管的決策模型:TypeSafe 的 Jev 1.13,也就是 InternLM 用來對其整個模型家族做基準測試的那個模型,已在型錄上,價格為每百萬輸入 token 0.042 美元,具備 65K 上下文,P50 首 token 時間為 178 毫秒。而如果你真正需要的是一個與 MiniCPM5-2B 同尺寸級別、又不必負擔維運工作的通用模型,我們最小的託管 Qwen 路由雖然規模大了好幾倍,但它是 200 多個模型中的其中一把金鑰,價格為供應商定價原價轉嫁、不加價,並有自動容錯移轉作為後盾。
決定一切的那個數字
這不是 84.68 對上 53.9。那兩個平均值來自不同的測試套件,由不同實驗室測量,而且其中一個還是由一間從未有人檢查過其數字的實驗室所測得。真正決定這件事的數字是 8,192。如果你的狀態能塞進八千個 token 之內,而且你的答案已經是一份清單,那麼 Intern-Decision-2B 就是一件精準儀器,附有重現套件,還有一個你應該留意的校準異常——它的預期校準誤差 0.100 是 InternLM 所公布的三種尺寸中最糟的,而尺寸只有它一半的模型則是 0.066,所以在信任任何信心值之前,先自行擬合你的溫度參數。如果你的狀態塞不下,這個問題在基準測試開始之前就已經結束了,而 MiniCPM5-2B 就是答案。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
