
Liquid AI d1-3B 與 MiniCPM5-2B:筆電規模下的機率還是散文?
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個開放權重模型,兩者都小到足以在你面前的機器上運行,但它們對模型應該回傳什麼的看法並不一致。Liquid AI d1-3B 是 Liquid AI 的 3.12B 決策模型,於 2026 年 10 月 7 日開放權重:它讀取一個狀態與一組具名問題,並在一次前向傳遞中回傳一個標籤、每個選項的機率以及一個信心值,不生成任何東西。MiniCPM5-2B 是 ModelBest 與 OpenBMB 的 2.52B 稠密模型,於 7 月 19 日在世界人工智慧大會上亮相,並在 2026 年 9 月初以 Apache-2.0 授權悄悄發布到 Hugging Face——這是一款推理、程式編寫與工具呼叫助理,會撰寫答案、以 XML 呼叫函式,且下載次數已超過一百萬。較小者擁有四倍的上下文視窗,以及寬鬆得多的授權;較大者就算你想讓它產生一個 token 也辦不到。這兩種型態哪一個適合放進你的管線,完全取決於呼叫下游的東西想要的是數字還是一句話。
值得先注意的反轉
幾乎所有關於這個配對的直覺預期都是反的,所以就從這裡開始。
MiniCPM5-2B 是較小的模型,卻擁有更長的上下文:131,072 個 token,相較於 Liquid AI d1-3B 的 32,768 個。它同時也是兩者中授權較寬鬆的一方——Apache-2.0、不設申請門檻,訓練資料集更以 UltraData 系列的一部份隨權重一同釋出。Liquid AI d1-3B 則以 Liquid 自家的 lfm1.0 授權推出,該授權可下載、可微調,但屬於廠商自訂授權,而非標準的寬鬆式授權。
Liquid AI d1-3B 是較大的模型——總參數量為 3.12B 對 2.52B,不過在非嵌入參數上比較又會逆轉——而且它就是那個不會寫作的模型。它具備視覺能力;MiniCPM 則僅支援文字。它只針對單一任務進行後訓練;MiniCPM 則針對多種任務進行後訓練。而且,MiniCPM5-2B 登場時附有一張比較圖表,將其置於同尺寸級別的頂端,Liquid AI d1-3B 則只附上一個單一指標分數和一組延遲表。
這些都不能說明哪一個更好。這表示兩者針對的是不同的工作,而最明顯的線索就在於它們各自回傳的答案形態。
什麼會透過網路回傳?
MiniCPM5-2B 是生成式語言模型。它會推理、以文字段落作答,也會發出 XML 風格的工具呼叫,SGLang 內建的 minicpm5 解析器會將其轉換成 OpenAI 相容的 tool_calls,無需自訂轉接器。它的後訓練才是其故事中有趣的部分:4000 億個 token 的深度思考監督式微調,接著是使用向 JustRL II 借來的基於評論者演算法的強化學習,然後是在策略蒸餾,將十六個專門化的 RL 教師——其中五個是代理型——折回單一稠密網路。模型卡將推理與一般任務平均提升 10.96 分、代理型任務提升 6.96 分歸功於 RL 加上蒸餾,並報告在其自身比較集上平均為 53.9,高於該集合中納入的最大模型。這些是 ModelBest 的數字,由內部產生,尚未有獨立重現結果發表。
Liquid AI d1-3B 會回傳結構。noul 問題會以 0 到 1 之間的 P(yes) 回傳。選擇題會回傳標籤、信心度,以及每個選項的機率。評分題會回傳在 2 到 10 的排序量表上的預期等級,並附上其分佈與圖例。usage 物件會回報 output_tokens: 0,而且如果你想要未經修飾的向量,還有一個原始的 probabilities 存取器。它的後訓練則是相反類型的工作:將兩個檢查點平均在一起,在不同的資料混合上微調數個種子,將它們合併,然後把心力花在長輸入訓練、打亂答案選項順序,以及從訓練資料中移除捷徑——因為一個學會「選項 B 通常才是對的」而不是解讀狀態的決策模型,比無用還糟。
一種是要求模型先思考,然後再說出內容。另一種則是問模型它已經相信什麼。

並排顯示,並標示來源
以下每一項數據皆由廠商自行提供。MiniCPM5-2B 的數字來自 ModelBest 自家的模型卡及其自家比較集;Liquid AI d1-3B 的數字則來自 Liquid 自行執行官方 Decision Index 評分器,而非提交至公開排行榜。截至開放權重發布時,這兩個模型都尚未經第三方獨立基準測試。
• 參數 — Liquid AI d1-3B 總計 3.12B,配備 400M SigLIP2 視覺編碼器與 128,000 詞元詞彙表;MiniCPM5-2B 總計 2,516,756,480,非嵌入參數 1,981,982,720,42 層,16 個查詢頭對 2 個 KV 頭,詞彙表 130,560。
• 上下文 — Liquid AI d1-3B 為 32,768 個詞元;MiniCPM5-2B 為 131,072 個詞元。
• 輸入模態 — Liquid AI d1-3B 支援文字與圖像;MiniCPM5-2B 僅支援文字。
• 輸出 — Liquid AI d1-3B 的機率、標籤、信心度與排序分數,且零輸出符元;MiniCPM5-2B 的生成文字、推理與 XML 工具呼叫。
• 主要分數 — Liquid AI d1-3B 在 Decision Index 0.2.1 上拿到 48.57,在廠商表格中 10B 以下模型中排名第一;MiniCPM5-2B 在其自家比較集中平均為 53.9,而那是另一組衡量不同項目的資料。
• 速度 — 在 RTX 4090 上每題 8 毫秒,在 Jetson AGX Orin 64 GB 上為 26 毫秒,在 Jetson Orin Nano 上為 50 毫秒;而 Liquid AI d1-3B 每次傳遞可處理 64 個打包狀態,每秒 475 個。MiniCPM5-2B 的速度取決於它生成多少個 token,因此無法用單一數字與其對比。
• 授權條款 — Apache-2.0,無需審核即可取用,訓練資料已釋出,適用於 MiniCPM5-2B;Liquid 的 lfm1.0 適用於 Liquid AI d1-3B。
• 證據 — MiniCPM5-2B 在 Hugging Face 上有超過一百萬次下載,並有社群為期一個月的量化;Liquid AI d1-3B 只存在兩天,且沒有第三方執行。
每個人真正擅長的工作
有一個工作流程是兩個模型都能完成的,而它們完成方式的差異就是整場論證的重點。
假設你正在分流支援工單,或判斷檢索到的段落是否回答了一個問題,或依據評分標準為 LLM 輸出評分。MiniCPM5-2B 這三件事都能做到——它是一個具備工具呼叫與長上下文能力的小型推理器,你會像執行任何其他助理一樣來執行它,要求它給出標籤,然後解析回傳的任何內容。有時它會回傳乾淨的 JSON。有時它會回傳包著說明的 JSON。有時它會以錯誤的格式回傳正確答案,而這種失誤是你解析器的錯誤,而不是模型的錯誤。
Liquid AI d1-3B 無法做其他任何事,而這正是重點。在同樣這三項任務上,它回傳一個機率值和一個標籤,沒有其他需要解析的東西;對同一個狀態問三個問題,耗時是只問一個問題的 1.3 倍;而失敗模式也從「格式壞了」轉為「信心校準失準」——這至少是可量測的,因為信心就明明白白地呈現在回應裡。
MiniCPM5-2B 真正徹底勝出的地方,在於決策之後的所有下游環節。它能容納 131K 個 token,因此狀態可以是整個儲存庫的檔案樹或一份長文件,而不是只容納第一頁。它能原生撰寫工具呼叫。這是一個你能在其上打造小型代理的模型,而且它是明確針對代理式工作進行後訓練的。而它的 Apache-2.0 授權意味著,通常那套商業律師的對話不會發生。
Liquid AI d1-3B 之所以能明顯勝出,在於其延遲下限與模態。一台能在 50 毫秒內完成一次決策、且不靠 GPU 的裝置,並不是執行 MiniCPM5-2B 的裝置;儘管參數量相近,兩者卻屬於不同的硬體層級。而且這款 3B 模型看得見——供應商報告指出,在十一項公開影像基準測試中,以決策方式解讀的成績為 74.1,相較於它所衍生的視覺語言模型之 73.9;並報告若移除影像,同樣的問題成績會驟降至 45.1,這是他們用來表明答案來自像素的方式。產線的目視檢查,根本不是純文字的 2B 所能被交付的任務。

執行它們,以及它們周圍的層
兩者都是自託管的故事,而兩者的部署工作也都已經完成。Liquid AI d1-3B 推出當天就支援 llama.cpp,涵蓋從 DGX 到 Jetson 的完整 NVIDIA 堆疊、NVFP4 量化、8 位元權重與激活值的建置版本,以及已經發布的 GGUF 轉換檔。MiniCPM5-2B 是單純的 LlamaForCausalLM 架構,不需要自訂核心,只有一個 BF16 safetensors 分片,整個家族中有 GGUF 與 MLX 建置版本,並且在你有工具呼叫解析器需求時,有明文記載偏好使用 SGLang。兩者都不在我們的產品目錄中,而本文並非對其中任何一者的供應可得性聲明。
託管式替代方案是供應商自家的 API 與第三方平台。Liquid 提供託管的 d1,僅依輸入 token 計價,每百萬個 token 收費 $0.04,圖像以輸入計費,每 32×32 像素區塊算 1.5 個 token,而且完全沒有輸出計費項目;MiniCPM5-2B 沒有第一方 API,這對 Apache-2.0 開放權重的釋出而言很正常。
這兩者所餵入的,是同一個架構問題。一個負責分類、路由或護欄檢查的本機 2B 或 3B 模型,就位於那些並非由你代管的生成式呼叫之前,而這種混合——自有推論與租用推論並存——正是路由層存在的目的所要吸納的。橫跨 200 多個模型的單一端點,供應商定價以 0% 加價直接轉嫁,因此供應商一調價,當天就生效,自動容錯移轉,在某個上游服務品質下滑時啟動。擁有小型模型會讓路由問題變得更難,而非更簡單,因為現在你與他人之間的界線,成了你必須針對每一個請求逐一做出的決定。
依答案類型挑選
如果你需要的東西是標籤、機率或評分,而且選項集合是事先已知的,那麼 Liquid AI d1-3B 是更誠實的工具——它就是為這類請求而打造,答案不會以格式錯誤的形式送達。把供應商授權條款、32K 上下文,以及僅有兩天歷史的證據軌跡,當作代價接受吧。
如果你需要的是能推理、呼叫工具、容納長篇文件並以文字回答的小型模型,那麼 MiniCPM5-2B 是能力大幅領先的機器,而且它還附帶 Apache-2.0 授權,背後更有上百萬次下載所累積的他人測試作為後盾。
能從這兩個發行版本中獲益最多的團隊,就是同時運行兩者的團隊:前方是一個決策模型,答案是一個數字,而且毫秒必爭;後方則是一個小型生成式模型,負責工作中需要語言的部分。它們不是競爭對手,而是一個過濾器和一個揚聲器。

