
Liquid AI d1-3B 與 Intern-Decision-4B:你真正需要哪一款經過校準的決策器?
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個開放權重模型現在什麼都不寫就能回答問題,而在你把它們的 I/O schema 並排比較之前,它們看起來就像是同一個想法出現兩次。Liquid AI 的 d1-3B 於 2026 年 10 月 5 日上傳到 Hugging Face,兩天後由 Liquid 發布公告,是一個 3.12B 的多模態決策模型,其模型卡直白寫著它「不是聊天模型,不會撰寫文字」。InternLM 的 Intern-Decision-4B 於 2026 年 9 月 26 日悄悄上傳到 InternLM 組織,背後沒有部落格文章、沒有推文,也沒有發布頁面,是一個以 Qwen3.5-4B 微調而成的 4B 決策模型,同樣在單次前向傳播中為每個問題回傳一組答案分布。表面上的合約相同。底下的差異——一個會讓你頭痛的授權條款、一個可能意外寫出文字的合約,以及沒有人比較過的機器——才是決定哪一個該放進你技術堆疊的關鍵。
這兩者實際上有多接近
首先必須釐清的是,這場比較有多大一部分其實是不分高下。兩個模型都接收一個狀態,以及一組具名問題的結構描述;兩者都從佔位符位置的 logits 讀取訊號,而不是進行取樣;兩者都是多模態;而且兩者都回報自己什麼都沒寫。就呼叫的整體樣貌而言,兩者幾乎完全相同,而有趣的差異則藏在周邊細節裡。
• 規模 — Liquid AI d1-3B 總計 3.12B,基於 Liquid 的 LFM2.5-VL-3B 打造;Intern-Decision-4B 為 4B(依模型卡所列的張量數量約為 4.54B),由 Qwen3.5-4B 微調而來
• 問題類型 — d1-3B 與 Intern-Decision-4B 使用相同的三種:noul用於是/否,choice用於從具名集合中擇一,score用於有序尺度上的某一點
• 答案欄位 — d1-3B 會回傳答案,外加信心值與機率;InternLM 的結構描述則會回傳分佈,外加一個信心值,而模型卡警告該值並非經校準的機率
• 輸入上限 — d1-3B 具備 32,768 個詞元的上下文;Intern-Decision-4B 則有 8,192 個詞元的上限,會直接拒絕更長的請求,而不是截斷,且圖片也計入其中
• 授權條款 — d1-3B 依 Liquid 的 LFM Open License v1.0 授權,InternLM 端則依 Apache 2.0 授權
• 語言 — d1-3B 列出 16 種;Intern-Decision-4B 的卡片則標示為無
• 介面 — d1-3B 以模型形式提供,您載入並以 trust_remote_code=True 呼叫;Intern-Decision-4B 則以 Python 函式庫形式提供,您可透過 pip install 安裝,且僅有一個已實作的後端,請求本身的 model 欄位明確無法切換檢查點
• 廠商自身分數 — d1-3B 在 Decision Index 0.2.1 公開分割上為 48.57;Intern-Decision-4B 在其自身七組表格中平均為 90.02,Brier 分數為 0.347,期望校準誤差為 0.065
最後那兩個數字不能互相比較,把它們當成計分板會是這一頁上最容易犯的單一錯誤。它們來自不同的測試框架、不同的題目集,以及不同的評分器。

校正就是這項產品的全部,而只有其中一家以白紙黑字為它背書。
一個決策模型,唯有當它伴隨答案回傳的那個數字具有意義時,它的延遲才值得。這就是校準的意義:宣稱 0.9 的信心,應該在大約十次中對九次;而一個自信卻出錯的模型,比一個說自己不知道的模型還糟。
InternLM 就是實際採用這種做法的模型。其模型卡記載了一個擬合出的溫度值 1.99241824,該值是透過對 1,728 個指定校準案例進行負對數似然最小化得出,並保留 1,693 個案例作為驗證;數值印到小數點後八位,以便重現。它還公布了一項涵蓋 96 個案例的前後對照先導實驗,展示該機制確實在運作,而不是只憑宣稱:校準前 Brier 為 0.628、ECE 為 0.213,校準後則為 0.550 與 0.089。Brier 與 ECE 是衡量所陳述機率是否誠實的兩項標準指標,而這次的變化幅度很大。
Liquid 並未發布任何對等內容。d1-3B 自家的模型卡載有準確率類型的基準測試——SQuAD 2.0 85.3、Civil Comments 93.0、MASSIVE 意圖 87.3、PubMedQA 66.0、BoolQ 86.7、XNLI 85.0、PAWS-X 76.9,平均 77.1——以及其在 Decision Index 上的 48.57,而該模型宣稱的賣點是經過校準的具型別答案。但沒有 ECE 欄列,沒有 Brier 欄列,也沒有公布擬合溫度。
那種不對稱並不代表 Qwen3.5-4B 的後繼模型比以 LFM2.5-VL-3B 打造的 3B 模型校準得更好;它代表的是,在這兩張模型卡之間,其中一張提供你重現該說法所需的運算依據,另一張則只提供你那個說法。如果你的管線會對信心值設下閾值——高於 0.8 就分流,低於 0.4 就升級處理——你今晚就能驗證 InternLM 那一邊,而 Liquid 那一邊你只能做抽查。
這項但書對雙方都適用。兩組數字都出自第一方。兩個模型都未經獨立第三方評分,而 InternLM 的校準說法,是基於 InternLM 自家 96 個案例的前導測試,並以 InternLM 自家的擬合結果作為對照。
要求你提供號碼的授權
Intern-Decision-4B 採用 Apache 2.0 授權,承襲自 Qwen3.5-4B,並保留上游聲明——可商業使用、可再散布、可微調,其中完全沒有任何收益方面的問題。
d1-3B 採用 Liquid 的 LFM Open License v1.0,而第 5 條是那種在採購部門讀到之前,沒有人會去讀的部分。商業使用僅在您或您的法律實體維持低於某個門檻的條件下才獲授予;該門檻在同一份文件中定義為年營收達一千萬美元以上;超過該門檻的使用則完全未獲授權。非營利組織與研究使用者則被排除在外。
對個人或小型團隊來說,兩者都免費。對任何設有財務部門的組織而言,這兩個儲存庫就是不同的產品,而差別在於某個數字,你要嘛高於它,要嘛不高於它。
d1-3B 基準測試表的尾端,才是它真正的主張
Liquid 模型卡上的頭條數字是 Decision Index 0.2.1 上的 48.57,領先表內其他低於 10B 的列;這張表從 Winnow-12B 的 50.02 一路排到 Decider 2B 的 28.97。讓這個數字值得引用的是位於其下方的區辨指數。在 Decision Index 本身的子分數上,d1-3B 在工具項目得分 74.5、在藝術項目得分 36.3,知識項目卻僅有 23.8——對上 Decider 35B-A3B,這個規模為其 12 倍的 36B 混合專家模型,在工具項目得分 56.5、藝術項目得分 32.6、知識項目得分 31.8。

換句話說,3B 並不是一個各方面都稍微差一點的小模型。它是一個在結構化工具式決策上異常強、但在需要世界知識的問題上異常弱的小模型,而且在最像它被打造來執行的那份工作的兩類任務上,它還勝過 36B。如果你的決策是「這五個具名動作中該選哪一個」以及「這是否有檢索到的段落作為依據」,那麼規模差距所發揮的作用會比你預期的更小。如果你的決策仰賴模型必須事先掌握的事實,那就等著看 23.8 的表現浮現吧。
那個論點在視覺方面還有第二個版本。d1-3B 在十一項公開圖像基準測試中平均得分 74.1,而其自家基礎模型為 73.9,而把圖像移除後,同樣的題目得分為 45.1——因此,在圖像題目上,答案確實是來自圖片。它與其基礎模型水準相當,而非優於它,而各基準測試的逐項數據則好壞參半:CV-Bench 82.1 對 87.6,POPE 88.5 對 90.1,BLINK 59.2 對 58.7。
也值得注意 InternLM 卡片中的停頓:其高總分來自問題驅動的任務,例如 Typed Decision 80.55 和 ToolACE 96.45,而 Jevbench-Hard 則為 73.87。當模式變難時,分數就會下降。
速度:差距不在你預期的地方
d1-3B 標榜在 RTX 4090 上單一問題為 8 毫秒、在 MI325X 上為 9 毫秒,三個問題共用一個狀態時為 21 毫秒、在 Jetson AGX Thor 上為 16 毫秒,以及在 4090 上每秒 475 次決策、在 MI325X 上每秒 1,106 次決策的打包吞吐量。
Intern-Decision-4B 的卡片在相同的 RTX 4090 上測得端到端平均 44.16 ms,中位數為 44.03 ms,P95 為 44.60 ms。
那看起來像是 5 倍的優勢,但其實不是,因為兩者衡量的是不同的東西。Liquid 的數字是暖機後的模型呼叫,一次一個請求,核心選擇與編譯成本已預先支付——說明卡明確指出,在 4090 上,未使用 CUDA graph 編譯時,單一問題耗費 16 毫秒,而首次以新形狀呼叫時需支付編譯成本。InternLM 的 44 毫秒是透過 Python 函式庫的每查詢端到端時間,該函式庫唯一實作的後端是本地 Hugging Face 推論,因此包含了周遭的機制。兩個數字都沒有錯。把兩者放在同一個測試框架下、同一台機器上、相同形狀的請求,差距就會縮小到一個你會想要實際測量、而非憑空假設的程度。
沒有疑問的是上限。8,192 個 token 在 InternLM 這邊是硬性拒絕,而圖像 token 也從同一份預算中支出,所以一份長文件加上一張截圖的請求,回來的是拒絕,而不是被截斷。d1-3B 給你 32,768 個 token 可用。如果你的狀態是工單與簡短往來,這個落差永遠不會咬人。如果它們是整頁大小的,那麼在任何基準測試之前,它就先決定了這個問題。
將它們作為一組來運行,而非互換。
回答一個特定的是/否問題,和回答「這是六個具名項目中的哪一個,以及你有多確定」是兩種不同的要求;而這兩張卡片的形態差異大到——一張有硬性輸入上限與已發佈的校準擬合,另一張有 32K 上下文與更好的評分尾部——以至於對同時評估兩者的團隊而言,有用的部署方式往往不是替代方案,而是一組並行模型:把相同狀態同時交給兩個模型,並將出現分歧的案例轉給人類或更大的模型。
這兩款模型都不在我們的目錄上,而這也不是一項可用性聲明;兩者都是自行託管的產物。但面板正是那種由路由層實際做事、而非文書作業的形態。OrcaRouter 在單一 API 金鑰後方提供超過 200 款模型,供應商定價以 0% 加成原樣傳遞——因此當你透過我們路由的供應商降價時,你的帳單當天就會跟著變動——而且跨供應商自動容錯移轉可避免一個雙模型面板變成兩個單點故障。你今天所路由的模型並不是這兩款;它們是你將要取代的託管通用型模型,例如 Qwen3.5-27B,每百萬輸入權杖 $0.086、每百萬輸出權杖 $0.688,而這就是自行託管的 3B 在把 GPU 算進去之後必須超越的數字。
本週該做什麼
如果你的決策屬於短狀態,授權條款必須能通過你公司的審查,而且你想要最廣泛的建置目標——llama.cpp、Ollama、LM Studio、一條能在單次執行中跑完 64 個狀態的打包批次路徑——那麼 d1-3B 是兩者中更產品化的一款,而且它的工具與藝術辨別力是兩張卡所展示的最強項目。如果你的決策涉及長狀態,或者你需要沒有營收條款的授權,或者你想要可重現的校準擬合,以及一個周邊成本已被計算在內的測試框架,那麼 Intern-Decision-4B 才是你能夠實際查核其書面文件的那一個。

令人不安的部分對兩者來說都一樣:沒有任何獨立第三方跑過這兩個模型中的任何一個,也不存在任何不是由撰寫該卡片的供應商委託進行的校準比較。對於一個其全部價值就在於答案旁那個數字代表什麼的模型類別而言,這正是在你對任何事物設下閾值之前值得填補的落差。
