一張為 Microsoft-Decision-1 對 Intern-Decision-4B 生成的標題卡,副標題為「兩個評分器,一個有數字,一個沒有」,標籤寫著 9B 對 4B、託管 API 對開放權重、沒有已發布基準對 Brier 0.347 與 ECE 0.065,並附有來源註腳,註明 Microsoft 的數字未經重現,而 InternLM 的數字為廠商報告。
Guides & Insights

Microsoft-Decision-1 對比 Intern-Decision-4B:一個發布其校準,另一個發布其方法論

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Microsoft-Decision-1 與 Intern-Decision-4B 放在一起,就會得到一場比較,而決定這場比較的,與其說是能力,不如說是各家廠商願意公開什麼。微軟的模型於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:以 Qwen3.5-9B 為基礎,由微軟進行後訓練,僅支援文字,32,768 個 token 的上下文,權重未發布,評估方法說明了準確度、校準誤差與配對統計檢定——卻沒有任何一項結果。InternLM 的 Intern-Decision-4B 於 2026 年 9 月 26 日 05:36:37 UTC 上傳到 Hugging Face,背後沒有任何公告,是從 Qwen3.5-4B 微調而來,除了文字也能接受影像,在單張 RTX 4090 上以 44 毫秒執行,並印出 Brier 與期望校準誤差的完整數值表。兩者都會針對你提供的選項回傳機率分佈。但只有其中一個會告訴你它做得有多好。

那種倒置——規模更大、資金更充裕的模型反而不透明——正是這場對決的全貌,而它比任何規格條目都更快地為大多數團隊決定了選擇。

區分它們的那一個數字

InternLM 針對 Intern-Decision-4B 在其基準測試套件上回報 Brier 0.347 與 ECE 0.065,平均分數為 90.02,涵蓋 Jevbench-Easy(100.00)、Jevbench-Original(98.61)、Jevbench-Hard(73.87)、Typed Decision(80.55)、ToolACE(96.45)、AG News(90.82)與 WildJailBreak(89.86)。這些是廠商在自家測試框架上回報的數字,尤其是 Jevbench 各列,屬於該專案自家的基準測試系列——請把它們解讀為自我評估,而非獨立驗證。但這些數字附有明確標示的尺度,而 ECE 尤其是能告訴你回傳的 0.8 是否值得據以行動的那個數字。

微軟並未發布同等資訊。Microsoft-Decision-1 目錄頁面上的 Benchmarks 索引標籤說明了衡量了哪些項目,並宣稱該模型「表現與領先的決策模型相當,且領先其他以相同方法評估的開放決策模型」,其中最強的領域為推理、規則應用與提示格式穩健性,最弱的則是專業領域知識。沒有 Brier,沒有 ECE,也沒有準確率表。如果你的採用決策需要一個校準數值,才能設定升級門檻,那麼這兩個模型之中,一個會直接把它交給你,另一個則要你自己去測量。

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

這兩份合約實際上的差異之處

表面上,這些模型接受同一種呼叫。你提供一個狀態、一份具名問題的結構描述,以及一組固定選項;取回的則是每個選項的機率,且不含任何生成的文字符元。差異會出現在這份合約的邊界上。

• 模態 — Microsoft-Decision-1 明確僅支援文字,不接受或產生影像、音訊或視訊內容。Intern-Decision-4B 可接受伴隨狀態的選用圖片,每次呼叫最多八張,這使其成為螢幕截圖分流、文件版面檢查與視覺 QA 路由的候選方案。

• 問題基數 — InternLM 記載每次呼叫 1 到 16 個問題,每個問題最多 62 個選項,涵蓋三種欄位類型(選擇、分數、noul)。Microsoft 記載了這些格式——是/否、多選、評分、分類、評分規準——以及單次呼叫最多 32K token,但沒有每次呼叫的問題上限。

• 上下文 — Microsoft 表示為 32,768 個 token。Intern-Decision-4B 的卡片是以問題、選項和圖片來陳述其限制,而非以單一上下文數字呈現,因此你無法用單一數字將兩者對齊比較。

• Microsoft-Decision-1 — Microsoft-Decision-1 是託管的 Foundry API;不提供模型權重,亦無法下載。Intern-Decision-4B 在 Hugging Face 上以 Apache-2.0 授權發布,並保留上游 Qwen 授權條款,即 LICENSE-QWEN,這表示若您重新散布,必須保留該授權條款及上游聲明。

• 成本樣態 — InternLM 的權重執行起來不花任何成本,在單張 RTX 4090 上報稱平均為 44.16 毫秒、P95 為 44.60 毫秒。Microsoft 的每 token 價格則完全沒有印在模型頁面上。

• 治理 — 微軟提供負責任 AI 評估、有文件記錄的部署實務,以及明確的排除事項(不適用於文字生成、開放式問答、對話、翻譯或摘要;不得在涉及人的重大決策中成為唯一的自動決策者)。InternLM 則提供一份對其來源坦白的模型卡——權重「經決策調校修改」——卻完全沒有類似合規套件的東西。

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

延遲數值難以比較的兩個截然不同的原因

Microsoft-Decision-1 並未公布延遲數據,因此沒有什麼可以跟 InternLM 的 44.16 毫秒平均值並列。對這個工作負載而言,這不是一個小疏漏。這些模型的存在,是為了在管線內被反覆呼叫——每取回一份文件一次、每提出一個工具呼叫一次、每個待評分的回應一次——而每秒四次決策與每秒四十次決策之間的差異,就是為一個樣本評分與為所有內容評分之間的差異。InternLM 的數字如今已可在你能按小時租用的硬體上達成;Microsoft 的數字則必須透過你自己的 Foundry 部署來測量,而你選擇的部署形態(隨用隨付的無伺服器與佈建輸送量)對它的影響,會比模型本身更大。

這也是 OrcaRouter 在這個模式中所負責的那一半發揮作用的地方,而且僅限於生成的那一半。我們不託管 Microsoft-Decision-1 或 Intern-Decision-4B——一個回傳機率而非文字的模型,不是你會把聊天補全導向的對象,而且兩者都不在我們的目錄中。我們那一組 OpenAI 相容金鑰背後,是負責執筆、超過 200 個模型的池子:由某個模型草擬的評審提示詞、由另外兩個模型產生的候選答案、在執行前先被評分的工具呼叫。供應商定價以 0% 加成原樣轉嫁,因此生成模型降價時,我們這邊當天就生效;而當單一供應商效能下降時,自動容錯切換能讓評分迴路的生成端持續運作——這在這裡格外重要,因為一條會為所見一切評分的管線,沒有餘裕重試停滯的呼叫。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

誰應該拿哪個

若下列任一情況成立,請選擇 Intern-Decision-4B:你需要同時對圖片和文字評分、你需要在出貨前先取得校準數值、你希望能在自己掌控的界線內於自有硬體上執行模型,或者你想對它進行微調。最後一點值得強調——一個附有文件化封裝器的 4B 開放權重評分器,是你可以調整以符合自家標籤的模型,而 Microsoft-Decision-1 則是託管 API,沒有微調途徑,也沒有可調整的權重。

選擇Microsoft-Decision-1,如果卡點是採購而非效能:在任何東西進入正式環境之前,你需要 Azure 身分驗證、統一計費、治理,以及供應商的負責任 AI 評估;而且長文件需要 32K 上下文,但 4B 的每次呼叫限制會使這點變得複雜。它缺乏已發布的基準測試是一項實際成本,但這是一項你只要花一個下午就能擺脫的成本:用你自己的標註集跑過這兩個模型並比較 ECE——而這本來就是你在信任任一供應商表格之前會做的事。

令人不安的答案是,這兩者測試起來都便宜到幾乎不值得爭論。Intern-Decision-4B 只需要一張你大概已經有的 GPU。Microsoft-Decision-1 則需要一個 Foundry 部署,以及一份你自己標註的決策樣本。把你的資料跑過這兩者,在你真正在意的那個子集上計算校準度,然後讓數字來決定——而這恰如其分地正是這些模型的用途。