
Microsoft-Decision-1 對比 Intern-Decision-4B:一個發布其校準,另一個發布其方法論
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
把 Microsoft-Decision-1 與 Intern-Decision-4B 放在一起,就會得到一場比較,而決定這場比較的,與其說是能力,不如說是各家廠商願意公開什麼。微軟的模型於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:以 Qwen3.5-9B 為基礎,由微軟進行後訓練,僅支援文字,32,768 個 token 的上下文,權重未發布,評估方法說明了準確度、校準誤差與配對統計檢定——卻沒有任何一項結果。InternLM 的 Intern-Decision-4B 於 2026 年 9 月 26 日 05:36:37 UTC 上傳到 Hugging Face,背後沒有任何公告,是從 Qwen3.5-4B 微調而來,除了文字也能接受影像,在單張 RTX 4090 上以 44 毫秒執行,並印出 Brier 與期望校準誤差的完整數值表。兩者都會針對你提供的選項回傳機率分佈。但只有其中一個會告訴你它做得有多好。
那種倒置——規模更大、資金更充裕的模型反而不透明——正是這場對決的全貌,而它比任何規格條目都更快地為大多數團隊決定了選擇。
區分它們的那一個數字
InternLM 針對 Intern-Decision-4B 在其基準測試套件上回報 Brier 0.347 與 ECE 0.065,平均分數為 90.02,涵蓋 Jevbench-Easy(100.00)、Jevbench-Original(98.61)、Jevbench-Hard(73.87)、Typed Decision(80.55)、ToolACE(96.45)、AG News(90.82)與 WildJailBreak(89.86)。這些是廠商在自家測試框架上回報的數字,尤其是 Jevbench 各列,屬於該專案自家的基準測試系列——請把它們解讀為自我評估,而非獨立驗證。但這些數字附有明確標示的尺度,而 ECE 尤其是能告訴你回傳的 0.8 是否值得據以行動的那個數字。
微軟並未發布同等資訊。Microsoft-Decision-1 目錄頁面上的 Benchmarks 索引標籤說明了衡量了哪些項目,並宣稱該模型「表現與領先的決策模型相當,且領先其他以相同方法評估的開放決策模型」,其中最強的領域為推理、規則應用與提示格式穩健性,最弱的則是專業領域知識。沒有 Brier,沒有 ECE,也沒有準確率表。如果你的採用決策需要一個校準數值,才能設定升級門檻,那麼這兩個模型之中,一個會直接把它交給你,另一個則要你自己去測量。

這兩份合約實際上的差異之處
表面上,這些模型接受同一種呼叫。你提供一個狀態、一份具名問題的結構描述,以及一組固定選項;取回的則是每個選項的機率,且不含任何生成的文字符元。差異會出現在這份合約的邊界上。
• 模態 — Microsoft-Decision-1 明確僅支援文字,不接受或產生影像、音訊或視訊內容。Intern-Decision-4B 可接受伴隨狀態的選用圖片,每次呼叫最多八張,這使其成為螢幕截圖分流、文件版面檢查與視覺 QA 路由的候選方案。
• 問題基數 — InternLM 記載每次呼叫 1 到 16 個問題,每個問題最多 62 個選項,涵蓋三種欄位類型(選擇、分數、noul)。Microsoft 記載了這些格式——是/否、多選、評分、分類、評分規準——以及單次呼叫最多 32K token,但沒有每次呼叫的問題上限。
• 上下文 — Microsoft 表示為 32,768 個 token。Intern-Decision-4B 的卡片是以問題、選項和圖片來陳述其限制,而非以單一上下文數字呈現,因此你無法用單一數字將兩者對齊比較。
• Microsoft-Decision-1 — Microsoft-Decision-1 是託管的 Foundry API;不提供模型權重,亦無法下載。Intern-Decision-4B 在 Hugging Face 上以 Apache-2.0 授權發布,並保留上游 Qwen 授權條款,即 LICENSE-QWEN,這表示若您重新散布,必須保留該授權條款及上游聲明。
• 成本樣態 — InternLM 的權重執行起來不花任何成本,在單張 RTX 4090 上報稱平均為 44.16 毫秒、P95 為 44.60 毫秒。Microsoft 的每 token 價格則完全沒有印在模型頁面上。
• 治理 — 微軟提供負責任 AI 評估、有文件記錄的部署實務,以及明確的排除事項(不適用於文字生成、開放式問答、對話、翻譯或摘要;不得在涉及人的重大決策中成為唯一的自動決策者)。InternLM 則提供一份對其來源坦白的模型卡——權重「經決策調校修改」——卻完全沒有類似合規套件的東西。

延遲數值難以比較的兩個截然不同的原因
Microsoft-Decision-1 並未公布延遲數據,因此沒有什麼可以跟 InternLM 的 44.16 毫秒平均值並列。對這個工作負載而言,這不是一個小疏漏。這些模型的存在,是為了在管線內被反覆呼叫——每取回一份文件一次、每提出一個工具呼叫一次、每個待評分的回應一次——而每秒四次決策與每秒四十次決策之間的差異,就是為一個樣本評分與為所有內容評分之間的差異。InternLM 的數字如今已可在你能按小時租用的硬體上達成;Microsoft 的數字則必須透過你自己的 Foundry 部署來測量,而你選擇的部署形態(隨用隨付的無伺服器與佈建輸送量)對它的影響,會比模型本身更大。
這也是 OrcaRouter 在這個模式中所負責的那一半發揮作用的地方,而且僅限於生成的那一半。我們不託管 Microsoft-Decision-1 或 Intern-Decision-4B——一個回傳機率而非文字的模型,不是你會把聊天補全導向的對象,而且兩者都不在我們的目錄中。我們那一組 OpenAI 相容金鑰背後,是負責執筆、超過 200 個模型的池子:由某個模型草擬的評審提示詞、由另外兩個模型產生的候選答案、在執行前先被評分的工具呼叫。供應商定價以 0% 加成原樣轉嫁,因此生成模型降價時,我們這邊當天就生效;而當單一供應商效能下降時,自動容錯切換能讓評分迴路的生成端持續運作——這在這裡格外重要,因為一條會為所見一切評分的管線,沒有餘裕重試停滯的呼叫。

誰應該拿哪個
若下列任一情況成立,請選擇 Intern-Decision-4B:你需要同時對圖片和文字評分、你需要在出貨前先取得校準數值、你希望能在自己掌控的界線內於自有硬體上執行模型,或者你想對它進行微調。最後一點值得強調——一個附有文件化封裝器的 4B 開放權重評分器,是你可以調整以符合自家標籤的模型,而 Microsoft-Decision-1 則是託管 API,沒有微調途徑,也沒有可調整的權重。
選擇Microsoft-Decision-1,如果卡點是採購而非效能:在任何東西進入正式環境之前,你需要 Azure 身分驗證、統一計費、治理,以及供應商的負責任 AI 評估;而且長文件需要 32K 上下文,但 4B 的每次呼叫限制會使這點變得複雜。它缺乏已發布的基準測試是一項實際成本,但這是一項你只要花一個下午就能擺脫的成本:用你自己的標註集跑過這兩個模型並比較 ECE——而這本來就是你在信任任一供應商表格之前會做的事。
令人不安的答案是,這兩者測試起來都便宜到幾乎不值得爭論。Intern-Decision-4B 只需要一張你大概已經有的 GPU。Microsoft-Decision-1 則需要一個 Foundry 部署,以及一份你自己標註的決策樣本。把你的資料跑過這兩者,在你真正在意的那個子集上計算校準度,然後讓數字來決定——而這恰如其分地正是這些模型的用途。
