
Microsoft-Decision-1 對比 Intern-Decision-2:快九毫秒,但校準明顯更差
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 55 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
InternLM 自家表格裡有一個本不該存在的數字,而這正是這項比較比規格表更有價值的原因。Intern-Decision-2B——2,213,241,664 個參數,以 Qwen/Qwen3.5-2B 微調而成,於 2026 年 9 月 26 日 05:36:19 UTC 上傳至 Hugging Face,且未發布任何公告——錄得33.28 ms(單張 RTX 4090 上每筆查詢的平均延遲),比自家 852 百萬參數同系列模型的 33.98 ms 略快。它還錄得其系列中最差的校準:期望校準誤差為 0.100,而 0.8B 為 0.066;擬合溫度為 2.100509348278,而 0.8B 為 2.747760550703。同時,Microsoft-Decision-1,在 Microsoft Foundry 正式推出,自2026 年 10 月 8 日起,卻完全沒有公布任何延遲數字或校準誤差——只有一段描述兩者如何測量的方法學段落。所以,這場對決真正問的問題不是兩者哪個更好,而是當你購買任何東西的中間尺寸時,你究竟買到了什麼。
這兩個模型都是決策評分器:輸入狀態、輸入有限的問題集,輸出校準後的機率,不會產生文字,也沒有需要解析的 token。正是這個共通的契約,讓兩者的差異清晰可辨。Microsoft-Decision-1 是託管的純文字 Foundry API,基於 Qwen3.5-9B,具備 32,768 個 token 的上下文視窗,沒有分散式權重,也沒有微調途徑。Intern-Decision-2B 是 Apache-2.0 檢查點,上游 Qwen 授權以 LICENSE-QWEN 形式保留,儲存庫約 4.46 GB,包含自訂推論程式碼,且任何地方都沒有託管端點。
中尺寸實際上到底是做什麼用的
InternLM 在四十秒內推送了三個檢查點:0.8B 在 05:35:57,這一個在 05:36:19,4B 在 05:36:37。在廠商自家的七項套件平均上,這個家族如人所願地依序攀升——79.38、84.68、90.02——而這是 2B 唯一看起來像是合理購買選擇的地方。在其他任何地方,它看起來都像是沒有人會刻意選擇的那個尺寸。
在決策呼叫中,提示處理佔主導地位,這就是延遲反轉的機械性解釋,而非什麼難解之謎。評分器只會對提示進行恰好一次前向傳遞,而提示長度是由狀態、結構描述與選項描述所決定——絕不是由模型寫出的任何內容決定,因為它什麼都不寫。在那種情境下,參數數量是次要成本,所以平常想改用最小檢查點的理由並不適用:你省下的不是時間,而是記憶體。0.8B 的整個儲存庫約為 1.73 GB,相對於這個模型的 4.46 GB,而這才是偏好它的誠實理由。2B 唯一真正的主張,是它剛好是那個最快的快速模型,而領先幅度小到可視為雜訊。
相較於 Microsoft-Decision-1,這種說法幾乎無關緊要,因為這兩個模型並不在同一個延遲區間。託管端點的速度,首先取決於你的部署形態——在同一標準 SKU 上,是無伺服器還是佈建輸送量——其次才取決於模型,而 Microsoft 並未公布任何每次呼叫的數據可供比較。Microsoft 確實公布的是另一項反向作用的硬性營運限制:批次推論已停用。沒有離線通道可用來分攤大量評分作業的成本,因此 Microsoft-Decision-1 管線必須為每個決策支付互動成本,而自行託管的檢查點則無論是否在進行評分,都要付出 GPU 小時。
校正欄,中間輸掉的地方
把三張 Intern-Decision 卡一起讀,這個家族的行為就不再可預測。準確率隨規模單調變化;校準則不然。2B 的 ECE 為 0.100——最弱——而擬合溫度為 2.100509348278,遠低於 0.8B 的 2.747760550703。卡片指示你使用與所下載規模一併附帶的推論模組,因為預設校準是依檢查點而異的;任何人若把封裝器從一個同系列模型複製到另一個,就會在不知不覺中套用錯誤的溫度。
在把那個 0.100 當成對權重的判決之前,這個轉換本身值得先理解。它是對該欄位的候選 logits 做 softmax,接著再對該分佈取對數後除以 temperature 的結果做第二次 softmax。由於它在第一次 softmax 之後執行,且會保持排序,因此完全無法改變 argmax。它會移動信心、yes 機率,以及某個分數問題的期望值,但標籤保持不變。如果你的 pipeline 讀取的是標籤,temperature 就是無操作,而 ECE 只是個新奇玩意。如果你的 pipeline 讀取的是機率——對它們設閾值、依它們排序、將它們餵進期望值計算——那麼 0.100 的 ECE 就是「一個如你所寫的那般有意義的閾值」與「一個並非如此的閾值」之間的差別。正確的回應是在你自己有標籤的案例上擬合你自己的 temperature,而不是斷定權重很糟。
Microsoft-Decision-1 要求完全相同的工作,但可用的起始資訊更少。其 Benchmarks 分頁指出,準確率、校準誤差、安全召回率、偽陽性率與公平性一致性是在公開與社群決策基準,加上保留的內部測試集上衡量;選項順序有加以變動;有套用配對統計檢定;且該模型「表現與領先的決策模型相當,並優於以相同方法論評估的其他開放決策模型」。沒有 ECE。沒有 Brier。沒有溫度參數。沒有準確率表。那個整體價值主張就是可信賴機率的模型,卻是這項比較中完全沒有公布任何校準數字的那一個。

合約邊界:託管模型不會做的四件事
這兩個模型看似做出相同的呼叫,而分歧就存在於它的邊緣。
• 模態 — Microsoft-Decision-1 明確僅限文字,不接受任何影像、音訊或視訊。Intern-Decision-2B 除了狀態之外,還能接受最多八張影像,這使其成為螢幕截圖初步篩檢與版面配置檢查的候選方案,而託管 API 無論準確度為何都無法提供這類服務。
• 輸入上限與失敗模式 — Microsoft-Decision-1 以單次呼叫處理最多 32,768 個 Token。Intern-Decision-2B 宣告 DecisionEngine(max_length=8192),並拒絕過大的輸入,而非將其截斷;這對評分器而言是正確行為,同時也是一道硬性限制,因為狀態、結構描述與骨架都必須在一次傳遞中全部存在;沒有任何分塊策略能保有這項契約。
• 問題形態 — InternLM 說明每次呼叫可包含一到十六個問題,每個問題最多有 62 個選項,橫跨三種欄位類型(choice、score、noul),其中 noul 是一種二元的「是/否」,會回傳一個機率,而 score 會回傳一個機率加權的期望值,尺度由你自行命名。Microsoft 記載了這些格式——是/否、多選、評分、分類、評分規準——另外還明確支援棄答選項,例如在證據不足時可選「無法判斷」,這對任何撰寫升級邏輯的人來說,是整頁最有用的一句話。
• 價格 — Microsoft-Decision-1 模型頁面並未列出費率;定價會連結至 Microsoft 的定價頁面,因此每次決策的成本得從 Azure 或帳單上查看,其中 0% 可歸因於輸出 token,因為根本沒有輸出 token。Intern-Decision-2B 每次呼叫不收費,成本全在 GPU 時間上,而且它沒有託管供應商。其儲存空間約為 4.46 GB,分別是 3.76 GB 的語言分片、612.5 MB 的視覺塔與 50.3 MB 的投影器。
哪些是已確認的,哪些又只是廠商在說?
將這兩類區分開來,正是這個家族貫徹始終的準則。由檔案清單或 HTTP 回應確認:參數量、分片映射、授權條款配對、基礎模型、底層架構——一個 Qwen3_5ForConditionalGeneration,具有 24 層、2,048 隱藏大小、8 個查詢頭對上 2 個鍵值頭、頭維度為 256、三層線性注意力對一層全注意力的重複模式、一層保留的多詞元預測層,以及 262,144 位置的嵌入上限,而 8,192 詞元的引擎上限讓這個上限實際上變得無關緊要。

供應商自行回報且未經重現:每一個準確率數字、每一項延遲數據,還有溫度參數。沒有論文、沒有 arXiv 條目、沒有發布貼文、沒有變更日誌,也沒有獨立評估。那個示範 Space 回傳 401,這表示它並非公開,而不是故障。在模型之後才出現的 GitHub 儲存庫——三次提交、訓練程式碼、兩個推論後端、一份內含 10,751 列測試資料的評估套件、一個 96 個案例的校準基準,以及一份重現指南——比大多數低調發布所獲得的文件還要多,而且它並未隨附權重、訓練資料或程式碼授權條款。微軟處於不同但相鄰的位置:其方法論是真實的,其主張是質性的,而目前兩家公司都無法讓其核心數字由你以外的任何人來查核。
OrcaRouter 在像這樣的管線中位於哪個位置
這兩款模型都不在我們的目錄中,此處任何內容都不應解讀為可用性聲明。會回傳機率而非文字訊息的模型,並不是你會將聊天補全導向的對象,而這兩款皆然。我們確實提供的是那些評分器所服務之迴圈的生成端:單一 OpenAI 相容金鑰背後超過 200 款模型,負責撰寫評分標準、草擬候選答案,並發出工具呼叫,再由評分器於執行前加以評分。供應商定價的傳遞方式是 0% 加價,因此生成端的供應商降價,當天就會在我們這裡生效;而如果你不想把門檻押在單一評審上,路由 DSL 會將數個模型組成單一呼叫,模型融合則會將它們的一致程度回報為一個你可評分的欄位。當單一供應商效能下降時,自動容錯移轉能讓這一端持續運作;在一個會為所見一切評分的迴圈中,這比在一個偶爾回答使用者的迴圈中更為重要。

底線
Microsoft-Decision-1 自 2026 年 10 月 8 日起已在 Microsoft Foundry 正式推出:託管服務、僅支援文字、32,768 個詞元、由 Microsoft 後訓練的 Qwen3.5-9B 基礎模型、不提供分散式權重,以及一份記載其方法論卻未印出任何數字的基準測試章節——包括沒有延遲數據,且批次推論為關閉狀態。Intern-Decision-2B 是 2026 年 9 月 26 日發布、具備 2,213,241,664 個參數的 Apache-2.0 檢查點,在 4090 上以 33.28 毫秒成為其三兄弟中最快的一個,卻是校準最差的一個,ECE 為 0.100,其擬合溫度 2.100509348278 無法改變任何標籤,卻會改變你據以設下閾值的每一個信心值。若你想要中間那個尺寸,支持它的理由其實很薄弱:為 4B 的準確度多付 2.7 GB,或者接受 0.8B 的佔用空間;而不論選哪一邊,都要在閾值接近正式環境之前先擬合你自己的校準。
我們確實承載的,是那些評分器為了服務而存在的迴圈中,負責生成的那一半:超過 200 個模型,背後是一組與 OpenAI 相容的金鑰,而這些模型會撰寫評分規準、起草候選答案,並發出工具呼叫,接著由評分器在執行前對它進行評分。
