
Microsoft-Decision-1 對上 Intern-Decision-0.8B:半盎司的越獄麻煩,對上一個託管的空白
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 55 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
先從一篇發布貼文會略去的那一欄談起。Intern-Decision-0.8B——InternLM 的 852,985,920 參數決策模型,從 Qwen3.5-0.8B 微調而來,於 2026 年 9 月 26 日上傳到 Hugging Face,沒有公告、沒有論文,還有一個仍會 404 的 GitHub 連結——在 WildJailBreak 上測得 64.48,對照 TypeSafe 的 Jev 1.13 參考值 96.29。這不是四捨五入的差異。這是一個職責完全就是判斷輸入的模型,在拒答穩健性上的崩塌,而且還刊在廠商自家的模型卡上,放在一張基準屬於競爭對手的表裡。把這跟 Microsoft-Decision-1並列——它於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出,是一個以 Qwen3.5-9B 後訓練而成的純文字評分器,有記錄在案的評估方法論,底下卻沒有印出任何一項結果——你就能看出這場對決真正的樣貌。這兩個模型中,有一個會告訴你一個讓自己難看的數字。另一個則會告訴你它原本會採用哪些指標。
那個反轉比規格表更有價值。兩個模型都接收一個狀態和一組有界的問題,並回傳你的各個選項的機率——兩者都不生成文字,而在這個軸線上,它們是同一類工具。真正有差的差異在於:由誰運行、它有多大、你能驗證多少,以及一個較小、較低調、可完整下載的模型仍選擇公開的安全欄位。
每一個實際上回傳什麼
Microsoft-Decision-1 是託管 API,而這是第一個結構性差異。權重不會被散布——沒有下載、沒有存放庫、沒有微調途徑——而整合意味著在 Foundry 上部署,並附帶 Azure 驗證、計費與治理。它會對最多 32,768 個詞元 執行單次遍歷,支援是/否、多選、評分、分類與評分規準形式的問題,且輸入為純文字、輸出為數值。當證據不足時,它明確支援例如「無法判斷」的棄權選項,這正是讓閾值具有意義的原因。
Intern-Decision-0.8B 則是相反的安排。它是 Apache 2.0 權重,並在旁邊保留上游的 Qwen 授權作為 LICENSE-QWEN,約1.73 GB的儲存庫,分散於三個分片——一個 1.50 GB 的語言分片、一個 176 MB 的視覺分片,以及一個 25 MB 的投影器——可放進單張消費級 GPU 或配備完善的筆記型電腦。它接受一個狀態、一份包含一至十六個具名問題(每個問題最多 62 個選項)的結構描述,以及可選的最多八張圖片,而其隨附的inference.py對這份合約的記載,比大多數已發佈的模型所願意費心的還要詳細:選項會對應到單一詞元的符號 A–Z,接著 a–z,然後 0–9;logits 會在預先算繪的骨架中,緊接在每個<decision>預留位置之前的位置讀取;softmax 只針對該欄位的合法候選項計算;並套用一個擬合過的溫度參數。
這兩份授權並不是同一筆採購。Microsoft-Decision-1 給你一個受管理的端點,但不提供任何你擁有的成品。Intern-Decision-0.8B 則給你一個你擁有的成品,但沒有端點、沒有支援合約,也沒有儲存庫本身以外的任何文件。

天花板,以及你可以稽核的校準
兩個數字決定了大多數真實的整合,而這兩個數字都屬於小型模型。
第一個是 8,192 個 token。Intern-Decision-0.8B 的推論引擎會拒絕過大的輸入,而非將其截斷;這對評分器而言是正確的行為,同時也是一道硬性限制:沒有任何分塊策略能維持這項契約,因為狀態、結構描述與骨架都必須一次處理完畢。Microsoft-Decision-1 的上限則高出四倍,達到 32,768,而且這是託管限制,可以透過不同的佈建方式提高,而不是 Python 檔案中的常數。
第二個是校準,而這裡情況正好相反。InternLM 發佈的溫度為 2.747760550703,適用於 0.8B;此溫度是透過在 1,728 個指定校準案例上最小化 NLL 所選出,並保留 1,693 個用於驗證,且模型卡明確表示未使用測試套件標籤來選擇它。所套用的轉換是先對該欄位的候選 logits 進行 softmax,接著對該分佈的對數除以溫度,再進行第二次 softmax。因為此轉換是在第一次 softmax 之後執行,且會保留排序,所以完全無法改變 argmax——它會改變置信度、yes 機率以及分數題的期望值,並使標籤保持不變。如果你的管線讀取的是標籤,溫度就不會產生任何作用。如果它讀取的是機率、對其設定閾值,或將其饋入期望值計算,那麼溫度就是一個有意義的數字與一個沒有意義的數字之間的差別。傳入 temperature=1 會傳回未校準的分佈,如果你更想自行擬合自己的校準。
Microsoft-Decision-1 沒有對等的產物。其 Benchmarks 分頁指出,準確率、校準誤差、安全召回率、偽陽性率與公平性一致性是在公開及社群決策基準,加上保留的內部測試集上衡量;選項順序有變化;有套用配對統計檢定;以及該模型「表現與領先的決策模型相當,並優於以相同方法評估的其他開放決策模型」。沒有印出校準誤差,沒有可檢視的溫度,也沒有描述驗證集切分。唯一讓機率有用的性質——0.8 是否就代表 0.8——只是被宣稱,且未量化。
把那兩段並排對讀,比較就不再是關於大小。一個 0.8 億參數的檢查點,其校準可供檢視,其軟體可供執行,對評估團隊而言,是比校準只有一句話的託管 API 更容易處理的對象。這個小型模型也有公開紀錄的延遲數據——在 InternLM 自己的量測中,透過本機 Hugging Face 路徑,在單張 RTX 4090 上每筆查詢的平均值為 33.98 毫秒、中位數為 33.44 毫秒、p95 為 37.50 毫秒——而 Microsoft 的延遲則是你得透過自己的部署來量測,其中在無伺服器與佈建輸送量之間的選擇,對這個數字的影響會比模型本身更大。

小型模型在哪裡失利
以上皆不足以讓 Intern-Decision-0.8B 成為安全選擇,而同一份已發布的表格說明了原因。WildJailBreak 的64.48對上 Jev 的 96.29,是在評分器接觸不受信任輸入的那個確切類別中,出現三十分的拒答穩健性落差。決策模型往往是決定某個提議動作是否被允許的元件;一個容易被話術繞過的模型,在那個位置上是個負擔。這個缺陷究竟是源自 Qwen3.5-0.8B 基礎模型、決策調校目標,還是來自參數量小,並非該儲存庫會告訴你的事,而且沒有論文、沒有訓練配方、也沒有資料揭露能說明此事。
InternLM 自己表格的其餘部分比該欄更為好看,但仍屬適中。七個套件的平均分數為:0.8B 為 79.38,相較於自家 2B 兄弟的 84.68 與 4B 的 90.02——這個家族隨著規模急遽攀升,這是一個溫和訊號,顯示該表格並非為了美化旗艦模型而反向工程設計。AG News 拿下 88.61,對比 Jev 的 89.57,在四類主題分類上實際上旗鼓相當。在校準方面,0.8B 回報 Brier 為 0.530,預期校準誤差為 0.066,對比 Jev 的 0.358 與 0.095——ECE 較好,但準確率明顯較差。對於一個刻意擬合溫度的小模型來說,這是個合理的樣貌,而這也不是行銷團隊會不小心選擇公布的組合。
此外,也沒有發布日期、沒有公告、沒有彙集這三個檢查點的集合、任何地方都沒有託管端點,也沒有任何形式的獨立評估。這個示範 Space 會回應 401。對 Intern-Decision-0.8B 的正確描述是:一個已發布的檢查點,但其宣稱未經審核——這比排隊等候的 API 情況更好,因為你可以在一個下午內對它進行測量,但這也意味著驗證的重擔完全落在你身上。
選擇,以及 OrcaRouter 的定位
若阻礙在於採購或規模,就選擇 Microsoft-Decision-1:你需要 Azure 驗證、統一計費,以及在任何東西進入生產環境之前完成 Responsible AI 評估;你需要 32K 上下文;你需要一個不是你自行營運的端點;或者你需要的是內建設計好的棄權路徑,而非自己手工打造。作為交換,接受你無法自行執行它、無法微調它、無法檢視它的校準,而且將得自行衡量它的核心主張。
若阻礙在於成本、記憶體或控制權,就選 Intern-Decision-0.8B:你要的是一個能塞進 1.73 GB 的 Apache-2.0 評分器,可在你既有的硬體上執行、每次產生相同標籤,而且只要更改檢查點路徑,就能換成它的 2B 或 4B 兄弟版本。作為交換,請接受 8,192-token 的高牆、WildJailBreak 那一欄,以及 InternLM 之外無人重現過該卡上任何結果的事實。
誠實的建議是兩者都做,因為它們便宜到幾乎不值得為此爭論。評分呼叫本身並不是我們路由的東西——一個回傳機率而非文字的模型並不是聊天補全,而這兩者都不在我們的產品目錄裡。OrcaRouter 承載的是這個迴路的另一半:一個與 OpenAI 相容的金鑰背後超過 200 個模型,它們負責草擬評分標準、產生候選答案,或發出你的評分器即將評分的工具呼叫,並依供應商定價原樣傳遞,0% 加價,因此生成端的供應商降價,我們這邊當天就同步生效。自動容錯移轉在這裡比平常更重要,因為一個对所見一切都要評分的流程,沒有餘裕去重試停滯的呼叫,而路由 DSL 讓你可以把同一個評判提示送給多個撰寫者,並融合它們的一致意見,而不是只信任單一一個。

底線
Microsoft-Decision-1 於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:託管式、純文字、32,768 個權杖,以 Qwen3.5-9B 為基礎打造,並以一段方法論說明取代基準測試表格。Intern-Decision-0.8B 則是 2026 年 9 月 26 日上傳、大小 1.73 GB 的 Apache-2.0 檢查點,公布了 0.530 的 Brier 分數、0.066 的 ECE、2.747760550703 的擬合溫度、在 4090 上 33.98 毫秒——以及一個沒人要求它印出的 64.48 WildJailBreak 分數。若你在採用兩者之前只能驗證一件事,請在你自己的標註案例上驗證校準;那正是兩家廠商都留給你自行找出的數字。
