一張為 Microsoft-Decision-1 對上 Intern-Decision-0.8B 生成的標題卡,副標題是「一個不帶任何數字的代管評分器,對上一個 1.73 GB、數字卻不甚好看的檢查點」,標籤分別寫著 Foundry 端點對上 852,985,920 個參數、一段方法論說明對上 64.48 的 WildJailBreak 分數,以及 32,768 個 token 對上 8,192 的上限。
Guides & Insights

Microsoft-Decision-1 對上 Intern-Decision-0.8B:半盎司的越獄麻煩,對上一個託管的空白

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

先從一篇發布貼文會略去的那一欄談起。Intern-Decision-0.8B——InternLM 的 852,985,920 參數決策模型,從 Qwen3.5-0.8B 微調而來,於 2026 年 9 月 26 日上傳到 Hugging Face,沒有公告、沒有論文,還有一個仍會 404 的 GitHub 連結——在 WildJailBreak 上測得 64.48,對照 TypeSafe 的 Jev 1.13 參考值 96.29。這不是四捨五入的差異。這是一個職責完全就是判斷輸入的模型,在拒答穩健性上的崩塌,而且還刊在廠商自家的模型卡上,放在一張基準屬於競爭對手的表裡。把這跟 Microsoft-Decision-1並列——它於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出,是一個以 Qwen3.5-9B 後訓練而成的純文字評分器,有記錄在案的評估方法論,底下卻沒有印出任何一項結果——你就能看出這場對決真正的樣貌。這兩個模型中,有一個會告訴你一個讓自己難看的數字。另一個則會告訴你它原本會採用哪些指標。

那個反轉比規格表更有價值。兩個模型都接收一個狀態和一組有界的問題,並回傳你的各個選項的機率——兩者都不生成文字,而在這個軸線上,它們是同一類工具。真正有差的差異在於:由誰運行、它有多大、你能驗證多少,以及一個較小、較低調、可完整下載的模型仍選擇公開的安全欄位。

每一個實際上回傳什麼

Microsoft-Decision-1 是託管 API,而這是第一個結構性差異。權重不會被散布——沒有下載、沒有存放庫、沒有微調途徑——而整合意味著在 Foundry 上部署,並附帶 Azure 驗證、計費與治理。它會對最多 32,768 個詞元 執行單次遍歷,支援是/否、多選、評分、分類與評分規準形式的問題,且輸入為純文字、輸出為數值。當證據不足時,它明確支援例如「無法判斷」的棄權選項,這正是讓閾值具有意義的原因。

Intern-Decision-0.8B 則是相反的安排。它是 Apache 2.0 權重,並在旁邊保留上游的 Qwen 授權作為 LICENSE-QWEN,約1.73 GB的儲存庫,分散於三個分片——一個 1.50 GB 的語言分片、一個 176 MB 的視覺分片,以及一個 25 MB 的投影器——可放進單張消費級 GPU 或配備完善的筆記型電腦。它接受一個狀態、一份包含一至十六個具名問題(每個問題最多 62 個選項)的結構描述,以及可選的最多八張圖片,而其隨附的inference.py對這份合約的記載,比大多數已發佈的模型所願意費心的還要詳細:選項會對應到單一詞元的符號 A–Z,接著 a–z,然後 0–9;logits 會在預先算繪的骨架中,緊接在每個<decision>預留位置之前的位置讀取;softmax 只針對該欄位的合法候選項計算;並套用一個擬合過的溫度參數。

這兩份授權並不是同一筆採購。Microsoft-Decision-1 給你一個受管理的端點,但不提供任何你擁有的成品。Intern-Decision-0.8B 則給你一個你擁有的成品,但沒有端點、沒有支援合約,也沒有儲存庫本身以外的任何文件。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

天花板,以及你可以稽核的校準

兩個數字決定了大多數真實的整合,而這兩個數字都屬於小型模型。

第一個是 8,192 個 token。Intern-Decision-0.8B 的推論引擎會拒絕過大的輸入,而非將其截斷;這對評分器而言是正確的行為,同時也是一道硬性限制:沒有任何分塊策略能維持這項契約,因為狀態、結構描述與骨架都必須一次處理完畢。Microsoft-Decision-1 的上限則高出四倍,達到 32,768,而且這是託管限制,可以透過不同的佈建方式提高,而不是 Python 檔案中的常數。

第二個是校準,而這裡情況正好相反。InternLM 發佈的溫度為 2.747760550703,適用於 0.8B;此溫度是透過在 1,728 個指定校準案例上最小化 NLL 所選出,並保留 1,693 個用於驗證,且模型卡明確表示未使用測試套件標籤來選擇它。所套用的轉換是先對該欄位的候選 logits 進行 softmax,接著對該分佈的對數除以溫度,再進行第二次 softmax。因為此轉換是在第一次 softmax 之後執行,且會保留排序,所以完全無法改變 argmax——它會改變置信度、yes 機率以及分數題的期望值,並使標籤保持不變。如果你的管線讀取的是標籤,溫度就不會產生任何作用。如果它讀取的是機率、對其設定閾值,或將其饋入期望值計算,那麼溫度就是一個有意義的數字與一個沒有意義的數字之間的差別。傳入 temperature=1 會傳回未校準的分佈,如果你更想自行擬合自己的校準。

Microsoft-Decision-1 沒有對等的產物。其 Benchmarks 分頁指出,準確率、校準誤差、安全召回率、偽陽性率與公平性一致性是在公開及社群決策基準,加上保留的內部測試集上衡量;選項順序有變化;有套用配對統計檢定;以及該模型「表現與領先的決策模型相當,並優於以相同方法評估的其他開放決策模型」。沒有印出校準誤差,沒有可檢視的溫度,也沒有描述驗證集切分。唯一讓機率有用的性質——0.8 是否就代表 0.8——只是被宣稱,且未量化。

把那兩段並排對讀,比較就不再是關於大小。一個 0.8 億參數的檢查點,其校準可供檢視,其軟體可供執行,對評估團隊而言,是比校準只有一句話的託管 API 更容易處理的對象。這個小型模型也有公開紀錄的延遲數據——在 InternLM 自己的量測中,透過本機 Hugging Face 路徑,在單張 RTX 4090 上每筆查詢的平均值為 33.98 毫秒、中位數為 33.44 毫秒、p95 為 37.50 毫秒——而 Microsoft 的延遲則是你得透過自己的部署來量測,其中在無伺服器與佈建輸送量之間的選擇,對這個數字的影響會比模型本身更大。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

小型模型在哪裡失利

以上皆不足以讓 Intern-Decision-0.8B 成為安全選擇,而同一份已發布的表格說明了原因。WildJailBreak 的64.48對上 Jev 的 96.29,是在評分器接觸不受信任輸入的那個確切類別中,出現三十分的拒答穩健性落差。決策模型往往是決定某個提議動作是否被允許的元件;一個容易被話術繞過的模型,在那個位置上是個負擔。這個缺陷究竟是源自 Qwen3.5-0.8B 基礎模型、決策調校目標,還是來自參數量小,並非該儲存庫會告訴你的事,而且沒有論文、沒有訓練配方、也沒有資料揭露能說明此事。

InternLM 自己表格的其餘部分比該欄更為好看,但仍屬適中。七個套件的平均分數為:0.8B 為 79.38,相較於自家 2B 兄弟的 84.68 與 4B 的 90.02——這個家族隨著規模急遽攀升,這是一個溫和訊號,顯示該表格並非為了美化旗艦模型而反向工程設計。AG News 拿下 88.61,對比 Jev 的 89.57,在四類主題分類上實際上旗鼓相當。在校準方面,0.8B 回報 Brier 為 0.530,預期校準誤差為 0.066,對比 Jev 的 0.358 與 0.095——ECE 較好,但準確率明顯較差。對於一個刻意擬合溫度的小模型來說,這是個合理的樣貌,而這也不是行銷團隊會不小心選擇公布的組合。

此外,也沒有發布日期、沒有公告、沒有彙集這三個檢查點的集合、任何地方都沒有託管端點,也沒有任何形式的獨立評估。這個示範 Space 會回應 401。對 Intern-Decision-0.8B 的正確描述是:一個已發布的檢查點,但其宣稱未經審核——這比排隊等候的 API 情況更好,因為你可以在一個下午內對它進行測量,但這也意味著驗證的重擔完全落在你身上。

選擇,以及 OrcaRouter 的定位

若阻礙在於採購或規模,就選擇 Microsoft-Decision-1:你需要 Azure 驗證、統一計費,以及在任何東西進入生產環境之前完成 Responsible AI 評估;你需要 32K 上下文;你需要一個不是你自行營運的端點;或者你需要的是內建設計好的棄權路徑,而非自己手工打造。作為交換,接受你無法自行執行它、無法微調它、無法檢視它的校準,而且將得自行衡量它的核心主張。

若阻礙在於成本、記憶體或控制權,就選 Intern-Decision-0.8B:你要的是一個能塞進 1.73 GB 的 Apache-2.0 評分器,可在你既有的硬體上執行、每次產生相同標籤,而且只要更改檢查點路徑,就能換成它的 2B 或 4B 兄弟版本。作為交換,請接受 8,192-token 的高牆、WildJailBreak 那一欄,以及 InternLM 之外無人重現過該卡上任何結果的事實。

誠實的建議是兩者都做,因為它們便宜到幾乎不值得為此爭論。評分呼叫本身並不是我們路由的東西——一個回傳機率而非文字的模型並不是聊天補全,而這兩者都不在我們的產品目錄裡。OrcaRouter 承載的是這個迴路的另一半:一個與 OpenAI 相容的金鑰背後超過 200 個模型,它們負責草擬評分標準、產生候選答案,或發出你的評分器即將評分的工具呼叫,並依供應商定價原樣傳遞,0% 加價,因此生成端的供應商降價,我們這邊當天就同步生效。自動容錯移轉在這裡比平常更重要,因為一個对所見一切都要評分的流程,沒有餘裕去重試停滯的呼叫,而路由 DSL 讓你可以把同一個評判提示送給多個撰寫者,並融合它們的一致意見,而不是只信任單一一個。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

底線

Microsoft-Decision-1 於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:託管式、純文字、32,768 個權杖,以 Qwen3.5-9B 為基礎打造,並以一段方法論說明取代基準測試表格。Intern-Decision-0.8B 則是 2026 年 9 月 26 日上傳、大小 1.73 GB 的 Apache-2.0 檢查點,公布了 0.530 的 Brier 分數、0.066 的 ECE、2.747760550703 的擬合溫度、在 4090 上 33.98 毫秒——以及一個沒人要求它印出的 64.48 WildJailBreak 分數。若你在採用兩者之前只能驗證一件事,請在你自己的標註案例上驗證校準;那正是兩家廠商都留給你自行找出的數字。