
Microsoft-Decision-1 對決 Gemma 4 12B:一個從你的清單中挑選,一個替你寫出全新的清單
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 69 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
將Microsoft-Decision-1與Gemma 4 12B並排比較,決定一切的差異不在於規模、準確度或授權條款——而在於模型讀取你的輸入之後會發生什麼事。Gemma 4 12B 是 DeepMind 的 119.6 億參數無編碼器多模態模型,於 2026 年 6 月 3 日以 Apache 2.0 發布,能讀取文字、圖像、音訊或影片,然後在 256,000 個詞元的視窗中、以超過 140 種語言,逐詞元為你寫出答案。Microsoft-Decision-1 在 Microsoft Foundry 正式推出,日期為 2026年10月8日,作為一個以 Qwen3.5-9B 後訓練而成的純文字評分器:你交給它一個狀態,以及一個答案已由你事先列舉的問題,它就會在單次處理最多 32,768 個詞元的過程中,為每個選項回傳一個校準後的機率,而不生成任何內容。一個模型告訴你哪個選項是對的。另一個則告訴你選項本來應該是什麼——並為其中每一個字向你收費。
將這件事框定為一場競賽會是範疇錯誤,而這點值得在規格條文之前、而非之後說清楚。這兩者並非彼此的替代品;它們位在工作流程的兩端。有用的問題是:你實際上正在打造哪一端?因為答案會決定你買到的是一位評審,還是一位寫手。
帳單就是差異不再只是哲學問題的地方。
Gemma 4 12B 的計費方式就跟每個生成式模型一樣:輸入 token 與輸出 token,兩者皆然。當你要求它輸出結構化 JSON 時,那段 JSON 的每一個字元都是生成、取樣並付費而來的——而且你的結構描述巢狀得越深,回答就越長,那筆計費項目也就越大。這不是模型的缺陷。這就是解碼器的作用,而這正是決策頭存在所要刪除的那筆計費項目。
Microsoft-Decision-1 沒有可計費的輸出端。它會對你的狀態、問題與選項集執行單次前向傳遞,讀取每個候選項的分數,然後返回。其後果會隨資料量而非提示大小而累積:一條用 Gemma 4 12B 標記一萬筆紀錄的管線會產生一萬份 JSON 文件,而同一條管線若改用決策評分器,則只會產生一萬個提示,別無其他。絕對節省幅度是否很大,完全取決於你的資料量與結構描述的肥厚程度,而任何有每權杖預算的人都能用試算表算清楚。方向沒有爭議。
還有第二個、較小的不對稱:微軟並未在 Microsoft-Decision-1 模型頁面上標示費率。定價會連結至微軟自家的定價頁面,因此每次決策的成本是你從 Azure 上讀到的,而不是從卡片上讀到的。該頁面確實確立的是:呼叫中有 0% 是輸出 token,且批次推論已停用——你無法像使用生成式模型那樣,透過批次通道來攤銷大量的評分執行。

相同的輸入,兩種不同的答案
給兩個模型一張客戶支援工單和一個問題。Microsoft-Decision-1 會回傳類似「帳務」0.83、「技術」0.11、「取消」0.04、「無法判斷」0.02 這樣的結果。你有一個可命名的標籤、一個可以設定閾值比較的數字,以及一條棄答路徑——Microsoft 的文件說明,當提供的證據不足時,支援某種「無法判斷」風格的選項,這正是讓升級邏輯得以運作的原因。你得不到的,是一個理由。
把工單交給 Gemma 4 12B,你就能得到一段文字。它能以可設定的思考方式推理這項請求、呼叫函式、讀取附加於工單的掃描發票、轉錄釘附其上的語音留言,並以顧客自己的語言回答。這些每一項都是 Decision-1 無論準確度如何都做不到的事:它的輸入介面只有文字,別無其他;它明確不是為開放式問答、對話、翻譯或摘要而設計。
Gemma 4 12B 的輸出完全不是機率。要求它帶著信心做出路由決策,你會得到一段含有數字的文字,而那個數字是取樣器產生的任何值,而不是對你提供的選項集合所做的 softmax。如果下游的閾值取決於那個數字具有某種意義,那你面對的是一項校準專案,而不是一個評分器。
你的問題是否有封閉集合,就是決定一切的關鍵。
這是在做任何其他事之前都該先套用的測試,而且搭配白板進行的話大約需要十分鐘。
• 如果你的答案是從一份你能事先列舉的清單中得出的——一個標籤、一個評分、一個是/否、一個評分規準分數、一條路線——那麼 Microsoft-Decision-1 才是正確的工具,而 Gemma 4 12B 則是從那份清單中挑選的浪費且較不可靠的方式。你等於是在付錢請解碼器去猜一個你早已界定範圍的數字。
• 如果你的答案不是封閉集合——總結這個、解釋那個、撰寫回覆、描述圖表——Microsoft-Decision-1 無論代價多高都幫不上忙。它沒有通往成文敘述的途徑、沒有理由欄位,也沒有任何機制可以產生你未列為選項的任何東西。
• 如果兩者皆是,你擁有的就是一條雙模型管線,而不是二選一;此時有趣的設計問題就變成:升級閾值由哪一個模型掌控。評分器負責設定它;寫作者則補上閾值以上與以下會發生的事。
而 Gemma 4 12B 則簡直是另一種運動
撇開決策框架不談,Gemma 4 12B 並不是在某一條線上領先——它是在玩一場不同的遊戲,而假裝不是如此會是不誠實的。

• 模態 — Microsoft-Decision-1 僅能輸入文字、輸出數值。Gemma 4 12B 透過無編碼器設計,將原始區塊與波形直接投射到嵌入空間,原生支援文字、圖像、音訊與影片,並可任意順序交錯輸入。
• 上下文 — Microsoft-Decision-1 為 32,768 個 token,對比 Gemma 4 12B 的 256,000 個;後者在 Google 自家的規格表上,於 128k 的 MRCR v2 八針測試中得分 43.4%。
• 語言 — Microsoft-Decision-1 支援 25 種語言,Microsoft 警告涵蓋範圍、品質與校準「可能因語言而異」,並指出資源較少的非英語語言是弱點;Gemma 4 12B 則支援 140 多種語言,在此規模下的 MMMLU 評估分數為 83.4。
• 已公布的效能數據 — Microsoft-Decision-1 的 Benchmarks 分頁只載明方法論,未提供任何數字;Google 則公布了 Gemma 4 12B 的 77.2% MMLU Pro、不使用工具下的 77.5% AIME 2026、72.0% LiveCodeBench v6、78.8% GPQA Diamond、69.1% MMMU Pro,以及 79.7% MATH-Vision。
• 發佈方式 — Microsoft-Decision-1 是僅限 Foundry 的代管 API,沒有權重、無法下載,也沒有微調途徑。Gemma 4 12B 則是以 Apache 2.0 授權的權重,推出首日便已進入 LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang 與 Unsloth 的生態系。
• 執行階段 — 決策評分只需單次處理,沒有解碼迴圈,因此延遲取決於提示長度,而非答案長度;Gemma 4 12B 會逐個 token 生成,而 Google 的發布資料將其定位在 16 GB VRAM 或統一記憶體。
基準測試那一列才值得停下來細看,而且是朝著對微軟最不客氣的方向解讀。Gemma 4 12B 的數字同樣是廠商自行提報的——但背後已有數月的第三方使用經驗,在公開測試框架上、在別人擁有的硬體上跑出來的。微軟在這個類別的產品是兩者中最新的、也最難以驗證的,儘管它出自規模更大的公司。
實際撥打每個要花你多少
Gemma 4 12B 的 12B 版本並不在我們的目錄中——如果那是你想要的規模,你得自行取得 119.6 億個 BF16 參數並自己部署。我們的目錄確實有收錄的,是 Gemma 4 系列其餘型號,而且價格不貴:Gemma 4 26B A4B 每百萬輸入權杖 $0.06、每百萬輸出權杖 $0.33,以及 Gemma 4 31B 為 $0.13 與 $0.38,兩者都列出 262,144 權杖的上下文長度。這些是供應商定價原樣轉嫁,我們這邊不額外加價,並可透過同一把 OpenAI 相容金鑰取用,與其他 200 多個模型並列。如果你的問題其實是通用推理,而不是封閉集合式的判定,那麼這兩個規模之一,就是拿來與自營評分器相互衡量的便宜選項——而如果你不想綁定單一生成方,自動容錯移轉能在某家供應商效能降級時,讓評分迴圈中的生成環節持續運作。

Microsoft-Decision-1 是您自行佈建的 Foundry 部署,且無法透過我們取得。本文中的任何內容都不構成對其可用性的聲明,通話雙方皆然。
底線
Microsoft-Decision-1 於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:這是一款純文字、32,768 詞元的評分器,以 Qwen3.5-9B 為基礎,會對你列舉的選項回傳經校準的機率,輸出詞元為零,未公開權重,也沒有公布基準測試數據。Gemma 4 12B 是一款 11.96B、無編碼器的多模態通用模型,於 2026 年 6 月 3 日以 Apache 2.0 授權發布,能推理、讀取圖像與音訊,並在 256,000 詞元範圍內撰寫答案。請依你答案的形態來挑選,而不是依參數量:封閉集合屬於評分器,開放式集合則屬於撰寫者;而付錢請解碼器從你已寫好的清單中挑選,正是團隊最常花上十倍於一項決策成本的方式。
我們的型錄確實提供的是 Gemma 4 系列其餘的型號,而且價格低廉:Gemma 4 26B A4B 每百萬輸入 token 為 0.06 美元,每百萬輸出 token 為 0.33 美元,而 Gemma 4 31B 則為 0.13 美元與 0.38 美元。
