一張為 Microsoft-Decision-1 對 Gemma 4 12B 生成的標題卡,副標題為「一個沒有輸出 token 的評分器,對上一個沒有封閉集合的寫作者」,標籤寫著「機率對比散文」、「32,768 token 的上下文對比 256,000」、「純文字對比文字、圖像、音訊與影片」,以及「託管 API 對比開放權重」。
Guides & Insights

Microsoft-Decision-1 對決 Gemma 4 12B:一個從你的清單中挑選,一個替你寫出全新的清單

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

將Microsoft-Decision-1與Gemma 4 12B並排比較,決定一切的差異不在於規模、準確度或授權條款——而在於模型讀取你的輸入之後會發生什麼事。Gemma 4 12B 是 DeepMind 的 119.6 億參數無編碼器多模態模型,於 2026 年 6 月 3 日以 Apache 2.0 發布,能讀取文字、圖像、音訊或影片,然後在 256,000 個詞元的視窗中、以超過 140 種語言,逐詞元為你寫出答案。Microsoft-Decision-1 在 Microsoft Foundry 正式推出,日期為 2026年10月8日,作為一個以 Qwen3.5-9B 後訓練而成的純文字評分器:你交給它一個狀態,以及一個答案已由你事先列舉的問題,它就會在單次處理最多 32,768 個詞元的過程中,為每個選項回傳一個校準後的機率,而不生成任何內容。一個模型告訴你哪個選項是對的。另一個則告訴你選項本來應該是什麼——並為其中每一個字向你收費。

將這件事框定為一場競賽會是範疇錯誤,而這點值得在規格條文之前、而非之後說清楚。這兩者並非彼此的替代品;它們位在工作流程的兩端。有用的問題是:你實際上正在打造哪一端?因為答案會決定你買到的是一位評審,還是一位寫手。

帳單就是差異不再只是哲學問題的地方。

Gemma 4 12B 的計費方式就跟每個生成式模型一樣:輸入 token 與輸出 token,兩者皆然。當你要求它輸出結構化 JSON 時,那段 JSON 的每一個字元都是生成、取樣並付費而來的——而且你的結構描述巢狀得越深,回答就越長,那筆計費項目也就越大。這不是模型的缺陷。這就是解碼器的作用,而這正是決策頭存在所要刪除的那筆計費項目。

Microsoft-Decision-1 沒有可計費的輸出端。它會對你的狀態、問題與選項集執行單次前向傳遞,讀取每個候選項的分數,然後返回。其後果會隨資料量而非提示大小而累積:一條用 Gemma 4 12B 標記一萬筆紀錄的管線會產生一萬份 JSON 文件,而同一條管線若改用決策評分器,則只會產生一萬個提示,別無其他。絕對節省幅度是否很大,完全取決於你的資料量與結構描述的肥厚程度,而任何有每權杖預算的人都能用試算表算清楚。方向沒有爭議。

還有第二個、較小的不對稱:微軟並未在 Microsoft-Decision-1 模型頁面上標示費率。定價會連結至微軟自家的定價頁面,因此每次決策的成本是你從 Azure 上讀到的,而不是從卡片上讀到的。該頁面確實確立的是:呼叫中有 0% 是輸出 token,且批次推論已停用——你無法像使用生成式模型那樣,透過批次通道來攤銷大量的評分執行。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

相同的輸入,兩種不同的答案

給兩個模型一張客戶支援工單和一個問題。Microsoft-Decision-1 會回傳類似「帳務」0.83、「技術」0.11、「取消」0.04、「無法判斷」0.02 這樣的結果。你有一個可命名的標籤、一個可以設定閾值比較的數字,以及一條棄答路徑——Microsoft 的文件說明,當提供的證據不足時,支援某種「無法判斷」風格的選項,這正是讓升級邏輯得以運作的原因。你得不到的,是一個理由。

把工單交給 Gemma 4 12B,你就能得到一段文字。它能以可設定的思考方式推理這項請求、呼叫函式、讀取附加於工單的掃描發票、轉錄釘附其上的語音留言,並以顧客自己的語言回答。這些每一項都是 Decision-1 無論準確度如何都做不到的事:它的輸入介面只有文字,別無其他;它明確不是為開放式問答、對話、翻譯或摘要而設計。

Gemma 4 12B 的輸出完全不是機率。要求它帶著信心做出路由決策,你會得到一段含有數字的文字,而那個數字是取樣器產生的任何值,而不是對你提供的選項集合所做的 softmax。如果下游的閾值取決於那個數字具有某種意義,那你面對的是一項校準專案,而不是一個評分器。

你的問題是否有封閉集合,就是決定一切的關鍵。

這是在做任何其他事之前都該先套用的測試,而且搭配白板進行的話大約需要十分鐘。

• 如果你的答案是從一份你能事先列舉的清單中得出的——一個標籤、一個評分、一個是/否、一個評分規準分數、一條路線——那麼 Microsoft-Decision-1 才是正確的工具,而 Gemma 4 12B 則是從那份清單中挑選的浪費且較不可靠的方式。你等於是在付錢請解碼器去猜一個你早已界定範圍的數字。

• 如果你的答案不是封閉集合——總結這個、解釋那個、撰寫回覆、描述圖表——Microsoft-Decision-1 無論代價多高都幫不上忙。它沒有通往成文敘述的途徑、沒有理由欄位,也沒有任何機制可以產生你未列為選項的任何東西。

• 如果兩者皆是,你擁有的就是一條雙模型管線,而不是二選一;此時有趣的設計問題就變成:升級閾值由哪一個模型掌控。評分器負責設定它;寫作者則補上閾值以上與以下會發生的事。

而 Gemma 4 12B 則簡直是另一種運動

撇開決策框架不談,Gemma 4 12B 並不是在某一條線上領先——它是在玩一場不同的遊戲,而假裝不是如此會是不誠實的。

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• 模態 — Microsoft-Decision-1 僅能輸入文字、輸出數值。Gemma 4 12B 透過無編碼器設計,將原始區塊與波形直接投射到嵌入空間,原生支援文字、圖像、音訊與影片,並可任意順序交錯輸入。

• 上下文 — Microsoft-Decision-1 為 32,768 個 token,對比 Gemma 4 12B 的 256,000 個;後者在 Google 自家的規格表上,於 128k 的 MRCR v2 八針測試中得分 43.4%。

• 語言 — Microsoft-Decision-1 支援 25 種語言,Microsoft 警告涵蓋範圍、品質與校準「可能因語言而異」,並指出資源較少的非英語語言是弱點;Gemma 4 12B 則支援 140 多種語言,在此規模下的 MMMLU 評估分數為 83.4。

• 已公布的效能數據 — Microsoft-Decision-1 的 Benchmarks 分頁只載明方法論,未提供任何數字;Google 則公布了 Gemma 4 12B 的 77.2% MMLU Pro、不使用工具下的 77.5% AIME 2026、72.0% LiveCodeBench v6、78.8% GPQA Diamond、69.1% MMMU Pro,以及 79.7% MATH-Vision。

• 發佈方式 — Microsoft-Decision-1 是僅限 Foundry 的代管 API,沒有權重、無法下載,也沒有微調途徑。Gemma 4 12B 則是以 Apache 2.0 授權的權重,推出首日便已進入 LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang 與 Unsloth 的生態系。

• 執行階段 — 決策評分只需單次處理,沒有解碼迴圈,因此延遲取決於提示長度,而非答案長度;Gemma 4 12B 會逐個 token 生成,而 Google 的發布資料將其定位在 16 GB VRAM 或統一記憶體。

基準測試那一列才值得停下來細看,而且是朝著對微軟最不客氣的方向解讀。Gemma 4 12B 的數字同樣是廠商自行提報的——但背後已有數月的第三方使用經驗,在公開測試框架上、在別人擁有的硬體上跑出來的。微軟在這個類別的產品是兩者中最新的、也最難以驗證的,儘管它出自規模更大的公司。

實際撥打每個要花你多少

Gemma 4 12B 的 12B 版本並不在我們的目錄中——如果那是你想要的規模,你得自行取得 119.6 億個 BF16 參數並自己部署。我們的目錄確實有收錄的,是 Gemma 4 系列其餘型號,而且價格不貴:Gemma 4 26B A4B 每百萬輸入權杖 $0.06、每百萬輸出權杖 $0.33,以及 Gemma 4 31B 為 $0.13 與 $0.38,兩者都列出 262,144 權杖的上下文長度。這些是供應商定價原樣轉嫁,我們這邊不額外加價,並可透過同一把 OpenAI 相容金鑰取用,與其他 200 多個模型並列。如果你的問題其實是通用推理,而不是封閉集合式的判定,那麼這兩個規模之一,就是拿來與自營評分器相互衡量的便宜選項——而如果你不想綁定單一生成方,自動容錯移轉能在某家供應商效能降級時,讓評分迴圈中的生成環節持續運作。

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 是您自行佈建的 Foundry 部署,且無法透過我們取得。本文中的任何內容都不構成對其可用性的聲明,通話雙方皆然。

底線

Microsoft-Decision-1 於 2026 年 10 月 8 日在 Microsoft Foundry 正式推出:這是一款純文字、32,768 詞元的評分器,以 Qwen3.5-9B 為基礎,會對你列舉的選項回傳經校準的機率,輸出詞元為零,未公開權重,也沒有公布基準測試數據。Gemma 4 12B 是一款 11.96B、無編碼器的多模態通用模型,於 2026 年 6 月 3 日以 Apache 2.0 授權發布,能推理、讀取圖像與音訊,並在 256,000 詞元範圍內撰寫答案。請依你答案的形態來挑選,而不是依參數量:封閉集合屬於評分器,開放式集合則屬於撰寫者;而付錢請解碼器從你已寫好的清單中挑選,正是團隊最常花上十倍於一項決策成本的方式。

我們的型錄確實提供的是 Gemma 4 系列其餘的型號,而且價格低廉:Gemma 4 26B A4B 每百萬輸入 token 為 0.06 美元,每百萬輸出 token 為 0.33 美元,而 Gemma 4 31B 則為 0.13 美元與 0.38 美元。