Microsoft-Decision-1 対 Gemma 4 12B 向けに生成されたタイトルカード。サブタイトルは「出力トークンを持たないスコアラー 対 閉集合を持たない書き手」で、チップには「確率 対 散文」「32,768トークンのコンテキスト 対 256,000」「テキストのみ 対 テキスト・画像・音声・動画」「ホスト型API 対 オープンウェイト」と表示されている。
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B:一方はあなたのリストから選び、もう一方は新しいリストを書き出す

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を並べて見れば、Microsoft-Decision-1とGemma 4 12Bすべてを決める違いはサイズでも精度でもライセンスでもない——モデルがあなたの入力を読み終えた後に何が起きるかだ。Gemma 4 12Bは、2026年6月3日にApache 2.0で公開されたDeepMindの119.6億パラメータのエンコーダ不要マルチモーダルモデルで、テキスト、画像、音声、動画を読み、256,000トークンのウィンドウと140以上の言語にわたり、トークンごとに答えを書き出す。Microsoft-Decision-1は、Microsoft Foundryで2026年10月8日に一般提供開始となった、Qwen3.5-9Bで事後学習されたテキスト専用スコアラーだ。状態と、答えをあらかじめ列挙した質問を渡すと、最大32,768トークンにわたる1回のパスで各選択肢の較正済み確率を返し、何も生成しない。一方のモデルは選択肢のどれが正しいかを教え、もう一方は選択肢がどうあるべきだったかを教える——そしてその一言一句に対して課金する。

これをコンテストとして位置づけるのはカテゴリー錯誤であり、仕様の行の後ではなく前にそう言っておく価値がある。この二つは代替物ではない。ワークフローの両端に位置している。有用な問いは、あなたが実際にどちらの端を構築しているかであり、その答えが、あなたが審査員を買っているのか、それとも書き手を買っているのかを決めるからだ。

請求書が来る段階で、その違いは哲学ではなくなる。

Gemma 4 12B は、あらゆる生成モデルと同じ課金方式をとる。入力トークンと出力トークンの両方だ。構造化 JSON を求めると、その JSON の一文字一文字が生成され、サンプリングされ、課金される。そしてスキーマのネストが深いほど、回答は長くなり、その課金項目は膨らむ。それはモデルの欠陥ではない。デコーダが行っていることだ。そして、まさにその課金項目こそ、decision heads が削除するために存在するものだ。

Microsoft-Decision-1には請求対象となる出力側がありません。これはあなたの状態、質問、選択肢セットに対して単一のフォワードパスを実行し、各候補のスコアを読み取って返します。その帰結は、プロンプトサイズではなく処理量とともに累積します。Gemma 4 12Bで1万件のレコードにラベルを付けるパイプラインは1万個のJSONドキュメントを生成し、同じパイプラインを決定スコアラーで動かすと1万個のプロンプトだけを生成して、それ以外は何も生成しません。絶対的な節約額が大きいかどうかは、処理量とスキーマの太さに完全に左右され、トークン単位の予算を持っている人なら誰でもスプレッドシートで決着をつけられます。方向性に議論の余地はありません。

第二の、より小さな非対称性がある。Microsoft は Microsoft-Decision-1 のモデルページに料金を記載していない。価格は Microsoft 自身の価格ページへリンクしているため、決定あたりのコストはカードからではなく Azure から読み取るものだ。このページで確認できるのは、呼び出しの 0% が出力トークンであること、そしてバッチ推論が無効になっていることだ。生成モデルのように、一括スコアリングの実行をバッチチャネル経由で償却することはできない。

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

同じ入力、2つの異なる回答

両方のモデルにカスタマーサポートのチケットと質問を与えます。Microsoft-Decision-1 は「請求」に対して 0.83、「技術」に対して 0.11、「解約」に対して 0.04、「判別不能」に対して 0.02 のような値を返します。名前を付けられるラベル、しきい値と比較できる数値、そして棄権のパスが得られます——Microsoft は、提供された証拠が不十分な場合に「判別不能」スタイルのオプションがサポートされると文書化しており、これがエスカレーション ロジックを機能させるのです。得られないのは理由です。

チケットをGemma 4 12Bに渡せば、1段落の回答が返ってくる。設定可能な思考でリクエストを推論し、関数を呼び出し、チケットに添付されたスキャン済み請求書を読み取り、それに留められたボイスメールを文字起こしし、顧客自身の言語で回答できる。これらのどれも、Decision-1にはどの精度でもできないことだ。その入力サーフェスはテキストだけで、それ以外には何もなく、オープンエンドの質問応答、会話、翻訳、要約のために明示的に設計されていない。

Gemma 4 12B の出力は、どれも確率ではありません。ルーティングの判断を確信度付きで求めると、数値を含む文章が返ってきますが、その数値は、あなたが与えた選択肢集合に対する softmax ではなく、サンプラーが生成したものです。下流のしきい値がその数値に意味があることに依存しているなら、あなたが手にしているのはスコアラーではなく、キャリブレーションのプロジェクトです。

あなたの問いが閉じた集合を持つかどうか、それですべてが決まる

これは何よりも先に適用すべきテストで、ホワイトボードを使っておよそ10分かかります。

• もしあなたの答えが、事前に列挙できるリスト——ラベル、評価、はい/いいえ、ルーブリックの点数、経路——から引き出されるものであるなら、Microsoft-Decision-1 が適切な道具であり、Gemma 4 12B はそのリストから選ぶには無駄が多く、信頼性も低い方法です。あなたは、すでに範囲を限定した数値をデコーダーに推測させるために、対価を払うことになるでしょう。

• あなたの答えが閉じた集合でない場合——これを要約する、あれを説明する、返信を書く、グラフを描写する——Microsoft-Decision-1 はどんな価格でも助けることはできない。それには散文に至る道も、根拠フィールドも、あなたが選択肢として列挙しなかったものを生成する仕組みもない。

• 両方に当てはまるなら、それは選択ではなく2モデルのパイプラインであり、興味深い設計上の問いは、どちらがエスカレーション閾値を担うかになる。スコアラーがその閾値を設定し、ライターがその上下で何が起こるかを埋める。

Gemma 4 12Bがまったく別次元の競技であるところ

意思決定の枠組みの外では、Gemma 4 12B は一本の線で先んじているわけではない——それは別のゲームをしており、そうでないふりをするのは不誠実だろう。

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• モダリティ — Microsoft-Decision-1 は入力がテキストのみ、出力は数値。Gemma 4 12B は、テキスト、画像、音声、動画をネイティブに扱い、エンコーダ不要の設計によって生のパッチや波形をそのまま埋め込み空間へ投影し、任意の順序でのインターリーブ入力にも対応する。

• コンテキスト — Microsoft-Decision-1の32,768トークンに対し、Gemma 4 12Bは256,000トークンで、Google自身のモデルカードでは128kにおけるMRCR v2のeight-needleで43.4%を記録しています。

• 言語 — Microsoft-Decision-1 の対応言語は 25 で、Microsoft はカバレッジ、品質、キャリブレーションが「言語によって異なる可能性がある」と警告し、低リソースの非英語を弱点として挙げている。Gemma 4 12B では 140 以上で、このサイズでの評価済み MMMLU 値は 83.4。

• 公開されている性能 — Microsoft-Decision-1のBenchmarksタブには方法論が記載されているだけで、数値はない。GoogleはGemma 4 12Bについて、MMLU Proで77.2%、ツールなしのAIME 2026で77.5%、LiveCodeBench v6で72.0%、GPQA Diamondで78.8%、MMMU Proで69.1%、MATH-Visionで79.7%を公開している。

• 配布 — Microsoft-Decision-1 は Foundry 専用のホスト型 API で、重みもダウンロードもファインチューニングの手段もない。Gemma 4 12B は Apache 2.0 の重みで、LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang、Unsloth からなる初日対応のエコシステムに投入された。

• ランタイム — 意思決定スコアリングはデコードループのない1回のパスであるため、レイテンシは回答の長さではなくプロンプトの長さに比例します。Gemma 4 12B はトークン単位で生成し、Google の発表資料では 16 GB の VRAM またはユニファイドメモリを想定しています。

ベンチマークの行こそ、立ち止まって考える価値のあるものだ。しかもマイクロソフトにとって最も都合の悪い方向において。Gemma 4 12Bの数値もベンダーによる報告ではある——だがその背後には、公開されたハーネスにおいて、他人が所有するハードウェア上で、数か月にわたる第三者による使用がある。このカテゴリーにおけるマイクロソフトの参入製品は、より大きな企業のものであるにもかかわらず、両者の中で最も新しく、最も検証しにくいものだ。

それぞれを実際に呼び出すのにいくらかかるか

Gemma 4 12B の 12B 版は当社のカタログにはありません。もしそれが求めるサイズなら、BF16 の 119.6 億パラメータを入手してご自身でサーブすることになります。当社のカタログに掲載されているのは Gemma 4 シリーズの残りで、しかも安価です:Gemma 4 26B A4B は入力 100 万トークンあたり $0.06、出力 100 万トークンあたり $0.33、そして Gemma 4 31B は $0.13 と $0.38、いずれも 262,144 トークンのコンテキスト付きで掲載されています。これらは当社側でマークアップを一切加えずにそのまま通すベンダー定価であり、200 を超える他のモデルとともに 1 つの OpenAI 互換キーの背後にあります。あなたの問題がクローズドセットの判断ではなく汎用的な推論であるなら、この 2 つのサイズのどちらかが、自前運用のスコアラーと比較して測定するのに安上がりな選択です。そして、単一のライターに固定したくない場合、あるプロバイダーが劣化したときに自動フェイルオーバーがスコアリングループの生成側を生かし続けます。

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 は、お客様自身でプロビジョニングする Foundry デプロイメントであり、当社を通じて利用できるものではありません。この記事のいかなる記述も、呼び出しのどちらの側においても、その可用性を主張するものではありません。

結論

Microsoft-Decision-1は2026年10月8日にMicrosoft Foundryで一般提供が開始された。Qwen3.5-9Bをベースにしたテキスト専用の32,768トークンのスコアラーで、列挙した選択肢に対する較正済み確率を返し、出力トークンはゼロ、重みも公開ベンチマーク値もない。Gemma 4 12Bは2026年6月3日にApache 2.0の下でリリースされた11.96Bのエンコーダーフリーなマルチモーダル汎用モデルで、推論し、画像と音声を読み取り、256,000トークンにわたって回答を書き出す。パラメータ数ではなく、答えの形で選べ。閉じた集合はスコアラーのもの、開いた集合は書き手のものであり、すでに自分で書いたリストから選ばせるためにデコーダーに金を払うのは、チームが意思決定にかかる費用の10倍を費やす最も一般的な方法だ。

当社のカタログに実際に掲載されているのは、Gemma 4シリーズの残りのラインナップであり、しかも低価格です。Gemma 4 26B A4Bは入力100万トークンあたり$0.06、出力100万トークンあたり$0.33、Gemma 4 31Bは$0.13と$0.38です。