Microsoft-Decision-1 の生成タイトルカード。サブタイトルは「一般提供開始、しかも公表されたスコアはただの一つもない」、バッジには「Microsoft Foundry、2026年10月8日」、チップには「Qwen3.5-9B base、32,768トークンコンテキスト、テキストのみ、出力トークンゼロ、重みは非配布」と表示されている。
Guides & Insights

Microsoft-Decision-1がFoundryで公開された。そのベンチマークタブは空だ。

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今週のMicrosoftのリリースで最も興味深いのは、Microsoft-Decision-1に何ができるかではない。Microsoftがそれについてあえて公表しなかったことだ。このモデルはすでに稼働している。Microsoft Foundryで2026年10月8日に一般提供が開始された。これは本稿を書く2日前のことだ。これは意思決定スコアリングモデルだ——状態と、固定された回答セットを伴う質問を与えると、回答ごとに較正された確率を返す——MicrosoftがオープンウェイトのQwen3.5-9Bでポストトレーニングしたもので、最大32,768トークンに対して1回のパスを実行し、出力トークンはゼロだ。なぜならそもそも何も生成しないからだ。カタログページにはBenchmarksタブがある。そこには方法論の段落が1つあるだけで、数値は一切ない。

そのギャップこそが核心であり、また別の「Microsoftがモデルを出荷した」という記事よりも有用な話だ。スコアラーに関する真剣な問いはすべてキャリブレーションの問いだ——返された0.8は0.8を意味するのか——そして、ブライアスコアも期待キャリブレーション誤差の数値も一切示さずに登場するローンチは、肝心の唯一の数値を、それを採用する誰かに測らせるままにする。以下に示すのは、Foundryページが実際に文書化していること、あからさまに省いていること、そして評価チームが今週それについて何ができるかである。

正確には、何がリリースされましたか

Microsoft-Decision-1はホスト型APIです。その契約は、入力が1回の呼び出し、出力が1つの分布であり、経路のどこにもデコードループが存在しません。リクエストは、判定対象の素材と、回答集合が限定された質問を運び、レスポンスは各選択肢の確率を運びます。Microsoftは、対応する質問形式として、はい/いいえ、多肢選択、評価、分類、ルーブリックベースを挙げており、いずれも最大32Kトークンの単一呼び出し内で扱えます。これはテキスト専用で、画像・音声・動画の入力はなく、出力は数値だけです。

除外事項は機能と同じくらい率直に述べられており、何よりも先に読む価値がある:テキスト生成、自由回答形式の質問応答、会話、翻訳、要約には設計されておらず、入力に存在しない知識を必要とするタスクを意図したものでもない。根拠は生成しない。公表されているユースケースはすべて、プラットフォームチームが既にラベル付きの決定を下す必要がある場所である — 生成された回答をルーブリックに照らして採点する、検索の関連性を判断する、キューをトリアージする、提案されたエージェントツール呼び出しをゲートする、固定されたベンダーポリシーではなくアプリケーションが定義する閾値に対してコンテンツをスクリーニングする、そして高信頼度の結果を自動承認し、残りをエスカレーションする。

デプロイの一覧から際立つ運用上の詳細が2つある。1つ目は、Microsoft が、提供された証拠が不十分な場合に「判断できない」といった棄権オプションを明示的にサポートしていることだ。これは、較正されたスコアラーと、単に自信があるだけのスコアラーとの違いであり、しきい値処理を機能させるものである。2つ目は、バッチ推論が無効になっていることだ。生成モデルのように、大規模なスコアリング実行をバッチチャネルを通じて償却することはできない。そのため、呼び出しごとのレイテンシは、オフラインジョブの問題ではなく、あなたのパイプラインのレイテンシである。

配布はFoundry限定で、「Direct from Azure」ポートフォリオにおいて、標準SKU上でのサーバーレスまたは統合エンドポイント(unified endpoint)デプロイとして提供されます — 従量課金制または予約済みプロビジョニングスループット。 重みは配布されません。 Hugging Faceリポジトリも、ダウンロードも、ファインチューニングの手段も、セルフホスティングの選択肢もありません。アプリケーションは標準のAzure認証を用いてHTTPS経由で統合されます。トレーニングに関する開示情報によると、データセットが最初に使用されたのは2026年9月で収集は継続中であり、これはトレーニングデータとGA日との間の可能な限り最短の距離にあたり、他社が公開したベースモデルに対するポストトレーニングとしては通常のことです。

ベンチマークタブ、全文引用

Microsoft がモデルの性能について公表した内容の全体は次のとおりです。評価には「公開およびコミュニティの意思決定ベンチマークと、トレーニングに使用されていない内部のホールドアウトテストセット」が使われました。指標は精度、キャリブレーション誤差、安全性リコール、偽陽性率、公平性の一貫性でした。選択肢の順序は変えられました。対応のある統計検定が適用されました。主張は定性的です。Microsoft-Decision-1 は「同じ方法論で評価された主要な意思決定モデルと同等の性能を発揮し、他のオープンな意思決定モデルより優れています」としています。

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

それは、結果が示されないまま説明された、手堅い評価設計だ。それを指摘することは非難ではない——表を伴わない方法論の段落は、具体的で検証可能な選択であり、この小さなカテゴリーのほかの面々がしてきた選択とは異なる選択だ。Microsoft が暗黙のうちに比較対象としているオープンな意思決定モデルは、自らの数値を公表している。InternLM の Intern-Decision ファミリーはモデルカードに Brier と expected-calibration-error の数値を記載し、TypeSafe の Jev はその両方を公開しており、Liquid AI の d1 ラインは重みとともに精度表を提供している。Microsoft はこのグループで最大の企業であり、ただ信頼して受け入れてほしいと求めている唯一の企業である。

同社は、モデルがどこで強くどこで弱いと考えているかを明示している。これは見出しのスコアよりも実行に移しやすい。最も強いのは、推論、ルール適用、プロンプトの書式に対する堅牢性。競争力があるのは、分類、検索、公平性、ツール利用、および大半の多言語タスク。最も弱いのは、専門領域の知識だ。自己申告された限界も同じように率直である——スコアは言い回しや選択肢の順序によって変動し得る、枠組みが不適切な質問でもスコアは返ってくる、キャリブレーションが最も強いのは慣れたタスク種別であり、回答が誤って見えるときに監査できる説明はない。

言語カバレッジにも同じ形の注意点がある。25言語がサポート対象として挙げられており、日本語、韓国語、アラビア語、ベトナム語、タイ語、トルコ語、ヒンディー語、ベンガル語、スワヒリ語、ヘブライ語、ペルシア語、ウクライナ語などを含む。カバレッジ、品質、キャリブレーションは「言語によって異なる場合がある」こと、また英語以外、特に低リソース言語は性能が不十分な領域であることについて、明示的に警告されている。Qwen3.5-9Bベースは200をはるかに超える言語をサポートする。ポストトレーニングではその約4分の1が維持され、キャリブレーションが適合されたのはその4分の1である。

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; availability Foundry GA, October 8, 2026; context 32,768 tokens; output calibrated probabilities with zero output tokens; published benchmarks a methodology only with no figures; weights hosted API only, not distributed. A footer line reads that all figures are Microsoft-reported with no independent reproduction and no published Brier or expected calibration error.

そのページにも価格はありません

カタログの価格フィールドには料金が記載されていません。Microsoft自身のモデル価格ページへリンクしており、1回の意思決定あたりのコストはモデルカードからではなくAzureや請求書から読み取るものです。大量処理での意思決定あたりのコストを試算する人にとって、これは実際の欠落であり、推計でごまかさず率直に明言する価値があります。ただし、アーキテクチャから導かれる2点は、その試算に活かす価値があります。1回の呼び出しコストの0%は出力トークンです。なぜなら出力トークンは一切存在しないからであり、選択肢の集合は入力の一部であるため、62個の記述的な選択肢を伴う質問はイエス/ノーよりも1回あたりのコストが高くなります。支払っているのは自分が書いたルーブリックに対してであり、答えに対してではありません。

なぜこの形のリリースが興味深い部分なのか

意思決定スコアラーは、プリミティブ企業が実際に必要としているのは、より優れた書き手ではなく、より安価で信頼性の高い判定者だという賭けである。その賭けが報われるのは、確率が信頼できる場合だけだ。なぜなら、スコアラーの下流にあるものはすべてしきい値だからである。0.7は人間にエスカレーションし、0.95は自動承認し、その線を間違えるコストは、トークンではなく、誤った自動意思決定によって支払われる。キャリブレーション表なしでスコアラーを出荷するベンダーは、各顧客に自社データ上でそれを再導出するよう求めているようなものだ。

Microsoft自身のドキュメントがまさにそれを推奨しており、そのことは批判を和らげると同時に、実践的な結論を際立たせている。ユースケースを代表するデータで検証すること。デフォルトではなく、エラーのコストからしきい値を設定すること。常に棄権の選択肢を含めること。順序が回答にバイアスを与えうる場合は、選択肢の順序をランダム化すること。重要な事柄には必ず人間をループに入れておくこと。それはどんなスコアラーにとっても妥当な助言だ。このスコアラーについては、それが唯一利用できる助言である。

今週、コミットせずに試してみる

最も安上がりな評価は、すでに手作業で下している判断を一つ選び、アプリケーションが実際に提示するであろう回答セットを使ってラベル付きの事例を二百件集め、それらを Foundry デプロイメントに通すことだ。出力に対して期待キャリブレーション誤差を計算すれば、Microsoft が公表しているどの情報よりも Microsoft-Decision-1 について多くを知ることになる。なぜなら、社内のホールドアウトテストセット上ではなく、あなた自身の分布上で測定したことになるからだ。それは午後半日で終わる作業であり、ベンチマークに関する問い全体を不要にする。

OrcaRouterが当てはまるのはスコアリングループのもう一方の半分であり、それは生成する側の半分です。当社はMicrosoft-Decision-1をホストしておらず、カタログにも含まれていません — テキストではなく確率を返すモデルは、チャット補完をルーティングする先ではありませんし、ここにある記述は可用性の主張として読まれるべきものではありません。当社の単一のOpenAI互換キーの背後にあるのは、200を超えるモデルのプールであり、それが文章を書く役割を担います。ルーブリックを起草するモデル、候補となる回答を生成する2つのモデル、ツール呼び出しDecision-1を発行し、それが実行される前にスコアリングするモデルです。プロバイダーの定価はマークアップ0%でそのまま渡されます。そのため生成側での値下げは当社側でも当日に反映され、単一のプロバイダーが劣化したときには自動フェイルオーバーが生成側のレッグを維持します — これは、たまにユーザーに応答するだけのパイプラインよりも、目にするものすべてをスコアリングするパイプラインにおいて重要です。単一のジャッジを選びたくない場合、ルーティングDSLが複数のモデルを1回の呼び出しに合成し、モデルフュージョンはそれらの一致を、読まなければならない散文としてではなく、スコア付きのフィールドとして報告します。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

この記事を変えるものは表だ。ブライアスコアとECEを公開するか、独立した実行をリーダーボードに載せれば、上の評価は、現存する唯一の証拠ではなく、裏づけになる。それまでは、Microsoft-Decision-1について正確に言えるのはごく限られている。重みは実在し、契約はほとんどのホスト型リリースがなし得るよりもよく文書化され、棄権オプションは後付けではなく当初から設計に組み込まれており、性能の主張は一文にすぎない——よく書かれた一文で、数値にはまったく結びついていない。

結論

Microsoft-Decision-1 は、2026年10月8日に Microsoft Foundry で一般提供を開始した、Qwen3.5-9B を基盤とするテキスト専用・32,768トークンの意思決定スコアラーであり、独自の選択肢セットに対して校正済みの確率を返し、出力トークンはゼロ、ダウンロードする重みもありません。その強みは、クリーンなシングルパス契約、設計に組み込まれた棄権パス、そして Azure の認証・課金・ガバナンスが付随していることです。弱みは、Microsoft の外部には、その校正精度がどれほど優れているかを示す公表された数値が誰にもなく、Microsoft 自身にもないことです。このローンチは、能力が確立されたものとしてではなく、API が利用可能になったものとして扱い、下流の何かがしきい値に依存する前に、自分自身のラベル付きケースをそれに通してください。