Decision 3.0 と Microsoft-Decision-1 の比較用に生成されたタイトルカード。サブタイトルは「同じ Qwen3.5-9B バックボーン、正反対の入手方法」、チップは「重みは Apache-2.0 vs ホスト型のみ」「画像と動画 vs テキストのみ」「公開 10 月 10 日 vs GA 10 月 8 日」、フッターは「Decision 3.0 の数値は vLLM-SR 自身によるもの、Microsoft-Decision-1 の数値は Microsoft 自身によるものであり、いずれも独立に再現されたものではない」。OrcaRouter のロゴが右下隅に合成されている。
Engineering & Research

Decision 3.0 対 Microsoft-Decision-1:一方はダウンロード、もう一方はSKU

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

9BティアのDecision 3.0とMicrosoft-Decision-1は、書類上は同じ製品である。どちらもQwen3.5-9Bを、トークンを一切生成することなく、固定された一連の候補回答に対してそれぞれ較正済みの確率で答えるスコアラーへと事後学習させる。どちらも狙っている仕事は同じだ——リクエストのルーティング、ルーブリックに照らした出力の採点、エージェントの行動のゲート、キューのトリアージ。どちらも1週間以内に相次いで登場した。Microsoft-Decision-1は2026年10月8日にMicrosoft Foundryで一般提供を開始し、翌日に発表された。そしてd3-flashは2026年10月10日17:23 UTCにHugging Faceへプッシュされた。

違いはモデルではない。許されていることだ。d3-flashは、ダウンロードして実行する83.9億パラメータのApache-2.0チェックポイントであり、5.9億から始まり260.9億で頂点に達するファミリーの中で3番目に位置する。Microsoft-Decision-1はFoundry上のホスト型エンドポイントであり、重みはまったく配布されておらず、後に自社のMAIモデルへリベースするとマイクロソフトが述べている系統に属する。このうち一方は成果物であり、もう一方はサービスだ。この二者に関する実用的な疑問は、ベンチマークに関するものに見えるものを含め、ほぼすべてがそのただ一つの事実から導かれる。

決定モデルの目的に関する2つの決定

マイクロソフトの投稿は、モデルカードではめったにないほど、適用範囲について明確に述べている。対応する質問形式は、はい/いいえ、多肢選択、評価、分類、ルーブリックに基づく採点だ。除外事項も同じくらい明白に列挙されている。テキスト生成、自由回答形式の質問応答、会話、翻訳、要約向けには設計されておらず、入力に存在しない知識を必要とするタスクを意図したものでもない。最大32,768トークンに対して1回のパスを実行し、デコーディングループがないため出力トークンはゼロである。マイクロソフトはまた、提供された証拠が不十分な場合に「cannot tell」などの棄権オプションをサポートしており、この詳細によって初めて出力に対する閾値設定が意味を持つようになる。

d3-flashは同じ概念的な枠組みの中に位置する——Choice、Noul(はい/いいえ)、Scoreの質問、質問ごとに1回の順伝播、選択肢ごとに1つの確率、生成なし——そして入力側を広げる。Microsoft-Decision-1が設計上テキスト専用であるのに対し、d3-flashはテキストまたはJSONを受け付け、1リクエストにつき複数の画像を各最大1.6メガピクセルで、複数の動画を毎秒2フレームで読み取る。リクエスト内のすべての質問は、それに添付されたすべての画像と動画を見る。それは、与えられた入力をより多く活用する、より小さなモデルである。

それが最初の本当の分かれ目であり、好みの問題ではない。あなたが下す必要のある判断が、スクリーンショット、レシート、チャート、またはカメラのクリップに関するものであるなら、Microsoft-Decision-1 にはそれはできない。それは能力の境界であり、品質の差ではない。そして、どれだけ精度向上に取り組んでもその境界は埋まらない。

それぞれが何を公開しているのか、そしてその方法

ここでは、この2つのリリースは本当に異なる種類の証明を行っており、数字を並べるよりもそれらを切り分ける価値がある。

Microsoftは約15万件の質問にまたがる36ベンチマークの比較を、訓練から隔離した状態で実施し、ルーティング、ランキング、長いコンテキスト、多言語および分布外タスク、推論、安全性を網羅し、同社のモデルがこれらのセット全体で最良の結果を出したと述べている。レイテンシは数値ではなく比率で報告しており、p50はGPT-6 Solより約35倍速く、次点としているH2O-Lightning-4B v1.1より2.5倍速い。堅牢性は手順として記録している。同じリクエストを8通りに摂動させ、平均の判定反転率は1.3%、選択肢の説明を言い換えた場合や選択肢を逆順またはシャッフルした場合の反転はゼロだった。安全性は、有害コンテンツ、ジェイルブレイク、プロンプトインジェクションを網羅する11のベンチマークにわたる5,250件のリクエストでテストした。自らに課すキャリブレーション基準を明示している。代表的なケースでは、90%の予測は10回中約9回正しくなるべきだというものだ。

vLLM-SRがインデックスを公開した。Jev Decision Index 0.3.1は、d3を64.7に、d3-flashをpublic-suiteで57.79に位置づけ、Decision 2.0の9Bモデルの46.76に対して11.0の向上を主張している。また、140,178件の公開リクエストすべてに回答し、未対応はなかったと主張しているが、これは正確性ではなく網羅性に関する記述である。カードは、d3自身の行は内部評価である一方、その隣に並ぶ比較行 — Perplexity Decider v1.1、Fastino GLiDE、Jev、Torchcast Decision 27B — はライブのボードデータであると開示している。そしてマルチモーダル側では、d3ファミリーのモデルが19,140件の検証質問すべてでPerception Testスコアを報告しており、d3-flashは73.3で、3択のチャンス下限33.3に対する値である。

要するに、Microsoft は、文書化された手法とロバスト性の数値を伴う広範性の主張を公表しており、チェックポイントごとのキャリブレーション数値は示していない。vLLM-SR は、自身の行と他の行との間に明記された来歴のギャップがあるリーダーボード順位を公表し、さらに動画の結果も示しているが、キャリブレーション数値もない。どちらのカードにも、それが記述するモデルのブライアスコアや期待キャリブレーション誤差の数値は載っていない。返される数値に意味があることこそが価値提案のすべてである2つの製品にとって、これが共通の穴であり、どちらのベンダーが次にリリースできるとしても最も有用な一点である。

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

流通はスペック表以上にものを決める

ここからは、比較はモデルの話ではなくなります。

d3-flashを使えば、重み、decision_config.json(ベースリビジョンを固定するもの)、ファイル単位のSHA-256マニフェスト、カスタムのモデリングコード、リードアウトヘッド、そして次を含む文書化された依存関係セットが得られます:transformers==5.17.0、および線形アテンション層向けのオプションのCUDAカーネルパッケージ。自分のハードウェアで実行し、ファインチューニングし、量子化し、エアギャップ環境に置くこともできます。ただし、運用面の作業も引き受けることになります。Pythonクラスはエンドポイントではありませんし、カードには状態+質問+候補記述のトークン予算が明記されていません——max_lengthは出荷時の設定ではnullなので、その上限は自分で見つけ出すことになります。

Microsoft-Decision-1 の場合、既存のクラウドアカウント内にエンドポイントが手に入り、それに付随する認証、リージョン可用性、プロビジョニングの管理も付いてきます。運用作業は一切発生しません。ただし、制御も一切できません。ダウンロードできるリポジトリもなく、ファインチューニングの道筋もなく、セルフホスティングのオプションもありません。モデルのライフサイクルはマイクロソフトのものであってあなたのものではなく、非推奨の通知や別のバックボーンへのリベースは、あなたが予定する変更ではなく、あなたが受け入れる変更です。マイクロソフトは自社の MAI モデルへのリベースが控えていると述べており、これは高速なシングルパススコアリングを主眼とするモデルにとって妥当なロードマップですが、同時に、あなたがベンチマークした特定のチェックポイントが、1 年後に呼び出しているものと同じとは限らないということも意味します。

レイテンシの話も注意深く読む必要がある。Microsoftの見出し数値は、はるかに大規模な汎用モデルに対する比率であり、これはその主張にとって正しい比較だ——意思決定モデルの役割は、高コストな生成呼び出しを安価なスコアリング呼び出しに置き換えることであり、p50でGPT-6 Solに対して35倍というのは、その主張が実際に成立するときの姿である。vLLM-SRの数値は絶対値で、単一リクエストかつ単一GPUのもので、モダリティ税を明瞭に示している。1台のAMD Instinct MI325X上では、d3-flashへのテキストリクエストは中央値19.1 msかかり、同じリクエストに画像を付けると149.4 ms、10秒の動画では407.6 msかかる。どちらの数値セットもベンダー報告によるもので、異なるハードウェア上で得られたものであり、どちらもそれを生み出したラボの外で再現されたことはない。

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

選び方

決定ルールは短く、これはその2つの製品が実際には同じ枠を争っていないという良い兆候だ。

選んでくださいMicrosoft-Decision-1判断がテキストのみで、すでに Foundry 上で運用しており、デプロイではなく呼び出しであること自体が目的であるなら。GPU を買う必要も、コンテナを運用する必要も、モデルのライフサイクルを自前で持つ必要もありません。マイクロソフトの補足資料もまた、プラットフォームチームにとっては2つのうちより使いやすいものです。摂動、安全テストの件数、そして棄権オプションがサポートされているという記述は、しきい値ポリシーを策定するために必要な情報であり、32,768トークンの上限も空白のままではなく明記されています。

を選ぼうDecision 3.0 — 現実的には d3-flash か d3-mini — 判断の一部でも画像やクリップに依存する場合、ホスト型 API が到達できない場所で実行する必要がある場合、または独自のラベル付きケースでスコアラーをファインチューニングしたい場合。Apache-2.0 ライセンスとファイルレベルのハッシュマニフェストが、それを理論上の選択肢ではなく本物の選択肢にしている。その代わりに受け入れることになるのは、明示されていない入力予算、公開されたキャリブレーションがないこと、そしてこのファミリーが登場して数日しか経っておらず、外部での使用実績が実質的に皆無であるという事実だ。

両方が必要な場合——定型的なテキスト経路向けのホスト型スコアラーと、マルチモーダルやエアギャップ環境向けのセルフホスト型スコアラーを、同じインターフェース経由で呼び出す——、正直なところ、現在それを提供しているベンダーは存在せず、また2つのリクエスト形式は統合できるほど近いものの、同一ではない。

OrcaRouterが位置する場所と、そうでない場所

typesafe/jev-1.13は、私たちのカタログにある決定モデルであり、次のエンドポイントで提供されます:POST /v1/systemone上記の両モデルが実装しているのと同じ状態と名前付き質問の契約を持ちます:テキスト入力、構造化JSON出力、最大約64K入力トークン、非ストリーミング、100万入力トークンあたり$0.042で、完了課金はありません。なぜなら、それを生成しないからです。特に、上記のどちらのカードも完全には答えていないAndroidスタイルのトークン予算の質問は、ここで答えられます。

この比較に登場するどちらのモデルも、当社では取り扱っていません。Decision 3.0 のチェックポイントは、ルーティング可能なエンドポイントではなく、Hugging Face リポジトリ内のローカル推論パスとして提供されています。また、Microsoft-Decision-1 は Microsoft 自社のプラットフォームおよび複数のサードパーティ製プラットフォームを通じて配布されており、当社を通じての配布ではありません。ここに記されている内容は、どちらについても入手可能であることを示す主張として解釈されるべきではありません。

この判断においてルーティング層が実際に価値を持つのは、ループのもう半分の側だ。スコアラーは構造上安価だが、その出力に基づいて動くモデルはそうではない。意思決定モデルと生成モデルを組み合わせるということは、通常、2つの統合、2つの課金関係、2つの障害モードを意味する。200以上のモデルを1つのキーで両方呼び出す——プロバイダーが不安定になったときの自動フェイルオーバー付きで、しかもベンダーの定価が0%のマークアップでそのまま渡されるため、ベンダーの価格変更が当日に反映される——ことで、呼び出し側に手を触れることなくスコアラーを差し替えられる。これはここではいつも以上に重要だ。なぜなら、これらのモデルはどちらもまだ登場したばかりで、今週下す判断は来月には覆せるものであるべきだからだ。

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

半年後にこれを決める問い

2つのチームが同じ週に同じベースチェックポイントをポストトレーニングして同じ形の製品に仕上げながら、それが顧客にどのように届くべきかについて正反対の結論を出した。それはタイミングの偶然というよりも、このカテゴリーがどう売られているかの分岐だ。重みとしてか、サービスとしてか。自分が所有するものとしてか、呼び出すものとしてか。

3つのシグナルに注目せよ。MicrosoftがMAIまたは自社モデルへリベースすることで、現在売り込んでいる精度とレイテンシの挙動が変わるかどうか——そして顧客がどれだけ事前通知を受けるか。vLLM-SRがDecision 3.0について入力バジェットとキャリブレーション数値を公表し、そのインデックスを実用的なものにできないでいるギャップを埋めるかどうか。そして、どちらのラボの外部の誰かが、公開されたd3の重みで公開スイートを実行するかどうか。というのも現時点で、この比較に決着をつける唯一の数値は、どちらのベンダーも出していないものだからだ。