Microsoft-Decision-1 対 Kev の生成タイトルカード。サブタイトルは「再トレーニングできるレシピに対するホスト型スコアラー」で、チップには 9B ホスト型 API 対 凍結ベース+33.8M ランク16 LoRA アダプター、公開ベンチマークなし 対 transfer-v4 での ECE 0.017、重み配布なし 対 Apache-2.0 と表示され、出典フッターにはどちらの数値も自己申告であると記されている。
Engineering & Research

Microsoft-Decision-1 vs Kev:スコアを買うのか、それともスコアを生み出すレシピを所有するのか

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ジャレッド・パーマーは自身のモデルの隣にレシートを置いた。Kevファミリー — Kev-0.8B、Kev-4B、Kev-9B — は、凍結されたオープンウェイトのベースチェックポイント上に、rank-16のLoRAアダプターと小さなポインターヘッドで構築され、2026年9月24日に、そのトレーニングレシピ、段階ごとのデータ件数、評価数値をすべて公開して出荷された。そして、それをMicrosoft-Decision-1と比較する人にとっての正直な見出しはこうだ。Kevのほうが、自分自身を再現する方法について圧倒的に多くを教えてくれる。Microsoftのスコアラーは2026年10月8日にMicrosoft Foundryで一般提供が開始された。MicrosoftがポストトレーニングしたQwen3.5-9Bベース、32,768トークンのコンテキスト、テキスト専用、重みは配布されておらず、評価手法は公開されているが結果は未公開。どちらも状態と一連の型付き質問を受け取り、生成されたテキストではなくキャリブレーションされた分布を返す。一方はサービスであり、もう一方は今夜ノートブックで実行できる手法だ。

この対決を能力ではなくその区別が決める理由は次のとおりだ。Kev-4B はドメイン外のロック済みテストで ECE 0.017 を報告しているのに対し、Microsoft-Decision-1 は何も報告していない。つまり、スコアラー対スコアラーの比較を通常決着させるキャリブレーションの論拠は、片側しか自らの立場を示していないのである。

ケブが実際に公開するもの

Kev-4Bのカードは異常に具体的で、その具体性こそが要点だ。バックボーンはQwen3.5-4B-Baseで、特定のリビジョンで凍結され、隠れサイズ2,560で24のGated DeltaNet線形アテンション層と8のフルアテンション層を持つ。その上にランク16のLoRAアダプター(3,380万の学習可能パラメータ、アテンション、MLP、DeltaNetの射影に適用)と、各選択肢の終端トークンを質問の最終トークンに対してスコア付けし、ソフトマックスするポインターヘッドが載っている。温度T = 2.41が1つ、ヘッドファイルに保存され、読み込み時に適用される。カードには適合値とファイルハッシュが記載されている。訓練は段階的に実行され、公開されたレコード数は次のとおり:基本レシピは12,576レコード、日付と欠落証拠用が1,425、実際のCFPB苦情ナラティブが5,219、スキルレコードが6,000、開発者ツーリングレコードが5,320で、後の段階では以前のものをリプレイした。カードには使われなかったものも明記されている:「Jev(TypeSafeのホスト型意思決定モデル)の出力は一切使用されていない。」

ベンチマーク表は同じページに記載されており、失敗事例も添付されている。これは成功事例よりも珍しい。Transfer-v4のロックされたドメイン外テスト: 精度0.838、Brier 0.224、ECE 0.017。Breadth-v1は14のホールドアウトデータセットと3,089問にわたり、精度0.690、ECE 0.029。Hard-v1テスト: 0.803。Documents-v1テスト: 0.903。10個の選択肢があるMMLU-Pro: 0.565。日付演算: 0.65。著者によって最も弱い領域と名指しされており、部分的な修正策としてプリプロセッサフラグが提示され、再測定は行われていないという明示的な注記がある。制限事項のセクションではさらに、キャリブレーションが単一の分布内温度であるためドメイン外ではカバレッジが低下すること、選択肢の順序によって回答が反転し得ること、8,192トークンを超える長さは提供されるものの検証されていないことが追加されている。サービングの数値も公開されている。H100上で短い状態に対する6問で18.1 ms、キャッシュ時は12.9 ms、常駐GPUメモリは14.3 GB。

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

代わりにMicrosoftが公開するもの

Microsoft-Decision-1 は、異なるスタンスでほぼ同じ領域をカバーしています。はい/いいえ、多肢選択、評価、分類、ルーブリックの質問を採点し、「判断できない」などの明示的な棄権オプションをサポートし、JSON 確率を返し、最大 32K トークンにわたる 1 回の呼び出しで実行されます — これは Kev が検証するコンテキストの 4 倍です。これは、Direct from Azure ポートフォリオの下で Microsoft Foundry のホスト型 API として配布され、サーバーレスおよび統合エンドポイントのデプロイ、標準 SKU、Azure 認証、統合課金パスを備えています。バッチ推論は無効で、重みのダウンロードやファインチューニングのパスはありません。

評価セクションでは、公開およびコミュニティの意思決定ベンチマークに加え、ホールドアウトされた内部セット、精度やキャリブレーション誤差を含む指標、オプション順序の変動、対応のある統計検定、そしてモデルが「同じ方法論で評価された主要な意思決定モデルと同等の性能を発揮し、他のオープンな意思決定モデルを上回る」という主張が記述されている。表はない。モデルカードは自らの限界を正直に明記している——スコアは言い回しやオプション順序によって変動し、キャリブレーションは慣れたタスクタイプで最も強く、説明は生成されず、非英語のカバレッジが最も弱い——しかし、限界のリストはキャリブレーションの測定ではない。Microsoft-Decision-1で0.9の自動承認しきい値を設定する人は、それを信仰に基づいて設定し、本番環境で調整しているのである。

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

比較の中でお金がかかる部分

Kevの経済性こそが、この対決が本当に接戦である理由だ。そのレシピは、凍結されたベースに33.8Mのアダプターを加えるという構成で、つまり追加で学習するモデルにかかる計算コストはアダプター規模であり、基盤モデル規模ではない。ベースを一度メモリに保持しておけば、複数のアダプター——意思決定ドメインごとに1つ——を読み込める。これはMicrosoftのホスト型APIではまったく表現できないデプロイ形態だ。あなたのルーティングルールが汎用的なジャッジのものと異なるなら、Kevはその違いを学習させてくれる。Microsoft-Decision-1は、より良いプロンプトを書いて祈ることしかできない。

それに対して、ホスト型 API には運用面での負担が一切ない。追跡すべきアダプターも、ウォーム状態に保つべきサービングスタックも、検証時と提供時のコンテキストギャップについて考える必要も、あるデータセットでフィットさせた temperature が自分のデータセットでは異なる挙動を示すリスクもない。意思決定の量が控えめなチームにとっては、トークンに費用がかかるとしても、サービスはエンジニアリング工数の面でより安価な選択肢だ。1 日に数百万件をスコアリングするチームにとっては、GPU の代金を回収した時点で、セルフホスト型アダプターが単位コストで優位に立つ。

どちらのモデルも、それが最も苦手とする部分には使わない第三の道があり、そこがOrcaRouterの立ち位置です。当社はMicrosoft-Decision-1やKevをホストしていません。確率を返すスコアラーはchat-completionsの対象ではありませんし、どちらのモデルも当社のカタログには入っていません。当社が担っているのは意思決定パイプラインの生成側です。つまり、候補となる回答を起草し、ルーブリックを書き、あるいはスコアリング対象となるツール呼び出しを発行するモデルです。それらすべては、200以上のモデルを搭載した1つのOpenAI互換キーの背後にありますプロバイダー定価のまま、マークアップ0%でそのまま提供。そのため、ベンダーの価格改定は当社側でも当日に反映されます。採点やトリアージのループを構築しているのであれば、執筆の呼び出しはルーティング可能で、スコアリングの呼び出しはそうではありません。この境界を明確に保つことが、スコアリングパイプラインが知らぬ間にチャットパイプラインになってしまうのを防ぐのです。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

どうやって決めるか

選ぼうKev——出荷前に数値が必要なとき、自分の意思決定ラベルでファインチューニングしたいとき、自分の境界内で限界費用ゼロでスコアリングを実行したいとき、あるいは複数の意思決定ドメインに1つの常駐ベースモデルを共有させたいときに。公表されているECEの数値は、依然として著者自身が著者自身のハーネス上で測定したものであり、監査済みの第三者による結果ではなく、信頼に足る自己評価として扱うべきだが、少なくとも再現を試みることのできる明示された尺度ではあり、再現するためのレシピもすぐそこにある。

選ぶべきですMicrosoft-Decision-1を、判断の分かれ目が調達かコンテキスト長である場合には。統合請求とResponsible AIパッケージを備えたマネージドAzureエンドポイント、長い文書向けの32K入力、そしてエスカレーション先となるベンダーが付いています。ベンチマーク表が欠けていることはスキャンダルではありません——ホスト型モデルの多くはそれなしでローンチされます——が、それはこのモデルの最初のキャリブレーション曲線がユーザーによって引かれることを意味しており、本番のしきい値をこれに設定する前に、自分のラベル付きデータを使って、その一人になるつもりで計画しておくべきです。