Microsoft-Decision-1 対 Intern-Decision-4B の生成されたタイトルカード。副題は「2つのスコアラー、一方は数値あり、もう一方は数値なし」で、チップには 9B 対 4B、ホスト型API 対 オープンウェイト、公開ベンチマークなし 対 Brier 0.347 および ECE 0.065 と表示され、出典フッターには Microsoft の数値は未再現であり、InternLM の数値はベンダー報告であると記載されている。
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B:一方は自らのキャリブレーションを公開し、もう一方は方法論を公開する

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

置くとMicrosoft-Decision-1の隣にIntern-Decision-4B、能力よりも各ベンダーが何を公表しようとしたかによって決まる比較が得られる。Microsoftのモデルは2026年10月8日にMicrosoft Foundryで一般提供を開始した:Qwen3.5-9Bベース、Microsoftによるポストトレーニング、テキストのみ、32,768トークンのコンテキスト、重みは配布されず、精度、キャリブレーション誤差、対応のある統計検定を記述した評価方法論 — そして結果は一つもない。InternLMのIntern-Decision-4Bは2026年9月26日05:36:37 UTCにHugging Faceに公開され、その背後に発表はなく、Qwen3.5-4Bからファインチューニングされ、テキストだけでなく画像も受け付け、単一のRTX 4090で44ミリ秒で実行され、Brierと期待キャリブレーション誤差の数値の完全な表を出力する。どちらも、あなたが提供する選択肢に対する確率分布を返す。そのうちの一つだけが、それがどれほどうまくやっているかを教えてくれる。

その逆転——より大きく、より資金力のあるモデルのほうが不透明であること——こそがこの対決の構図そのものであり、ほとんどのチームにとって、どんな仕様の一行よりも早く選択を決定づける。

両者を分かつたった一つの数字

InternLMは、Intern-Decision-4Bについて、ベンチマークスイート全体でBrier 0.347、ECE 0.065を報告しており、Jevbench-Easy(100.00)、Jevbench-Original(98.61)、Jevbench-Hard(73.87)、Typed Decision(80.55)、ToolACE(96.45)、AG News(90.82)、WildJailBreak(89.86)にわたる平均スコアは90.02である。これらはベンダー自身のハーネス上でベンダーが報告した数値であり、特にJevbenchの行はプロジェクト自身のベンチマークファミリーである——独立した検証ではなく、自己評価として読むべきである。しかし、これらは尺度が明記された数値であり、特にECEは、返された0.8が行動に移す価値があるかどうかを教えてくれる指標である。

マイクロソフトは同等のものを公開していない。Microsoft-Decision-1 のカタログページにある「Benchmarks」タブには、何が測定されたかが説明されており、同モデルは「主要な意思決定モデルと同等の性能を発揮し、同じ方法論で評価された他のオープンな意思決定モデルを上回る」と主張している。最も強い分野として推論、ルール適用、プロンプト形式への頑健性が挙げられ、最も弱い分野として専門領域の知識が挙げられている。ブライアスコアも ECE も精度表もない。導入の判断で、エスカレーションしきい値を決める前にキャリブレーションの数値が必要なら、この2つのモデルのうち一方はそれを手渡してくれ、もう一方は自分で測定するよう求めてくる。

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

2つの契約が実際に異なる箇所

表面上、これらのモデルは同じ呼び出しを受け付けます。状態と、名前付きの質問のスキーマと、固定された選択肢のセットを渡すと、生成テキストを1トークンも伴わずに、選択肢ごとの確率が返ってきます。違いは、その契約の境界に現れます。

• モダリティ — Microsoft-Decision-1 は明示的にテキスト専用であり、画像、音声、映像コンテンツを受け付けたり生成したりすることはありません。Intern-Decision-4B は状態と併せて任意の画像を1回の呼び出しにつき最大8枚まで受け付けることができ、そのためスクリーンショットのトリアージ、ドキュメントレイアウトのチェック、視覚的 QA ルーティングの候補となります。

• 質問数 — InternLM は、1回の呼び出しにつき1~16個の質問、各最大62個の選択肢を、3つのフィールドタイプ(choice、score、noul)にわたって記載しています。Microsoft は形式 — はい/いいえ、多肢選択、評価、分類、ルーブリック — と最大32Kトークンにわたる単一の呼び出しを記載していますが、1回の呼び出しあたりの質問数の上限は記載していません。

• コンテキスト — Microsoftは32,768トークンと述べています。Intern-Decision-4Bのカードは、その上限を単一のコンテキスト数としてではなく、質問、選択肢、画像として示しているため、1つの数値で両者を並べて比較することはできません。

• 配布 — Microsoft-Decision-1 はホスト型の Foundry API であり、モデルの重みは配布されておらず、ダウンロードもありません。Intern-Decision-4B は Hugging Face 上の Apache-2.0 で、上流の Qwen ライセンスを LICENSE-QWEN として保持しています。これは、再配布する場合にそのライセンスと上流の通知を保持する必要があることを意味します。

• コスト構造 — InternLMのウェイトは実行にコストがかからず、1基のRTX 4090で平均44.16 ms、P95で44.60 msと公表されています。Microsoftのトークンあたりの価格は、モデルページに一切記載されていません。

• ガバナンス — Microsoft は責任ある AI の評価、文書化されたデプロイ実務、および明示的な除外事項を提供している(テキスト生成、オープンエンドな QA、会話、翻訳、要約には使用しないこと。人に関する重大な意思決定において唯一の自動意思決定者としないこと)。InternLM は、来歴について率直なモデルカード——重みは「decision tuning によって変更」——を提供しているが、コンプライアンスパッケージに類するものは一切ない。

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

レイテンシの数値を比較するのが難しい、まったく異なる2つの理由

Microsoft-Decision-1はレイテンシの数値を公開していないため、InternLMの平均44.16 msの隣に並べるものは何もありません。これはこのワークロードにとって小さな欠落ではありません。これらのモデルは、パイプライン内で何度も呼び出されるために存在します — 取得された文書ごとに1回、提案されたツール呼び出しごとに1回、採点される応答ごとに1回 — そして1秒あたり4件の判断と40件の判断の差は、サンプルを採点することとすべてを採点することの差です。InternLMの数値は、時間単位でレンタルできるハードウェア上で今日達成可能です。Microsoftの数値は、自社のFoundryデプロイを通じて測定する必要があり、選ぶデプロイ形態(従量課金のサーバーレスか、プロビジョニング済みスループットか)は、モデルよりもそれを大きく変えます。

ここが、このパターンにおけるOrcaRouterの担当部分が関係してくる場面でもあり、それは生成側の半分だけです。当社はMicrosoft-Decision-1やIntern-Decision-4Bをホストしていません。テキストではなく確率を返すモデルは、チャット補完をルーティングする先ではなく、どちらも当社のカタログには掲載されていません。当社の単一のOpenAI互換キーの背後にあるのは、文章を生成する200を超えるモデルのプールです。あるモデルが起草した審査用プロンプト、別の2つのモデルが生成した候補回答、実行前に採点されるツール呼び出しなどです。プロバイダーの定価は0%のマークアップでそのまま適用されますそのため、生成モデルの値下げは当日中に当社側にも反映され、単一のプロバイダーが劣化したときには自動フェイルオーバーがスコアリングループの生成側を稼働させ続けます。これはここでは通常以上に重要です。目にするものすべてを採点するパイプラインには、停滞した呼び出しを再試行する余裕がないからです。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

誰がどれを取るべきか

選んでくださいIntern-Decision-4B。次のいずれかに当てはまる場合:テキストだけでなく画像もスコアリングする必要がある、出荷前にキャリブレーションが必要、自分で管理する境界内の自分のインフラで実行する選択肢が欲しい、またはファインチューニングしたい。最後の点は強調に値します — 文書化されたラッパーを備えた4Bのオープンウェイトスコアラーは、独自のラベルに適応させられるモデルであり、Microsoft-Decision-1はホスト型APIで、ファインチューニングの手段も学習できる重みもありません。

パフォーマンスではなく調達が障壁であるなら、Microsoft-Dec-1を選びましょう。何かが本番環境に到達する前に、Azure認証、統合請求、ベンダーの責任あるAI評価が必要であり、また4Bの呼び出しごとの制限では複雑になる長文書向けに32Kコンテキストが必要です。公開ベンチマークがないことは実際のコストですが、それは自分のラベル付きセットを両方のモデルに通してECEを比較すれば、午後には解消できるコストです。それはどちらのベンダーの表を信頼する前に、いずれにせよ行うことです。

気まずい答えだが、これらはどちらもテストするには十分安く、議論する価値はほとんどない。Intern-Decision-4B が必要とする GPU は、おそらくすでに持っている。Microsoft-Decision-1 には Foundry のデプロイと、自社のラベル付き意思決定のサンプルが必要だ。両方にあなたのデータを通し、あなたにとって重要なサブセットでキャリブレーションを計算し、数字に決めさせよう——まさにそれこそが、これらのモデルの目的なのだから。