Microsoft-Decision-1 対 Laya の生成されたタイトルカード。サブタイトルは「言語カバレッジ 対 コンテキスト長」で、チップには「25 のサポート言語 対 100+ 言語」「32,768 トークンのコンテキスト 対 1,024 トークンのウィンドウ」「ホスト型 API のみ 対 Apache-2.0 ウェイト」と表示され、フッターには両ベンダーの数値は自己申告である旨が記されている。
Engineering & Research

Microsoft-Decision-1 対 Laya:API の背後に 25 言語、322MB のダウンロードの背後に 100+ 言語

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

言語の数を数えれば、比較は決着したように見える。Microsoft-Decision-1は2026年10月8日からMicrosoft Foundryで一般提供されており、25のサポート言語を挙げ、カバレッジ、品質、キャリブレーションは「言語によって異なる場合がある」と明記し、非英語、とりわけ低リソース言語を性能が不十分な領域として名指ししている。Layaは、Convai Innovationsが2026年9月18日にApache 2.0の下で公開したもので、100以上の言語にわたる多言語対応と説明し、テストした51言語のうち45言語がルーティング併用で実用可能だと報告している。英語専用の兄弟モデルでは51言語中23言語であるのに対し。一方は32,768トークンのコンテキストを備えたAzureエンドポイント背後の9Bモデル、もう一方は単一のTesla T4上で1決定あたり32.8ミリ秒で動作する4億2,100万パラメータの分類器で、しかも無料。どちらもトークンを1つも書くことを拒み、どちらもあなたが定義した選択肢に対する確率を返す。

しかし、2つのモデルカードを最後まで読むと、言語数はもはや興味深い数字ではなくなる。興味深いのはその背後にあるキャリブレーションの話であり、その話をこの2つのプロジェクトは正反対の方向から語っている。

Layaは、自社のマーケティングにとって都合の悪い数字を公開している

Layaのモデルカードは、自身の限界セクションで、ベースチェックポイントが型付き意思決定ベンチマークでゼロショットで0.362を記録し、これは多数クラスベースラインの0.461を下回ると述べている。それは、そのテストで「最も一般的な答え」を推測するよりもモデルが劣っていると告げるカードである。また、ベースチェックポイントはゼロショットではほぼ偶然のレベルであり、見出しの0.766という型付き意思決定の数値はそのベンチマーク自身の分割で微調整する必要があり、順序尺度のスコア質問が最も弱いプリミティブであること(SST-5 0.372)、高カーディナリティの選択質問は、77の選択肢がそれぞれ約3~4トークンしか残さないため苦しむこと、noulは自身のラベルに従うことができること、そしてaction.act_probabilityフィールドはAUROC 0.30で「まだ使用可能なシグナルを運んでいない」こと。Convai自身の要約文は、いかなる評価にも持ち込むべきものである:Layaは特化するための高速なベースであり、ゼロショットの意思決定エンジンではない。

その率直さは、聞こえ以上に価値がある。なぜならそれは、Layaが何のためのものかを正確に語っているからだ。これは自分のラベルでファインチューニングするエンコーダであり、アーキテクチャ全体は、新しいスキーマには再学習が不要だが、タスクで良い性能を出すには再学習が必要となるように設計されている。そう使った場合、公表されている数値は強力だ。ファインチューニング後のtyped decisionsではJevの0.727に対して0.766、AG Newsは0.910に対して0.950、DAIR Emotionは0.480に対して0.595、そしてECEはJevの0.246に対して0.081——ただし、自信過剰な状態で出荷されるためtemperatureの再フィッティングが必要だという正直な注記付きで、それによって平均ECEは0.466から0.081へと動く。

Microsoftは方法論を公開する一方で、結果は伏せている

Microsoft-Decision-1 の Foundry ページは、同じ検証を逆方向から行っている。評価について詳細に説明している——公開およびコミュニティの意思決定ベンチマークに加え、ホールドアウトされた社内セット、精度や較正誤差を含む指標、選択肢の順序の変動、対応のある統計検定、比較対象モデルに同一のハーネス——そして、このモデルは「主要な意思決定モデルと同等の性能を発揮し、同じ方法論で評価された他のオープンな意思決定モデルより優れている」と報告している。その強み(推論、ルール適用、プロンプト形式に対する堅牢性)と弱み(専門分野の知識、非英語)を挙げている。

そして、何も出力しない。精度の数値も、キャリブレーション誤差も、ベンチマーク別の表もない。自己申告の限界は現実的で有用だ——スコアは言い回しや選択肢の順序で変動し、うまく組み立てられていない質問でもスコアは返ってきて、キャリブレーションはなじみのあるタスク種別で最も強く、説明は生成されない——しかし、限界の一覧は測定ではない。つまり、このトレードオフは異例なほど明快だ。Laya は、自分のデータで反証を試みられる数値を与えてくれる。Microsoft は、コンプライアンス上の姿勢と、長い文書を入れられる 32K コンテキストを与えてくれる。

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

サイズの違いが実際にもたらすもの

ここでの Laya の小ささは妥協ではなく、設計そのものです。なぜなら、すべての選択肢はそれぞれ独自の[MASK]トークンでスコアリングされ、その質問の選択肢全体に対してソフトマックスされるため、回答空間は語彙ヘッドに焼き込まれるのではなくリクエスト時に組み立てられます。だからこそ、今日の午後に考案したスキーマでも再学習が不要であり、モデルが3億2200万~4億2100万パラメータに収まるのです。多言語チェックポイントは英語版より約2.2倍高速に動作し、ルーターは0.5ミリ秒未満で文字体系を検出し、バッチ処理のスループットは1台の T4 で毎秒103~332問に達します。すべてのチケット、取得したすべての文書、あるいは提案されたすべてのアクションをスコアリングするようなワークロードにとって、そのスループットこそが価値であり、パラメータ数ではありません。

その設計のコストは同様に具体的であり、Microsoftの代替案と対比して述べる価値がある。英語版チェックポイントは512トークンのウィンドウを取り、多言語版は1,024で、8Kまで拡張可能だ。Microsoft-Decision-1は32,768を取る。長いサポートスレッド、完全な契約書、複数ページのポリシー文書は、Layaのウィンドウにはまったく収まらず、どれだけ速度があっても切り捨てを補えるものではない。Layaは1回のフォワードパスにつき1つの質問セットに回答し、各選択肢ごとに文書化されたトークン予算を伴う。Microsoftは、質問ごとの上限なしに最大32Kトークンにわたる単一の呼び出しを文書化している。また、分類器としてのLayaの競争上の弱点は知っておく価値がある。Banking77では0.425を記録し、Jevの0.870と対比される。これは、特化パスが最も重要となる種類の、細粒度で高カーディナリティなインテント問題である。

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

トークン単位ではないコスト比較

Laya は使用時点では無料です — セルフホスト、Apache 2.0、セルフホスト費用として「$0」と記載 — そしてその本当の価格は、あなたのタスクで十分に機能するようになる前に支払うことになるファインチューニング実行です。Microsoft-Decision-1 はホスト型の Foundry API で、モデルページに記載されていないトークン単位の料金がかかり、ダウンロードする重みもなく、ファインチューニングの道もなく、バッチ推論は無効化されています。一方は事前のデータラベリングプロジェクトであり、もう一方は従量制の呼び出しです。どちらが安いかは完全に量次第であり、その分岐点は高く、レンタルした T4 上で毎秒 300 項目をスコアリングする 421M エンコーダーは、一度トレーニングしてしまえば、判断あたりで打ち負かすのは非常に困難です。

ここが、どちらかのモデルで構築されたパイプラインにおいてOrcaRouterがその存在意義を発揮する場面であり、それは生成側に限られます。当社はMicrosoft-Decision-1もLayaもホストしていません。どちらもテキストではなく確率を返すものであり、どちらも当社のカタログには含まれておらず、スコアリング用エンドポイントはチャット補完の対象ではありません。当社が提供するのは、スコアリングされる対象を生成するモデル、すなわち下書きの返信、提案されたツール呼び出し、そしてLayaのファインチューニングされたヘッドが判定する候補回答を生み出すモデルです。それは単一のOpenAI互換キーの背後にある200以上のモデルプロバイダー定価のまま、0%のマークアップで提供であり、いずれかのサービング経路が劣化した際には自動フェイルオーバーが働きます。生成したものすべてをスコアリングするループでは、生成呼び出しこそが倒れうる部分であり、フェイルオーバーがスコアリングキューへの供給を絶やさないようにします。

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

どちらを選ぶべきですか

を選びましょうLaya。判断が多くの言語で届く場合、トークン単位の料金が重要になるほど処理量が多い場合、ラベルと微調整に使える1週間がある場合、あるいは自社の境界内のハードウェアでスコアリングを実行する必要がある場合です。512〜1,024トークンのウィンドウと、ベースチェックポイントを特化させるまではほぼ偶然の確率になるという事実を受け入れれば、出発点であることを正直に示す意思決定モデルが得られます。

を選びましょうMicrosoft-Decision-1。入力がチケットではなく長い文書である場合、デプロイの関門がダウンロードではなく Azure 認証、統合請求、Responsible AI パッケージである場合、25 言語でトラフィックをカバーできる場合、あるいはモデルをそもそも自社で所有したくない場合です。その最初のキャリブレーション曲線は自分で引くことになることを受け入れ、そのためにラベル付きサンプルで午後を1つ確保してください。なぜなら Laya と違い、こちらはあなたが議論できる ECE 数値を渡してはくれないからです。