
Microsoft-Decision-1 対 Liquid AI d1-omni-600M:聴くスコアラー 対 読むだけのスコアラー
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり · 55 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
保険の受付でクレームを振り分けていると、ファイルは3つの形で届く。PDF、へこんだドアの写真、そして90秒の電話通話だ。Liquid AI d1-omni-600Mは文書を読み、写真を見て、通話を聞き、あらかじめ書いておいた一連の質問——これは補償対象か、どのカテゴリか、深刻度は2から10の尺度でどれくらいか——に、1回のパスで答えられる。テキストは一切生成されず、解析すべきものも何もない。Microsoft-Decision-1は文書を読むことができる。Microsoft Foundry での一般提供開始は2026年10月8日で、Qwen3.5-9B に事後学習を施したホスト型のテキスト専用スコアラーであり、ウィンドウは32,768トークン。入力として扱える範囲はそこで終わる。画像も音声も動画もない。どちらも、指定した選択肢に対する較正済みの確率を返し、どちらも出力トークンを一切生成せず、どちらも較正の数値を公表していない。
その最後の共通する一文こそが、この比較の居心地の悪い部分だ。両者は今月出荷される中で最も広いセンサーと最も狭いセンサーの意思決定モデルであり、両者の間にあるアーキテクチャ上の隔たりにもかかわらず、証拠という点ではまったく同じ位置に着地している。すなわち、実重みまたは実エンドポイント、文書化された契約、そして確率が信頼できるかどうかを問われたときにベンダー外部の誰も指し示せる数値がない、ということだ。
2つの祖先系統であり、2つのサイズではない
587Mという数字を見ると、Liquid AI d1-omni-600Mを、このブログがこれまで取り上げてきたモデルの縮小版として読んでしまいたくなる。そうではない。このモデルはLFM2.5-Encoder-350Mから訓練されている。双方向エンコーダーで、381Mの共有トランクと決定ヘッド、LFM2.5-VL-450M系から取られた94Mの視覚エンコーダー、そして音声用の17層FastConformerを備える。Microsoft-Decision-1はまったく別の系統だ。Qwen3.5-9Bデコーダーで、Microsoftによって事後訓練され、Foundryでホストされ、重みは配布されておらず、ファインチューニングの手段も提供されていない。
双方向エンコーダーかデコーダーかということは、それぞれがどう振る舞うかを決めるアーキテクチャ上の事実であり、パラメータ数が本質から目をそらさせるものである理由でもある。双方向エンコーダーは状態全体を一度に読み込む。これは固定された入力に対する判断に適した形である。一方、事後学習されたデコーダーは生成の経路を放棄するが、トークナイザー、ウィンドウ、そしてファウンドリでの展開に伴うエンタープライズ向けのパッケージングは保持する。どちらかがどちらかを拡大したものではなく、ベンチマークの表をどう読もうと、互いに置き換えられるものではない。
入力リストが実際にもたらすもの
ここが、d1-omni-600M がこのカテゴリーの他のすべてとは異なる点であり、ある主張を注意深く読む必要がある点です。
• 音声 — Liquid AI d1-omni-600M はテキストに加えて最大30秒の音声を受け付け、それに対する判定を出力します。これはテキストのみのスコアラーにはどのような精度でもなし得ません。Microsoft-Decision-1 の非テキストモダリティは存在しません。
• 相互排他 — d1-omni-600M は、ValueError画像と音声が同じリクエストで届いた場合に発生させます。このカテゴリで最も広いセンサー面であっても、依然として非テキストモダリティは一度に1つだけであり、これは当該クレームデスクにとって現実的な制約となります。
• トリミング — そのカードには、テキスト・画像・音声を合わせて16,384ポジションと記載されており、画像がある場合、状態と質問のテキストは896トークンにトリミングされて訓練と一致する、と付け加えられている。写真を添付する文書はどれも、そのトリミングと競合する。Microsoft-Decision-1の32,768トークンはすべてテキストで、トリミングされない。
• フォーマット — d1-omni-600M には 3 つの質問タイプがあります: noul は 0 から 1 の間の P(yes) を返す二値判定用、choice は自分で名前を付けた集合から 1 つのラベルを、信頼度と選択肢ごとの確率付きで選ぶ用、そして score は 2 から 10 段階の順序尺度上の位置をその分布付きで示す用です。複数の質問が 1 つの状態から派生し、1 回のパスで読み取られ、使用量カウンターは報告します: output_tokens: 0。Microsoft は yes/no、多肢選択、評価、分類、ルーブリックの形式に加え、証拠が不十分な場合に「cannot tell」などの明示的にサポートされた棄権オプションを文書化しています — Microsoft のページにある設計上の詳細の中で、ここに直接対応するものがない唯一の点です。
• ランタイム — d1-omni-600M はカスタムコードを同梱しており、trust_remote_code=Trueが必要で、そのモデルカードでは GPU 上で float16 を推奨する一方、bfloat16 により一部の行で最上位の回答が変わったと警告している。これはベンダーが文書化したサービング時の感度であり、欠陥ではない。Microsoft-Decision-1 はマネージドエンドポイントであり、デプロイ形態が唯一のランタイム変数となる。また、バッチ推論が無効化されている点は特筆に値する。つまり、大量のスコアリング実行を償却できるオフラインチャネルが存在しないのだ。

双方向におけるエビデンスギャップ
Liquid AIは2026年10月7日、d1-omni-600Mを含むオープンなd1ファミリーを、リリース記事とドキュメント一式とともに公開した。公開されていないのは、マルチモーダルという主張を具体化する数値だ。その看板能力——94Mと112Mのエンコーダを正当化する視覚・音声の判断品質——に特化した精度ベンチマークは存在せず、視覚部門は公開された評価資料から伏せられている。レイテンシの数値も公表されていないため、モデルのスループットは自分のハードウェア上で確かめることになる。
マイクロソフトの立場は構造的に同一であり、さらに一歩先を行っている。その「ベンチマーク」タブには指標が列挙されている——精度、キャリブレーション誤差、安全性の再現率、偽陽性率、公平性の一貫性——そして、評価は公開およびコミュニティの意思決定ベンチマークに加え、トレーニングでは使用されていないホールドアウトの社内テストセットで実施されたこと、選択肢の順序を変えたこと、対応のある統計検定を適用したことを述べ、モデルは「主要な意思決定モデルと同等の性能を発揮し、同じ方法論で評価された他のオープンな意思決定モデルを上回る」と主張している。結果は一切掲載していない。サポート対象として25言語が挙げられており、日本語、韓国語、アラビア語、ベトナム語、タイ語、トルコ語、ヒンディー語、ベンガル語、スワヒリ語、ヘブライ語、ペルシア語、ウクライナ語が含まれる。ただし、カバレッジ、品質、キャリブレーションは「言語によって異なる場合がある」こと、非英語、とりわけ低リソース言語は弱点であるという率直な警告も付されている。料金もモデルページには記載されておらず、マイクロソフトの料金ページにリンクしている。
つまり、この両者の比較は、証拠対証拠の比較ではない。それは、二種類の欠けている数値のどちらを選ぶかという問題だ。Liquid AI はセンサー面を出荷し、その面の精度を公には測定しないままにしてきた。Microsoft は調達経路——Azure 認証、ガバナンス、Responsible AI アセスメント、文書化された方法論——を出荷し、確率製品のキャリブレーションを定量化しないままにしてきた。

二人のどちらも答えない校正の問い
決定モデルにとって、確率が成果物である。下流はすべてしきい値である:0.7はエスカレーションし、0.95は自動承認し、その線引きを誤るコストは、トークンではなく、誤った自動意思決定によって支払われる。このカテゴリでは、数値を公開しているファミリーが少なくとも1つある — InternLMのIntern-Decisionチェックポイントは、モデルカードにBrierと期待キャリブレーション誤差の数値を掲載している — そして本記事のどちらのモデルもそうしていない。この非対称性こそ、アーキテクチャだけで決めるのではなく、分野を広く保つ実用的な理由である。
良いニュースは、このテストが安価で、ベンダーの協力を必要としないことだ。実際のトラフィックに似たラベル付きケースを200件ほど集め、アプリケーションが実際に送信する質問スキーマを書き、両方のモデルをそれらに対して実行し、出力の期待キャリブレーション誤差を計算する。そうすれば、2つのベンダー以外の誰も現時点では知らない2つのことがわかる。Microsoft-Decision-1の確率があなたの分布上でその精度をどれだけうまく追跡しているか、そしてd1-omni-600Mの音声と画像のパスが、それらが搭載するエンコーダーに見合う価値があるかどうかだ。Microsoft自身の文書化されたガイダンスも同じ方向を指している — 代表的なデータで検証し、誤りのコストからしきい値を設定し、常に棄権オプションを含め、オプションの順序をランダム化し、重大な決定には人間をループに入れておく。
それぞれがどこに属するか、そして OrcaRouter がどこに属するか
Microsoft-Decision-1 は、判断材料がテキストで、障壁が調達にあるあらゆる場面に適しています。つまり、長い文書、検索された一節、提案されたツール呼び出し、ルーブリックに照らして採点される生成回答などで、Azure 認証、統合請求、ベンダー評価が、何かが本番環境に到達する前に必要とされる場合です。それはより限定的な手段であり、承認を得るのがより容易なものです。
Liquid AI d1-omni-600M は、判断材料がテキストではないあらゆる場面——フォームに添付された写真、短い通話録音、スクリーンショット——に適しており、また、自分で管理できる境界内で実行・微調整できる lfm1.0 の重みが必要なあらゆる場面にも適しています。それはより広範なツールであり、検証がより難しいものでもあります。なぜなら、マルチモーダルに関する主張は、まさに公表されたベンチマークが背後にない部分だからです。

どちらも当社のカタログにはなく、ここに記した内容はどちらについても提供可否を述べたものではありません。テキストではなく確率を返すモデルは、チャット補完をルーティングする先になるものではなく、採点席に就かないことこそがこの仕組みの設計そのものです。OrcaRouterが担っているのは、同じループの生成側です。1つのOpenAI互換キーの背後にある200を超えるモデルが、あなたのスコアラーが採点の基準とするルーブリックを書き、素材が状態になる前にそれを文字起こしまたは要約し、実行される前にあなたのスコアラーが承認するツール呼び出しを発行します。プロバイダーの定価は0%のマークアップでそのまま反映されるため、生成側でのベンダーの値下げは当社側でも当日から有効になります。単一のプロバイダーが劣化したときも、自動フェイルオーバーがその側を生かし続けます — 取得したすべてのドキュメントを採点するパイプラインなら、それに即座に気づくところです — そして、1つではなく複数の書き手を評価したい場合は、ルーティングDSLがそれらを1つの呼び出しにまとめ、モデルフュージョンがそれらの一致度を、あなたのスコアラーが他のフィールドと同じように読み取れるフィールドとして報告します。
結論
Microsoft-Decision-1 は 2026年10月8日に Microsoft Foundry で一般提供を開始した。テキスト専用で、32,768トークン、ポストトレーニング済みの Qwen3.5-9B を基盤に構築され、重みは公開されずにホストされ、モデルページに価格はなく、レイテンシの数値もなく、ベンチマークセクションは結果を掲載することなく手法を説明している。Liquid AI d1-omni-600M は 2026年10月7日、587M の双方向エンコーダ型意思決定モデルとしてアップロードされた。テキスト、画像、または30秒の音声を読み取る——非テキストモダリティは一度に1つで、画像が存在する場合にはテキストが896トークンに切り詰められる——lfm1.0 ライセンスの下であり、その目玉となる能力についての精度ベンチマークはなく、ビジョン分割もなく、公開されたレイテンシもない。スコアではなく、モダリティと制御性で選ぶこと。スコアは存在しないからだ。扱う素材が写真または電話通話なら、これらの中で答えられるのは一方だけであり、調達審査が付いた40ページの文書なら、デプロイできるのはもう一方だけだ。
OrcaRouterが担うのは、同じループの生成側です:200を超えるモデルが、1つのOpenAI互換キーの背後にあり、あなたのスコアラーが採点の基準とするルーブリックを書き、素材が状態になる前にそれを文字起こしまたは要約し、あなたのスコアラーが実行前に承認するツール呼び出しを出力します。
