
Decision 3.0がHugging Faceに登場:Xでのみ発表された6つのオープンなマルチモーダル意思決定モデル
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり · 71 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
Decision 3.0は今すぐダウンロードできる形で存在しており、それを書き留めた人はほとんどいない。6つのチェックポイント — d3、d3-flash、d3-mini、d3-nano、d3-lite、d3-edge — がHugging Faceのvllm-sr組織に2026年10月10日に登場した。新しいものから順に、09:38 UTCに始まり、d3-edgeで23:49 UTCに終わった。これらはApache-2.0で、Qwen3.5とQwen3.8のバックボーン上に構築されており、選択式・はい/いいえ・スコア形式の質問に対して、トークンを生成する代わりに選択肢ごとの確率で答える。そして6つのうち5つは現在、画像と動画を読み取る。各モデルカードは自らを「Decision 3.0の27Bマルチモーダル基盤意思決定モデル、vLLM Semantic Routerの意思決定モデル」と説明しており、これはvLLMプロジェクトのオープンな意思決定レイヤーである。
欠けているのは告知そのものだ。vLLMプロジェクトのXアカウントは10月11日、vLLM-SRチームのリリースを祝し、メンテナー自身の紹介スレッドを引用した——公的な記録はそれだけである。プロジェクトのブログ一覧は依然として10月10日のルーティング決定モデルに関する投稿で終わっており、今回のモデルについての投稿はない。vllm-project/semantic-routerのGitHubリリースページも、依然として9月27日のv0.4.0が最新である。重みは出荷されたが、ローンチの告知は出ていない。
その区別は、以下すべてをどう読むかに影響する。この記事のすべての性能数値は、vLLM-SR 自身のモデルカードに由来し、彼ら自身のハーネスで、彼ら自身のハードウェア上で測定されたものである。ここにあるものはどれも、部外者によって再現されていない。また、彼らが公開しているボードは、彼ら自身が維持管理しているものだ。これは、実在する成果物と、まだ監査されていない主張についての、初期段階の正直な読みである。
Hugging Face には実際のところ何があるのですか?
6つのリポジトリはシンプルで、完全で、互いに一貫しています。それぞれが safetensors の重み、チャットテンプレート、decision_config.json(ベースモデルのリビジョンを固定する)、カスタムモデリングコード(modeling_d3.py、d3_engine.py、d3_server.py)、独自の readout.safetensors の読み出しヘッド、そして MODEL_MANIFEST.json(ファイルごとの SHA-256 付き)を保持しています。7番目のリポジトリであるコレクションページには、6つすべてが一覧表示されています。
サイズの順に並べたファミリー:
• d3 — 0.46Bのビジョンエンコーダを含む26.09Bパラメータ、Qwen/Qwen3.8-27Bをベースに構築。10月10日 09:38 UTCにアップロード。
• d3-flash — 0.46Bのビジョンエンコーダを含む8.39B、Qwen/Qwen3.5-9Bをベースに構築。
• d3-mini — 0.33Bのビジョンエンコーダを含む4.54B、Qwen/Qwen3.5-4Bをベースに構築。
• d3-nano — 0.33Bのビジョンエンコーダを含む2.21B、Qwen/Qwen3.5-2Bをベースに構築。
• d3-lite — 0.10Bのビジョンエンコーダを含む0.85B、Qwen/Qwen3.5-0.8Bを基盤として構築。
• d3-edge — 0.10Bのビジョンエンコーダを含む0.59Bで、同様にQwen/Qwen3.5-0.8B上に構築されています。最後にアップロード、23:49 UTC。
6つすべてが同じリクエスト契約を持っています:状態(テキスト、または任意で画像や動画を伴うもの、名前付き質問の辞書、および応答としての型付き確率分布。質問タイプは Choice、Noul(はい/いいえ)、Score の3つがあり、モデルは入力に対して質問ごとに1回のフォワードパスを実行することで、1回の呼び出しですべての質問に回答し、デコーディングは一切行いません。

数字、そしてそれが誰のものか
vLLM-SRは、Jev Decision Index 0.3.1と呼ぶリーダーボードを公開し、その首位にd3を置いている。主要な行はすべてベンダー報告:
• d3 — 指標 64.7、公開スイート 65.5、同スキルテスト 62.8、新規ドメインタスク 56.6。
• Perplexity Decider v1.1 (27B) — 62.8、62.3、61.1、55.6。
• Fastino GLiDE no-thinking(28B) — 60.2、59.1、59.5、52.9。
• Jev — 60.1、58.0、58.0、55.0。
• Torchcast Decision 27B — 59.9、65.1、58.1、50.8。
• Decision 2.0 (27B)、前世代 — 55.9、57.0、55.7、47.9。
d3 のカードにある脚注は、d3 自身の行が内部評価である一方、比較行は 10 月 10 日に読み取られたライブなボードデータであると明確に述べている。これはなされるべき正しい開示であり、二度読む価値がある。競合の数値はボードから取得され、評価対象の数値はモデルを構築したチームによって生成されたからだ。カードはまた、140,178 件の公開リクエストすべてが回答され、未対応はなかったと主張している。これはカバレッジの主張であり、精度の主張ではない。そして公表するには珍しいものだ。

より小型のチェックポイント群は、足並みを揃えて前進していると自ら報告している。各カードには公開スイートの数値と、Decision 2.0 の同等サイズに対する差分が示されている。d3-flash は57.79で、以前の9Bから11.0上昇。d3-mini は54.90で、10.7上昇。d3-nano は42.22で、12.2上昇。d3-lite は36.93で、16.4上昇。d3-edge は28.82で、12.1上昇。相対的な伸びは、この範囲の下端で最大である。これは、マルチモーダル事前学習のレシピが大規模モデルよりも小規模モデルでより多くの働きをしているなら予想されることだ — そして、小規模モデルを最も徹底的にチューニングした場合に得られるものでもある。外側からは、どちらなのかを見分ける方法はない。
マルチモーダルな部分が本当の変化だ
Decision 2.0のモデルはテキストを読み取ります。Decision 3.0のモデルはテキスト、画像、動画を読み取り、これが世代間の実質的な違いであり、インデックスの移動ではありません。各カードには、画像入力としてPNG、JPEG、WebPが記載されており、パス、URL、PIL画像、またはbase64データURLとして提供され、1リクエストにつき複数、それぞれ最大1.6メガピクセルまでです。また、動画はMP4、WebM、MOV、MKV、またはフレーム配列として、毎秒2フレームで読み取られ、クリップ全体で最大32フレーム、各フレームは最大0.2メガピクセルです。リクエスト内のすべての質問は、それに添付されたすべての画像と動画を参照します。
映像に関する裏付け証拠は、19,140 件の検証設問すべてにおける Perception Test の結果です。d3 は 77.4、d3-flash は 73.3、d3-mini は 70.3、d3-nano は 63.5、d3-lite は 59.3、d3-edge は 46.6 で、3 択問題における文書化された偶然水準 33.3 と対比されています。vLLM-SR はこれを内部評価と位置づけています。d3 にはさらに、総合 71.6 で Perplexity Decider v1.1 の 70.6 と JEV-27B-VL の 69.6 を上回る位置に置くビジョンボードがあり、比較行もまた著者らによって実行されたものではなく、ボードのデータから取られています。
スループットの数値は単一リクエスト、単一GPUでのものであり、そのように明記されている。d3は、1基のAMD Instinct MI325X上で、テキストリクエストに中央値55 ms、画像を含むリクエストに273 ms、10秒の動画を含むリクエストに553 msで応答する。d3-edgeは同じことを6.7 ms、41.9 ms、308.3 msで行う。これらは、1つのワークフロー内で何度も呼び出されるように設計されたモデルにおける質問あたりの中央値であり、これらのモデルが作られているアーキテクチャにとって重要な数値である——20回の逐次的な判断で1回あたり100 ms余分にかかると2秒になる。Microsoftが今月、自社の意思決定モデルについて同じ点を指摘したように。
リポジトリが語らないこと
誰かがこれを前提に計画を立てる前に、指摘しておく価値のある3つのギャップがある。
1つ目は入力バジェットです。decision_config.jsonは最大のモデルセットに対してmax_lengthを null に設定しており、どのカードにも状態、質問、および選択肢の説明を合わせたものに対するトークン上限は記載されていません。Decision 1.0 のカードでは明示的なバジェットが公開されていました — エンコーダ分岐は 1,024 トークン、デコーダ分岐は 16,384 — そしてそれらの数値は実際の計画上の制約です。ここでそれらが欠けているのは顕著であり、フォローアップコミットが追加できる最も有用な一点はそれです。
二つ目はキャリブレーションです。意思決定モデルにとって最も重要な数値は精度ではなく、返された0.9が10回中9回を意味するかどうかです。視覚指標とテキスト指標は、それについて何も示していません。6枚のカードのどれにも、ブライアスコアも、期待キャリブレーション誤差の数値も、温度もありません。InternLMは9月に自社の意思決定モデルについて両方を公開しました。vLLM-SRは、このファミリーのどのメンバーについても公開していません。
第三は独立性だ。Decision 2.0 のモデルは2週間、外部で使われてきた。Decision 3.0 のものは数時間しかない。10月11日のダウンロード数 — d3 が130、d3-lite が83、d3-nano が82 — はアップロードの痕跡であり、採用の痕跡ではない。上記のあらゆる指標値は、リポジトリが付いた仮説として扱え。
今日呼び出せるスタックの中で、これがどこに位置するか
意思決定モデルに関する実用的な問いは、それが既存のパイプラインにそのまま組み込めるかどうかであり、ここではエコシステムのほうがモデルよりも先を行っている。これらのモデルが使う System One リクエスト形式は vLLM-SR 独自のものではない。それは、ホスト型 Jev モデルを呼び出す際に使われるのと同じ、状態と名前付き質問からなる契約であり、だからこそ「Jev」は d3 のモデルカードにおけるインデックスの名前としても、そのリーダーボード上の行としても登場する。
OrcaRouterはファミリーのその側面を担っています。typesafe/jev-1.13は当社のカタログに含まれており、POST /v1/systemoneを通じて提供されています——同じ契約で、入力トークン100万あたり$0.042、completionが存在しないためcompletion課金はありません。最大でおよそ64Kの入力トークン、入力はテキストで出力は構造化JSON、非ストリーミングです。これはまさに、意思決定レイヤーが今日呼び出すタイプのモデルです。当社が主張しない点が2つあります。d3およびDecision 3.0のその他の部分は当社のカタログにはありません。そして、Decision 3.0のローカル推論パスはHugging Faceリポジトリ内のPythonクラスであり、たとえ望んだとしても当社がルーティングできるエンドポイントではありません。ここでルーターが実際にもたらすものは、ループの反対側にあります——意思決定に作用する生成モデル、1つのキーで200以上のモデルにわたってルーティングされ、プロバイダーが不安定になると自動フェイルオーバーする、そのため、ワークフローの前にスコアリングステップを追加しても、2つ目のベンダー関係を追加することにはなりません。
何がこの状況を変えるでしょうか
4つのこと。どれだけのことを教えてくれるかの、おおよその順に並べる。プロジェクトによるブログ投稿で、入力バジェットと意図されたデプロイ形態が示されているもの。これは、これがプッシュではなくリリースであることを裏付けるだろう。任意の1つのチェックポイントにおけるBrierスコアまたはECEの数値。第三者が、インデックスを読むのではなく、公開された重みで公開スイートを実行すること。そしてランタイム — semantic-routerリポジトリでは10月11日に2つのコミットが入り、d3とd3-edgeを、ビデオ入力も含めてそのモデルランタイムに組み込んだ。これは、サービングの話が今まさに作られており、これらのモデルを安く試せるようにするものになることを示唆している。
少なくともそれらの最初のものが登場するまでは、正直に要約すればこうだ。Hugging Face 上には、0.6B から 27B までの、完全で Apache-2.0 の、真にマルチモーダルな意思決定モデルファミリーが存在する。異例なほどしっかりした来歴——ファイルハッシュ、固定されたベースリビジョン、明記されたハードウェアターゲット——で公開されており、一方で、それを使うべきかどうかを判断できる周辺ドキュメントは異例なほど少ない。ダウンロードするのには何のコストもかからない。インデックスを信じるのは待ったほうがいい。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
