Decision 3.0 と Intern-Decision-4B の比較用に生成されたタイトルカード。サブタイトルは「同じ Qwen3.5-4B ベース、2 つの異なる答え」、チップには「26 Sept vs 10 Oct」「動画 vs 画像のみ」「Brier 公開 vs 非公開」と表示され、フッターには「Decision 3.0 の数値は vLLM-SR 自身のもの、Intern-Decision-4B の数値は InternLM 自身のもの、いずれも独立に再現されていない」と記載されている。OrcaRouter のロゴは右下隅に合成されている。
Engineering & Research

Decision 3.0 vs Intern-Decision-4B:2つのチームが同じモデルをファインチューニングし、それ以外のすべてで意見が分かれた

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

並べてみるとd3-miniの4BメンバーDecision 3.0をIntern-Decision-4B最初に気づくのは違いではない。どちらも同じベースチェックポイントQwen3.5-4Bのファインチューニング版だ。どちらも45.4億パラメータと表記されている。どちらも状態、名前付きの質問のスキーマ、候補回答の集合を受け取り、トークンを一切生成することなく候補ごとに較正済みの確率を返す。どちらもApache-2.0。どちらも告知なしにリリースされた——InternLMは2026年9月26日、40秒で3つのチェックポイントをアップロードし、vLLM-SRのDecision 3.0ファミリーは2026年10月10日にHugging Faceに登場したが、そのニュースを伝えたのはvLLMプロジェクトのXアカウントだけだった。

それ以降はすべて意見の相違だ。彼らは、モデルから確率をどう読み取るか、動画が入力として見なされるかどうか、リクエストをどれだけ長くできるか、そして——最も先鋭的に——チームが自らの確信度が信頼に足ると示す数値を公表する用意があるかどうかについて、意見が食い違っている。本稿が扱うのはこれら四つの相違点と、それぞれがあなたに何のコストを強いるかであり、どちらのモデルが「より優れているか」ではない。なぜなら両者は同じ尺度で測られておらず、どちらのベンダーも行っていない作業をしない限り、互いに順位づけすることはできないからだ。

まず理解する価値のある偶然

2つのラボが2週間のうちに同じ4Bバックボーンを選んだこと自体は、それほど驚きではない — Qwen3.5-4Bは構造化出力モデルのベースとして妥当であり、両チームがそれを選んだのは、安価に実行できるほど小さく、指示を読み取れるほど強力だからであることは明らかだ。驚くべきは、彼らが同じパラメータ数に有効数字4桁まで一致したことだ。これは、ファインチューニングがアーキテクチャを保持したこと、そして総数を変えるほど大きな別個のビジョンタワーをどちらも追加しなかったことを示している。両者とも、マルチモーダル能力を同じ重みに折り込んでいる。

興味深いのは読み出しです。両モデルは原理的には同じ方法で質問に答えます——候補の回答を生成するのではなく採点する——が、その仕組みはまったく異なります:

• Intern-Decision-4B — すべての選択肢を単一のトークン記号(A~Z、次にa~z、次に0~9)に対応させ、フィールドごとにプレースホルダーを配置したJSONスケルトンをプロンプトにレンダリングし、1回の因果的フォワードパスを実行して、各プレースホルダーの直前の位置でロジットを読み取ります。この仕組みは、正確なソフトマックスと温度のステップを含め、モデルカードに段階的に記載されています。

• d3-mini — 独自アーキテクチャをmodeling_d3.py に搭載し、専用のreadout.safetensors に別個の読み出しヘッドを備え、decision_config.json で noncausal_full_attention と最終トークンプーリングを宣言し、トークンからコードへのマッピングを文章で説明するのではなく設定で定義しています。

どちらのアプローチも明らかに優れているというわけではない。InternLMのルートには、文書化された数値シーケンスを備えた標準のHugging Faceモデルクラス上で動作するという利点がある——その計算過程を検証できる。vLLM-SRのルートには、読み出しが既存のトークン埋め込みの射影ではなく学習済みのヘッドであるという利点があり、より自由に適合できる。その代償は、trust_remote_code=Trueを設定し、何かを行うには彼らのコードを実行しなければならないことだ。

それぞれが公表する制限

ここで本当の好みが形成され始めます。一方のカードのほうが、どこで使えなくなるかについて、もう一方よりはるかに具体的だからです。

• 入力上限 — Intern-Decision-4B: デフォルトで8,192トークン、それを超えるリクエストは切り詰められることなく即座に拒否され、上限はコンストラクタ引数で設定されます。d3-mini: max_length はnullで出荷時の設定に含まれており、カード上のどこにもトークン予算は記載されていません。

• リクエストあたりの質問数 — Intern-Decision-4B: 1~16で、1つの質問における選択肢の最大数は62と明記されています。d3-mini: 明記された上限はなく、カードには、質問はまとめて回答され、それぞれが独自のフォワードパスから生成されることだけが記載されています。

• 画像 — Intern-Decision-4B: 1リクエストにつき最大8枚、指定したリストの順序で並べられ、チェックポイントプロセッサがリサイズとトークン展開を処理します。d3-mini: 1リクエストにつき複数枚を、パス、URL、PIL画像、base64データURLとして指定でき、それぞれ最大1.6メガピクセルで読み込まれ、すべての質問がすべての画像を参照します。

• 動画 — Intern-Decision-4B: なし。d3-mini: 複数の動画を毎秒2フレームで読み取り、クリップ全体に分散して最大32フレーム、1フレームあたり0.2メガピクセルに制限。

入力の上限は、ほとんどの人にとってこれを決める分岐線になる。状態、質問の指示、候補の説明の間で共有される8,192トークンの予算は、これらのモデルが売りにしている文書採点や長文脈ルーティングの作業にとって、紛れもない制約であり、InternLMがそれを発見されるままにせず率直に明言したことは評価に値する。vLLM-SRがそれを明言していないのは正反対で、隠された制限ではなく未知の制限であり、リポジトリをどれだけ読んでも決着はつかない。

キャリブレーションこそが本当の分かれ目

すべての意思決定モデルは同じ約束をする。それが返す数値は確率であり、それに対して設定されるしきい値には意味がある、と。ほとんどどのモデルもそれを証明しない。ここが2つのリリースが最も大きく分かれる点であり、その相違は、リリース日から推測するであろう方向とは逆の方向に進む。

Intern-Decision-4Bは、自身のカード上で、7つのベンチマーク平均にわたるブライアスコア0.347と期待キャリブレーション誤差0.065、1,728件の指定キャリブレーションケースと1,693件の別個の検証ケースに対してNLL最小化によって導出されたフィット温度1.99241824、その温度の選択にテストスイートのラベルが使用されなかったという明示的な声明、および、温度スケーリング前は0.628ブライア / 0.213 ECE、後は0.550 / 0.089へとキャリブレーションが変化することを示す96件の診断結果を公表している。また、デフォルトについても述べており、キャリブレーションはチェックポイントごとであるため、このモジュールで別のサイズを使用しても一致しないと述べている。

Decision 3.0は精度指標とカバレッジの主張——140,178件の公開リクエストすべてに回答済みで、裏付けのないものは一つもない——を公表しているが、キャリブレーションの数値は一切示していない。Brierスコアも、ECEも、明示された温度も、6つのチェックポイントのいずれにもない。温度d3が出荷するdecision_config.jsonでは1.0であり、これは恒等変換であり、適合値であるかどうかは分からない。ファイルには明記されていない。

2つのインデックスの見出しを並べて読むと、非対称性はさらに悪化する。d3-mini のカードは Jev Decision Index 0.3 の公開スイートスコア 54.90 を報告しており、公開済みの重みで公式キットを用いて測定されたものと説明されている。一方、同じボード上の比較行はライブボードのデータと説明されている。Intern-Decision-4B は、独自の7つのベンチマークで平均 90.02 を報告している。この2つの数値は同じ尺度上になく、同じタスクを使ってもおらず、それらを比較として一文にまとめるのは不誠実だろう。比較できるのは開示のほうだ。一方のカードは自身の信頼度がどれだけ誤っているかを示しているが、もう一方は知らないか、言おうとしない。

A generated two-column scoreboard headed 'Decision 3.0 d3-mini vs Intern-Decision-4B - the scoreboard'. The left column for d3-mini reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling not stated on the card; video input yes, up to 32 frames at 2 fps; calibration figures none published; reported score Jev Decision Index 0.3 public suite 54.90; latency median 17.5 ms text and 96.2 ms image. The right column for Intern-Decision-4B reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling 8,192 tokens, rejected not truncated; video input none, images only up to eight; calibration Brier 0.347, ECE 0.065 and temperature 1.99241824; reported score 90.02 seven-benchmark average; latency mean 44.16 ms and median 44.03 ms on one RTX 4090. A footer reads 'd3-mini figures are vLLM-SR's own; Intern-Decision-4B figures are InternLM's own; neither is independently reproduced.'

レイテンシ、そして2組のミリ秒がどちらも比較できない理由

両方のカードはリクエストごとのレイテンシを公開しているが、それを額面どおりに受け取るのは、精度の数値が比較できないのと同じ理由で誤りである。

• Intern-Decision-4B — 平均44.16 ms、中央値44.03 ms、p95 44.60 ms。単一のRTX 4090上でローカルのHugging Faceパスを介して計測されたもので、ワークロードとハードウェアに依存するとされている。

• d3-mini — テキストでは中央値17.5 ms、画像付きでは96.2 ms、10秒の動画では371.5 ms、AMD Instinct MI325X 1基上で、一度に1リクエスト。

この2つを比較不可能にしている要因は2つある。1つ目はハードウェアとソフトウェアの経路、すなわち 4090 対 MI325X、標準の Hugging Face フォワードパス 対 flash-linear-attentionを通じて利用できるマスク層カーネルを備えた独自のアテンション実装である。2つ目はワークロードである。InternLM の数値は、明示されていない混在条件下でのクエリあたりのエンドツーエンドと説明されており、vLLM-SR の数値は入力モダリティ別に分割されているため、テキストのみの比較だけが唯一の同条件の比較であり、それすら2つの GPU ベンダーをまたいでいる。

両方のカードから読み取るべき数字はランキングではなく、形です。意思決定モデルは1つのワークフロー内で繰り返し呼び出されます——サポート記録には宛先、返金チェック、エスカレーション判断、優先度スコアという4つの問いが必要になることがあり、128件の記録のバッチはそれを512回の意思決定に変えます。その規模では、下流の生成モデルの前では17 msも44 msもどちらも霞んでしまいます。注視すべきはモダリティ別の数値です。d3-mini自身の数値では、画像や動画はテキスト1件の5~20倍のコストがかかりますし、もしあなたの意思決定が、ほとんどの意思決定モデル導入にはないコストプロファイルをインポートしたモデル上で行われているなら、なおさらです。

実際にどれを選ぶべきか

下すべき判断が動画に依存するなら、勝負は明白で、分析の必要もない。Decision 3.0 は動画を読み取れるが、Intern-Decision-4B は読み取れない。画面収録、カメラ映像、フレーム列が関わるあらゆることにとって、これが答えのすべてであり、この能力差だけで、より新しいファミリーの存在がそれ自体として正当化される。

入力がテキストとたまに画像であれば、選択を左右するのは2つの点であり、そのどちらもリーダーボードではありません。

しきい値について推論する必要があるときは、Intern-Decision-4B を選びましょう。2つあるうち、0.9が10回中9回を意味するのかどうかを教えてくれるのはこれだけで、temperature の設定値を明示し、その temperature がどのケースでフィッティングされたかを示し、推論を、標準のモデルクラスに対して再実装できる短い番号付き手順として文書化しています。自動化されたアクションの手前に置かれるスコアラーにとって、それこそが重要な性質であり、精度のポイントよりも希少です。

範囲やモダリティが必要なときは、Decision 3.0 を選んでください。0.59B から 26.09B までの6つのチェックポイントは、同じリクエスト形式を 6.7 ms のエッジモデルと 27B のモデルの両方で処理できることを意味し、ファミリーは1つのインターフェースを共有しているため、ティア間の移動は書き換えではなく構成変更で済みます。落とし穴は、明言されていない入力バジェットと監査されていないキャリブレーションの主張を信頼している点にあり、ファミリー内で最大のモデルは、ベンダーが自社のハーネスでそのインデックス番号を測定したモデルです。

現時点で、どちらも安全なデフォルトではない。d3 の最もダウンロードされているチェックポイントは Hugging Face に約1日前から公開されており、Intern-Decision-4B は2週間前から公開されていて、およそ3,200回のダウンロードと83件の「いいね」を集めている。これは注目ではあるが、本番トラフィックではない。どちらもテストするには十分安価で、どちらにも第三者による評価はない。お金を使うものの前にスコアラーを置くのであれば、やるべきことは両方を自分のラベル付きケースで実行し、インデックスの行ではなくキャリブレーション曲線を比較することだ。

A screenshot of the Intern-Decision-4B model card on Hugging Face. The header shows 83 likes, 1.34k followers and tags for Image-Text-to-Text, Transformers, Safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational under an Apache-2.0 licence, with the model size listed as 5B parameters in F32 or BF16 and the base model pinned to Qwen/Qwen3.5-4B. A section titled 'How inference works' lists five numbered steps: map each question's options to single-token symbols A to Z then a to z then 0 to 9; render the state, decision schema and a JSON skeleton with one decision placeholder per field; run one causal forward pass and read logits immediately before each placeholder; take a softmax over the allowed candidate-symbol logits and apply the checkpoint's probability calibration; and map symbols back to the original option values. It states that the API never calls generate() and samples no free-form text. A benchmark results table below carries Jevbench Easy, Jevbench Original, Jevbench Hard, Typed Decision, ToolACE, AG News and WildJailBreak columns for the Jev, Laya, Semif and Kev rows. The sidebar reports 3,179 downloads last month.

ルーターが役立つ場面、正直なところ

OrcaRouter はこれらのモデルのどちらも取り扱っていません。Decision 3.0 のチェックポイントは、公開された HTTP エンドポイントを持たない Hugging Face リポジトリ内のローカル Python 推論経路であり、Intern-Decision-4B は、DecisionEngine クラスを自分でインスタンス化して使う形で提供されます。どちらも現時点で私たちがルーティングできるものではなく、本記事のいかなる部分も可用性の主張として読まれるべきではありません。

私たちが実際に提供しているのは、同じファミリーのホスト版です。typesafe/jev-1.13は当社のカタログに含まれており、POST /v1/systemone経由で提供されています — 上記の2つのオープンモデルが実装しているのと同じ、状態と名前付き質問の契約です — 入力トークン100万あたり$0.042で、補完の課金はありません。そもそも補完を生成することがないからです。これはほか200以上のモデルと並んでいます。そしてこれが、この2つを比較する人にとっての実用的なポイントです。スコアラーはループの中では安価な部分であり、その判断に基づいて行動するモデルのほうが高価な部分なのです。両方を1つのキーでルーティングし、プロバイダーが不安定なときには自動フェイルオーバーを行い、プロバイダーの定価を0%のマークアップでそのまま渡すということは、意思決定モデルを評価するために、2つ目の契約を結んだり、バックエンドを切り替えるときに呼び出し箇所を書き換えたりする必要はない、ということです。もしあなたが評価の途中であれば — 今日、この2つのモデルはまさにその段階にあります — どちらかにコミットする前に整えておく価値があるのは、その部分です。

A screenshot of the OrcaRouter model page for Jev 1.13. The header reads 'Jev 1.13', by TypeSafe, dated 2026-09-24, tagged NEW, with a specification panel reading 65K tokens of context, text input, text output and a p50 time-to-first-token of 176 ms, and the endpoint listed as /v1/systemone. The description says it is TypeSafe's structured decision and evaluation model, given a state and a set of named questions (noul / choice / score), returning a structured answer for each, served via POST /v1/systemone, non-streaming, up to about 64K input tokens, text in and structured JSON out. The metric strip reads input /bin/bash.04 per 1M tokens, no output price, p50 TTFT 176 ms, p95 TTFT 423 ms and 59.3M tokens of traffic over 7 days. Buttons read 'Get the Jev 1.13 API' and 'Try in playground', and a code sample shows a POST to https://api.orcarouter.ai/v1/systemone with the model typesafe/jev-1.13 and a state plus noul, choice and score questions.

未解決の問題

2つのモデルカードは、モデル作者が読み手に対して何を負うかについて見解を異にしており、その不一致はモデルそのものよりも興味深い。InternLMは温度と、それを適合させたケースを公開し、続いてキャリブレーションがどれほど改善したかを示す診断結果を公開した。vLLM-SRはファイルハッシュ、固定されたベースリビジョン、明示されたハードウェアターゲット、カバレッジの主張——本物の来歴の仕事——を公開したが、キャリブレーションの数値は一切なかった。

どのリリースが成熟するかの試金石は、どれがボードで勝つかではない。次に来るDecisionチェックポイントがBrierスコアを伴って出荷されるかどうか、そしてInternLMの次のアップロードが動画に到達するかどうかだ。どちらも外部から見えて、どちらも確認するのは安く、そしてどちらもまだ起きていない。