「Intern-Decision-2B vs Qwen 3.8」と表示された生成タイトルカード。サブタイトルは「ひとつのバックボーン、まったく異なるふたつの仕事」、バッジは「2.2Bスコアラー、33 ms」と「2.4Tフラッグシップ、1Mコンテキスト」、隅にはOrcaRouterのロゴを合成。
Guides & Insights

Intern-Decision-2B 対 Qwen 3.8:一つのバックボーン、二つのまったく異なる仕事

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

{{2}}internlm/Intern-Decision-2B{{/2}} の設定とinternlm/Intern-Decision-2B{{4}}Qwen/Qwen3.5-2B{{/4}} の設定をQwen/Qwen3.5-2B並べて開いても、ほとんど何も違わない。同じ 24 層、同じ 2,048 の隠れサイズ、同じ 8 クエリヘッド対 2 キーバリューヘッド、同じ 256 のヘッド次元、同じ 262,144 位置の埋め込み上限、同じ 248,320 トークンの語彙、そして 3 つの線形アテンション層につき 1 つのフルアテンション層という同じ繰り返しパターン。Intern-Decision-2B は新しいアーキテクチャではない。テキストを生成する能力を取り除き、その確信度を較正した、あのバックボーンそのものだ。そしてその一つの引き算こそが、Qwen3.8-Max——すなわち「Qwe​n 3.8」というファミリー名が最上位で指す 2.4 兆パラメータのフラッグシップ——との比較を、パラメータの数比べ以上の価値あるものにする。

両者は競合ではなく、この対決は勝負ではない。Intern-Decision-2BはQwen3.5-2Bの2,213,241,664パラメータのファインチューニングであり、2026年9月26日05:36 UTCに、未発表の3つの兄弟モデルとともにHugging Faceへアップロードされた。そしてそれはトークンを一切出力しない。状態と型付きの質問を受け取り、1回の因果的フォワードパスを実行し、固定されたプレースホルダー位置でロジットを読み取り、フィールドごとにキャリブレーションされた分布を返す。Qwen3.8-MaxはAlibabaのホスト型フラッグシップで、トークンあたり約950億パラメータがアクティブなスパースなMixture-of-Expertsモデルであり、100万トークンのマルチモーダルコンテキストウィンドウを持ち、入力トークン100万あたり2.00ドル、出力トークン100万あたり6.00ドルのリスト価格が設定されている。一方はコンポーネントである。もう一方はサービスである。有用な問いは、すでに費用を払っているパイプラインにおいて、両者の間の継ぎ目がどこにあるべきかである。

正確に、減算を

決定チューニングが何を変えたのかは、正確に述べておく価値がある。そうすることで、ベースモデルがすでに持ち合わせていたものが明確になるからだ。

このタスクは、リポジトリ内では自己回帰マスク言語モデリングと命名されている。アシスタント入力には、フィールドごとに1つの<decision>トークンを含む完全なJSONスケルトンが含まれる。正解の回答記号はラベルにのみ現れ、入力には決して現れない。学習では通常の因果的次トークン整合を用いる。ここではマーカーの直前のロジットがそのフィールドの回答を予測し、すべてのフィールドが1回のフォワードパスを共有する。推論時には、ロジットは合法な単一トークン回答記号——A–Z、a–z、0–9——に制限される。これが62択の上限の由来である。その後、ソフトマックスされ、あなたのラベルにマップし戻される。

したがって、ベースモデルの次トークン機構はそのまま無変更である。学習によって組み込まれたのは、文を続けるのではなく、ごく少数の回答位置のいずれかを占めることへの選好、さらに、1,728件の指定されたキャリブレーション事例に対して1,693件をホールドアウトして負の対数尤度でフィッティングされた、チェックポイント固有の温度 2.100509348278 である。カードは、生成が選択肢にないことを明確にしている:APIは「構造化された候補スコアリングを実行する。generate() を呼び出したり、自由形式のテキストをサンプリングしたりしない」。

リポジトリは、チューニングが手を付けなかった点も記録している。すなわち「Qwen3.5の言語バックボーンをファインチューニングしつつ、ビジョンタワーとプロジェクターを凍結する」である。2B上の612,517,440バイトのビジョンシャードは、4Bの決定チェックポイントと同じバイト数であり、これは学習済みコンポーネントではなく継承されたコンポーネントに当てはまる。画像パスは機能している。ただ、決定パスが予算を費やした対象ではなかっただけだ。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

22億パラメータにはできないこと、そして2.4兆パラメータが代わりにすること

すべては一つの軸で分かれる:あなたの答えがすでにリストとして存在するかどうか。

Intern-Decision-2B は閉じた集合に回答する。1~16問、各最大62個の選択肢、最大8枚の画像で、すべて8,192トークンの予算内に収まる必要があり、エンジンは切り詰めるのではなく拒否する。確率として返される。単一の RTX 4090 上で1リクエストあたり平均33.28 ms、P95 は33.55 ms。また、課金対象となる出力が存在しないため、呼び出しごとの課金はない。

Qwen3.8-Maxが書く。100万トークンのコンテキスト、テキスト・画像・動画入力、思考モードによる推論、ネイティブのツール呼び出し、構造化出力、日付が0902のビルドでは最大131,000出力トークン。原理的には、Intern-Decision-2Bが下すのと同じルーティング判断を下すこともできる——選択肢の中から選び、JSONを返すようプロンプトできる。そうすると3つの問題が生じる。判断に費やしたトークンの分を支払うことになる。解析が成功するかどうかわからない文字列が返ってくる。そして、その文字列内の数値は、サンプラーが生成したものであって、0.8でしきい値を設けてそれに基づいて行動できるソフトマックスではない。

どちらの説明も正しく、一方が他方を打ち消すことはない。2.4兆パラメータのフラッグシップが存在するのは、ほとんどの問題が閉集合ではないからだ。22億パラメータのスコアラーが存在するのは、閉集合である部分集合にはより安価な道具がふさわしいからだ。

スコアボード

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• パラメータ — Intern-Decision-2B は BF16 で 2,213,241,664、さらにビジョンタワーとプロジェクターを備え、ディスク上では約 4.46 GB。Qwen3.8-Max は合計約 2.4 兆、トークンあたり約 950 億がアクティブで、ダウンロードされず、提供されます。

• コンテキスト — 8,192トークン(上記で却下); 0902ビルドでは1,000,000トークン、最大出力131,000トークン。

• 出力 — キャリブレーション済み確率と argmax、生成テキストなし;推論トレースを含む生成テキスト。

• 入力モダリティ — テキストと最大8枚の画像、テキスト・画像・動画。

• コスト — 呼び出しごとの課金はなく、GPU は自前で保有できます。入力 100 万トークンあたり $2.00、出力 100 万トークンあたり $6.00、キャッシュ読み取りは $0.25、キャッシュ書き込みは $2.50。

• 公開されたエビデンス — 10,751件のテスト行にわたり平均84.68、Brier 0.437、ECE 0.100を示す7スイートのベンダー表で、InternLM以外の誰にも再現されておらず、いいね1件・ダウンロード0件のチェックポイントに関するもの;145中15位のArtificial Analysis Intelligence Index 45.4と、138中9位のAA Coding index 76.2(いずれも独立に測定)。

• レイテンシ — RTX 4090 1台でのリクエストあたり平均は33.28 msで、バッチ処理を加えるにつれて低下します。カタログの報告では、最初のトークンまでのP50は2.655秒で、負荷とともに増加します。

証拠の行は等価ではなく、あたかも等価であるかのように出力されるべきではない。Alibabaのフラッグシップには、独立したインデックススコアが背後にある。InternLMのチェックポイントには、著者自身が作成した表があり、特にキャリブレーションの数値は、他者のデータによって検証されるまでは、十分に文書化された意図として読むべきだ——ここではなおさらである。なぜなら、この特定のサイズは、InternLMが提供した3つのうち最悪の期待キャリブレーション誤差を記録しており、0.100に対して、その半分のサイズのモデルは0.066、ほぼ2倍のサイズのモデルは0.065だからだ。

シーム、およびその実行方法

理にかなったパイプラインは、この2つのどちらかを選ぶことではなく、分業である。スコアラーが列挙された決定を扱い、フロンティアモデルが、答えがリストではないあらゆるものを扱う。6つのチームのいずれかに振り分け、緊急度を3段階で評価するサポートトリアージに、950億のアクティブパラメータは必要ない。必要なのは確率としきい値だ。最終的に顧客への返信を書くエスカレーションパスには必要だ。

その分割には運用上の形があります。Intern-Decision-2B は OrcaRouter 上にはありません — 当社のモデルページは 404 を返し、探し得る限りどこにもホスト型ルートは存在しません — つまりそれはお客様自身のハードウェア上で動作するため、お客様が運用し監視するコンポーネントとなります。Qwen3.8-Max はルートです:200 以上のモデルにまたがる 1 つのキー、プロバイダーの定価がマークアップなしでそのまま適用されるため、フラッグシップのベンダー価格の変更はそれが届いたその日に請求書へ反映されます。パイプラインのうちホスト側の区間をその単一の窓口の背後に置くことが、より安価な側を安く保つ秘訣です。スコアラーが呼び出し量を抑え、フロンティアモデルは本当に必要とされるケースにのみ到達します。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

そのスロットに入れるべきスコアラーをまだ検討しているなら — これには独立した評価がなく、そのキャリブレーションは同じファミリーの中で最も弱い — 自動フェイルオーバーをプロバイダー間で行うことが、すでに機能する代替手段が背後にあるパスでそれを試す方法であり、その代替手段を完全に置き換えるのではありません。

正直な評価

あなたの問題が、列挙できる一連の答えの中からの決定であり、状態が八千トークンに収まるなら、Intern-Decision-2B がそれを三十三ミリ秒で、呼び出しごとにタダでやってのける。そして、どれだけ多くのパラメータを借りようと、その軸でそれに勝てるフロンティアモデルは存在しない。それが報告する信頼度に依存する前に、自分自身のキャリブレーションをそれに適用しておけ。

あなたの問題がそれ以外の何かであるなら — 推論、長いコンテキスト、ツールの使用、動画、100万トークンの文書、あるいは単にまだ書かれていない答え — Qwen3.8-Max は単により優れているだけではない。2つのうち、その仕事をそもそも成し遂げられる唯一のものである。

そして、その2つのうちどちらを持っているのかまだ言えないなら、答えはおそらく、同じパイプラインの中で両方を持っているということだ。それが、パラメータ数がずっと静かに告げていたアーキテクチャなのだ。