ヒーロータイトルカードは「Intern-Decision-0.8B vs Gemma 4 12B」、サブタイトルは「一方が答えを書き、もう一方がそれを採点する」、バッジは「0.8Bスコアリングヘッド、出力トークンなし」と「11.95Bマルチモーダル汎用モデル」、コーナーにはOrcaRouterのロゴを合成。
Guides & Insights

Intern-Decision-0.8B 対 Gemma 4 12B:マルチモーダル汎用モデルに対するスコアリングヘッド

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Intern-Decision-0.8Bとは何か——そして何ではないか——を知る最も安上がりな方法は、それをGemma 4 12Bの隣に置いてみて、その比較がほぼ完全に、各モデルがその出力層で何をするかという話であることに気づくことだ。Gemma 4 12Bは、2026年6月3日にApache 2.0の下で公開されたDeepMindの119億5000万パラメータのエンコーダ不要マルチモーダルモデルであり、生成型汎用モデルだ。テキスト、画像、音声、動画を渡せば、答えを書き出す。Intern-Decision-0.8Bは、2026年9月26日にInternLMによって何の告知もなくひっそりとHugging Faceにアップロードされた、はるかに小さいQwen3.5-0.8Bのファインチューニング版であり、テキストを一切生成しない。状態、名前付き質問のスキーマ、最大8枚の画像を受け取り、単一の順伝播の後、各質問に対する較正済み確率分布を返す。一方は書き、もう一方は採点する。以下のすべては、そこから導かれる。

そのため、これを対決として位置づけるのは妙な組み合わせであり、スペックの行の前に率直に言っておく価値がある。この二つは代替品ではなく、どちらかを選ぼうとしている人はすでに問題の立て方を誤っている。Gemma 4 12Bは「応答はどうあるべきか」という問いに答える。Intern-Decision-0.8Bは「この16個の選択肢のうちどれなのか、そしてどれほどの確信があるのか」という問いに答える——しかもデコーダループなしで答える。ここにレイテンシとコストの差の原因がある。したがって有益な比較は、どちらが勝つかではなく、それぞれを一つのワークフローにどう組み込むかについてである。

最も大きな違いは、請求書の出力側です。

Gemma 4 12B は他のあらゆる生成モデルと同じように課金される。入力トークンと出力トークンの両方が対象だ。構造化 JSON を要求すれば、それらのトークンは 1 つ残らず生成され、サンプリングされ、課金される。スキーマが長く、ネストが深くなるほど、その数は増えていく。これはモデルへの批判ではない——デコーダとはそういうものだからだ——が、意思決定ヘッドが排除するために存在する費目である。Intern-Decision-0.8B には出力トークンが存在しない。そのカードはその理由を明示している。推論パスが決して呼び出さないのはgenerate()/ ではなく、各<decision>/ プレースホルダ(あらかじめレンダリングされたスケルトン内にある)の直前の位置でロジットを読み取り、そのフィールドで許可されている候補記号のみに対してソフトマックスを取ることである。使用量カウンターは、output_tokens/ と呼ばれ、数えるのはテキストではなく、スコア付けされたフィールドである。

その結果は規模が大きくなるにつれて複合的に膨らんでいく。Gemma 4 12B で1万件のレコードにラベルを付けるパイプラインは、1万件の JSON ドキュメントの分を支払う。同じパイプラインを Intern-Decision-0.8B で動かすなら、支払うのはプロンプトの分だけで、それ以外は何もかからない。絶対額が大きいかどうかは、あなたの処理量とスキーマに完全に依存し、トークンあたりの予算がある人なら誰でも10分で表計算ソフトを使って計算できる。しかし、方向性は疑いようがなく、まさにこれが、小規模な意思決定モデルというカテゴリがそもそも登場した理由である。

レイテンシ、そしてパラメータギャップがなぜ誤解を招くのか

• スループットモデル — Intern-Decision-0.8B: 順伝播1回、デコードループなし。Gemma 4 12B: 自己回帰生成、一度に1トークンずつ。

• 実測レイテンシ — Intern-Decision-0.8B:単一の RTX 4090 上で、ローカルの Hugging Face 経路を介した場合、平均 33.98 ms/p95 37.50 ms(InternLM 自身の測定による)。Gemma 4 12B:比較可能な単一パスの数値は存在しない。測定すべき単一パスが存在しないためである。

• フットプリント — Intern-Decision-0.8B:リポジトリの保存容量は約1.73 GBで、1.50 GBの言語シャード、176 MBのビジョンシャード、25 MBのプロジェクターにまたがる852,985,920個のパラメータ。Gemma 4 12B:Googleの発表資料では、16 GBのVRAMまたはユニファイドメモリとされています。

• 出力の決定性 — Intern-Decision-0.8B: 候補ロジットに対するargmaxなので、同じ入力なら毎回同じラベルが得られます。Gemma 4 12B: 温度をゼロに固定しない限りサンプリングとなり、ゼロに固定したとしてもラベルはテキストとして返るため、解析が必要です。

これら2つのモデル間の14倍というパラメータの差は、意思決定タスクにおける14倍の実行時間の差には決してつながりません。なぜなら、行われる作業の性質が異なるからです。Intern-Decision-0.8Bは、その1回のパスをプロンプト——状態、スキーマ、選択肢の説明——の読み込みに費やし、そこで止まります。Gemma 4 12Bは、同じプロンプト読み込みに加えて、さらに回答の全トークンをその上に載せます。説明的な選択肢ラベルを持つ16フィールドのスキーマでは、生成の段階は誤差の範囲ではなく、実時間の大部分を占めます。InternLM自身の表が、図らずもこの点を示しています。その2Bの兄弟モデルは平均33.28 msを記録し、0.8Bの33.98 msよりもわずかに高速です。プロンプト処理が支配的になると、パラメータ数はもはやてこの役割を果たさなくなります。img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Gemma 4 12Bが単に別格であるところ

スペックシートを意思決定タスクという枠組みのままにしておくのは不誠実だろう。というのも、その枠組みの外では、Gemma 4 12B は単に先行しているのではない——別の競技をしているのだ。

Intern-Decision-0.8Bはテキストと最大8枚の画像を受け付け、それが入力サーフェスのすべてである。デフォルトの入力上限は8,192トークンで、切り捨てではなく拒否され、これは設定が公称する262,144の最大位置埋め込みをはるかに下回る — 実用的なウィンドウはアーキテクチャではなく、この上限である。Gemma 4 12Bは、生のパッチと波形を埋め込み空間に直接投影するエンコーダー不要の設計により、テキスト、画像、音声、動画をネイティブに扱い、256Kのコンテキストウィンドウを保持し、テキストを返す。Googleが公開したカードでは、MMLU Proで77.2%、ツールなしのAIME 2026で77.5%、LiveCodeBench v6で72.0%、GPQA Diamondで78.8%、MMMU Proで69.1%、MATH-Visionで79.7%と評価している。これらはGoogle自身の評価カードによるベンダー数値であり、Intern-Decision-0.8Bの表とは異なり、その後ろには1年間の第三者による使用実績がある。なぜならGemma 4は初日からエコシステム — LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang、Unsloth — に投入されたからである。

両者のリリースもまったく似ておらず、その対比は示唆に富んでいる。Gemma 4 12B は登場した当日に、ローンチブログ、arXiv の技術レポート、5モデル構成のファミリーページ、評価カード、ダウンロードリンクを備えていた。Intern-Decision-0.8B には、404 を返す GitHub URL と 401 を返すデモ Space が載ったモデルカードしかなく、しかも同じくドキュメントが一切ない、より大きな2つの兄弟モデルが現れてから40秒以内に登場した。片方は製品だ。もう片方は、誰かがインターネットに置くことにしたチェックポイントにすぎない。

どちらも Apache 2.0 であり、それは些細な共有行ではない。

両者が本当に交わる唯一の次元はライセンスであり、ここは商業ユーザーにとって判断が変わるポイントなので、一段落を割く価値がある。どちらも Apache 2.0 だ。Gemma 4 12B は Google がホストする Gemma 4 ライセンス条項の下で提供されており、モデルカードはそれを Apache 2.0 と明記している。Intern-Decision-0.8B は Apache-2.0 を、2 つ目の LICENSE-QWEN/ ファイルとともに保持しており、これは Qwen の重みから派生したモデルに対する正しい扱いであり、InternLM が発表していなかったリリースにまで書類仕事をきちんと済ませたという兆しでもある。

そのことは、両者を Liquid AI の LFM2.5 ファミリーと明確に区別する。同ファミリーの LFM Open License v1.0 は、商用利用権を、あなたの法人の年間収益が1000万ドルの閾値を下回り続けることを条件としている——選択肢を比較する意思決定モデルの購入者が、「オープンウェイト」がどこでも同じ意味だと想定する前に読むべき実際の制約だ。あなたのユースケースが商用で、収益がその基準を上回るなら、Apache 2.0 と LFM ライセンスは互換ではなく、Gemma 4 12B も Intern-Decision-0.8B もその制限を伴わない。

Intern-Decision-0.8Bの数値についての正直な記録

Intern-Decision-0.8B の性能を示す数値はすべてベンダーによる報告であり、再現されたものは一つもない。これは形式的な話ではない。現時点での証拠の状態そのものであり、この表をどこまで重く受け止めるべきかを規定するものである。ベンチマークを選んだのも、比較対象を選んだのも、評価を実施して結果を公表したのも InternLM であり、公開リーダーボード上に独立した実行結果は存在しない。このモデルについて Artificial Analysis を検索しても、何も出てこない。img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

そのラベルが付いていても、結果の形は依然として示唆に富む。0.8BはTypeSafeのTyped Decisionベンチマークで77.35を記録し、Jev 1.13——そのベンチマークの名前の由来となったモデル——の73.35に対し、ToolACEでは94.52を記録して91.29に対している。スイート全体では平均79.38で、自身の2Bと4Bの兄弟モデルは84.68と90.02だ。購入者をためらわせるはずの列はWildJailBreakで、ここでは64.48を記録し、Jevの96.29に対している。これほどの拒否堅牢性の差はファインチューニングの性質であり、それがQwen3.5-0.8Bベース、意思決定チューニングの目的関数、パラメータ数から来るのかはどこにも文書化されていない。そのキャリブレーションプロファイルのほうがより興味深い読みだ——Brier 0.530、期待キャリブレーション誤差0.066で、Jevの0.358と0.095に対している——つまり全体としての精度は低いが、申告された信頼度はその精度により密接に追随している。閾値ベースのワークフローでは、その区別は生の精度よりも重要であり、InternLMが公表するインセンティブを持たなかった類のものだ。

それに対して、Gemma 4 12B の評価カードもベンダー報告だ——Google がそれらのベンチマークを実施したのも事実——だが、こちらは6月から世に出ており、あらゆる主要なローカルランタイムを通じて展開されてきたので、何か食い違いがあれば表面化していたはずだ。「1週間再現されていない」と「4か月間再現されておらず、誰も反論していない」の間の証拠上の隔たりこそが、この2つの列の本当の違いである。

実際にそれらをどのように組み合わせるか

理にかなったパターンは、選択ではない。意思決定ヘッドは構造化された呼び出し——ルーティング、トリアージ、分類、ルーブリックに対するスコアリング——を処理する。そこでは解答集合が閉じており、レイテンシが重要で、出力トークンは純粋なオーバーヘッドだ。汎用モデルは、散文、コード、統合、長いコンテキストを必要とするすべてを処理する。エスカレーションの要約、チケットがなぜ請求部門に回されたかの説明、人間が編集する下書きなどだ。

境界線がどこにあるのかを見極めようとしているなら、最も安上がりな実験は、両方の半分を1つのエンドポイントの背後に置くことだ。 OrcaRouterは200以上のモデルを単一のOpenAI互換API経由でルーティングし、自動フェイルオーバーを備え、プロバイダーの定価をマークアップゼロでそのまま通す。つまり、ホスト型の意思決定モデルとホスト型の汎用モデルを同じスクリプトで試すのに必要なのは、キー1つと午後1つだけだ。ここで1つの境界について正確に述べておく価値がある。Intern-Decision-0.8Bは当社のモデルではない。自分でダウンロードして実行するApache-2.0のチェックポイントであり、1.73 GBのモデルを選ぶ理由はまさに、それがあなたのデータがすでにある場所に住んでいるからだ。このパターンの生成側の半分は、あと1行で手が届く部分だ。Gemma 4 12Bに関して言えば、これも当社のカタログにはない。当社がルーティングしているGemma 4のサイズは31Bと26B A4Bであり、12Bはローカルダウンロードだ。 img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

では、評決は勝者を選ぶものではない。Intern-Decision-0.8B は、まだ説明されていないラボによる、安価で高速な決定論的スコアリングヘッドであり、誰も再現していないベンチマーク表と、信頼できない入力に近づける前にテストすべき拒否堅牢性の列を備えている。Gemma 4 12B は、公開文献、技術レポート、そして14倍のパラメータ数を備えた、成熟したオープンウェイトのマルチモーダル汎用モデルであり、16フィールドの分類呼び出しには間違ったツールだ——劣っているからではなく、答えの集合をすでに書き下している問いへの答えを生成することが、ラベルを得るための高価な方法だからである。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新