
Intern-Decision-2B vs Gemma 4 12B:8,192トークンの上限 対 256Kウィンドウ
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
判断を下す必要があるものが、40ページの保険金請求ファイルだとしよう。internlm/Intern-Decision-2Bはそれを拒否する。切り詰めるのでも、要約するのでもなく——拒否するのだ。同梱の推論エンジンがDecisionEngine(max_length=8192)を宣言しており、モデルカードにも、大きすぎる入力は「切り詰めなしで拒否される」とはっきり書かれているからだ。google/gemma-4-12B-it——Gemma 4 12B Unified——は、同じ文書に加えて、それに留められたスキャン写真、さらには録音された通話音声まで受け取り、答えを書いてくれる。この対比こそが比較のすべてであり、それは、仕様表を読む人が真っ先に目を向けるパラメータ数——2,213,241,664 対 11,959,730,224——とはほとんど何の関係もない。
Intern-Decision-2Bは、InternLMが2026年9月26日に予告なしでHugging Faceにアップロードした3つの意思決定チェックポイントの中央に位置するもので、Qwen/Qwen3.5-2Bからファインチューニングされ、Apache-2.0でライセンスされ、Qwenの条項も併記されています。Gemma 4 12B Unifiedは、Google DeepMindによる2026年5月のエンコーダ不要のマルチモーダルモデルで、テキスト、画像、音声、動画を入力として受け取り、256,000トークンのウィンドウで140以上の言語にわたってテキストを生成するany-to-anyシステムです。このうち一方はスコアラーです。もう一方は、注意深くプロンプトを与えれば下手にスコアリングすることもできる汎用モデルにすぎません。両者のどちらを選ぶかは、ベンチマークの問いというよりも、あなたの答えがすでにどのような形をしているかという問いなのです。
両者が実際には比較できない場合
数字の話に入る前に、この点については率直に言っておく価値がある。なぜなら、この対戦カードは偽の対称性を誘うからだ。
Intern-Decision-2B はトークンを生成しません。状態、それぞれ最大62個の選択肢を持つ1~16個の名前付き質問、およびオプションで最大8枚の画像を受け取り、各フィールドに1つの <decision> プレースホルダーを持つアシスタント JSON スケルトンをレンダリングし、単一の因果フォワードパスを実行し、各プレースホルダーの直前の位置でロジットを読み取り、そのフィールドの正当なシンボルのみに対してソフトマックスを行い、適合された温度 2.100509348278 を適用します。出力は、キャリブレーションされた分布とフィールドごとの argmax です。モデルカードには否定的な事項が明記されています:「この API は構造化された候補スコアリングを実行します。generate() を呼び出したり、自由形式のテキストをサンプリングしたりしません。」
Gemma 4 12Bは生成する。それが行うすべて — 設定可能な思考による推論、関数呼び出し、OCR、グラフ理解、音声認識、140言語対応 — は、262,144エントリの語彙に対するデコーディングループを通じて実行される。確率付きのルーティング判断を求めると、数値を含む文章が返ってくるが、その数値はサンプラーが生成したものであり、あなたの選択肢集合に対するソフトマックスではない。
だから実用的な問いは「どちらがより正確か」ではない。「自分の答えはすでに閉じた集合なのか」だ。もしそうなら、12B はリストから選ぶための無駄な方法だ。そうでなければ、Intern-Decision-2B はどんな精度でも一切役に立たない。
入力上限は、それらの間の最も鮮明な境界線です
これこそ、他の何よりも重く見るべき要素です。なぜなら、それは緩やかな性能低下ではなく、致命的な障害を引き起こすからです。
• 入力長 — Intern-Decision-2B は 8,192 トークンを受け付け、それより長いものは容赦なく拒否します。Gemma 4 12B は 256,000 トークンを受け付け、Google 自身のカードによれば 128k での MRCR v2 の eight-needle で 43.4% を記録しています。
• 画像 — Intern-Decision-2B では最大8枚で、同じ 8,192 トークンの予算に算入されます。Gemma 4 12B ではアスペクト比と解像度が可変で、テキストと画像を任意の順序でインターリーブして入力できます。
• モダリティ:一方はテキストと画像、もう一方はテキスト、画像、音声、動画。
• 言語 — Intern-Decisionのドキュメントでは、どこにも多言語対応の主張はなされていない。Gemma 4は140以上の事前学習済み言語をカバーし、12BではMMMLUで評価された多言語スコア83.4を記録している。
• 出力 — 一方には型付きのJSON回答分布、もう一方には生成テキスト。
8,192という上限は恣意的なものではなく、だからこそ回避するのが難しい。判定の目的関数はフィールドごとに固定位置のロジットを読み取るため、プロンプトは状態・スキーマ・完全なスケルトンを一度に含んでいなければならない。契約を保つチャンク化戦略は存在しない。チケット、メール、短いJSON状態、スクリーンショット1、2枚——それが設計の中心だ。検索を必要とする文書は、このモデルが対象とする文書ではない。
それぞれがあなたに何の犠牲を払わせているか、正直に数え上げたもの
Intern-Decision-2B にはホスト型エンドポイントもプロバイダーもありません。OrcaRouter の同モデルのページは 404 を返し、この記事のいずれの記述も可用性を主張するものではありません。これを呼び出すには、約 4.46 GB のリポジトリ — 3.76 GB の言語シャード、612.5 MB のビジョンタワー、50.3 MB のプロジェクター — をダウンロードし、重みと同じ場所で inference.py を、torch 2.9.1 と transformers 5.14.1 を入れた Python 3.12 環境で実行する必要があります。しかも、意思決定をスコアリングしているかどうかに関係なく料金を支払っている GPU 上で。
それはすべての場合で不利益というわけではなく、決めつけるのではなく計算してみる価値がある。InternLM自身の測定では、単一のRTX 4090で1リクエストあたり平均33.28 msのとき、ローカルでホストしたIntern-Decision-2Bは判断ごとに何も課金されない。ホスト型の汎用モデルはトークン単位で課金され、回答する前に思考に費やすトークンも含まれる。大量処理では、すでに保有しているスコアラーのほうが安価な手段だ——コストはGPUとエンジニアリングであり、呼び出しではない。
Gemma 4 12B Unified も同様に当社のカタログにはありません。必要なら、BF16 の 119.6 億パラメータを取得して自分でホストすることになります。当社のカタログに実際に Gemma 4 のルートがあるのは他の2つのサイズで、しかも安価です。Gemma 4 26B A4B は入力100万トークンあたり $0.06、出力100万トークンあたり $0.33、Gemma 4 31B は $0.13 と $0.38 で、どちらも 262,144 トークンのコンテキストと、カタログに表示される P50 初回トークン時間 1.73 秒が記載されています。あなたの問題がクローズドセットの判定ではなく汎用推論であることが判明した場合、それはローカルで運用するスコアラーと比較すべきものです — 1つのキーでさらに2つのモデル、プロバイダー定価をマークアップなしでそのまま適用、そして 自動フェイルオーバー により、まだ評価中のモデルが本番経路の単一障害点になることはありません。

スコアボード、ただし注意事項付き
• パラメータ — Intern-Decision-2B は BF16 で 2,213,241,664、さらにビジョンタワーとプロジェクターを含む。Gemma 4 12B Unified は BF16 で 11,959,730,224。
• コンテキスト — 上記で拒否された8,192トークン 対 256,000トークン
• 出力 — 較正された確率と argmax、テキストなし;生成テキストは一度に 1 トークンずつ。
• モダリティ — テキストと最大8枚の画像 対 テキスト・画像・音声・動画を入力、テキストを出力
• 公表されたエビデンス — 7スイートのベンダー表では平均84.68、Brierスコア0.437、ECE 0.100だが、ラボ外の誰によっても再現されていない。Googleの評価カードではMMLU Pro 77.2%、GPQA Diamond 78.8%、ツールなしのAIME 2026が77.5%、LiveCodeBench v6が72.0%、さらにArtificial Analysis Intelligence Index 14.2での独立した掲載がある。
• 採用状況 — 数百に及ぶ量子化、ファインチューニング、派生版を備え、5月から流通しているファミリーに対して、2Bチェックポイントはいいね1つ、ダウンロードはゼロ。
証拠の行は非対称に読むべきです。なぜなら、それが実態だからです。Googleの数値は第三者によって独立に索引化され、再現されています。InternLMの数値は研究室の外で誰も実行していません。とりわけキャリブレーションの値は、外部のテストセットで検証されるまでは、十分に文書化された意図として扱うべきです。正直な要約は、ベンダー表が間違っているということではありません。二つの列が同じ証拠上の重みを持っていないということです。そして、そのことを明示せずに84.68の隣に77.2を並べる比較は、読み手を誤導しています。

これをどうすればいいですか
決定が真に決着していて、状態が8,000トークンに余裕をもって収まり、解析しなければならない段落ではなくしきい値を設定できる確率が欲しく、まだ誰もサポートしていないチェックポイントを運用するハードウェアと意欲があるなら、Intern-Decision-2B を選ぼう。中間サイズは特に、InternLM が提供した3つのうち公表されている較正が最も弱い — ECE 0.100 に対して、半分のサイズのモデルは 0.066、ほぼ2倍のモデルは 0.065 — したがって、このファミリー内で選ぶなら、2B は自分の temperature を合わせるべきものであり、そのまま信用するものではない。
入力が1ページより長い場合、音声・動画・英語以外の言語が関わる場合、答えを単に選択するのではなく説明する必要がある場合、または推論スタックを自前で持ちたくない場合は、Gemma 4 12B — あるいはより実用的には、実際にルーティングしている2つのGemma 4サイズのどちらか — を選びましょう。12Bはネイティブ音声対応のGemma 4モデルの中で最小です。26B A4Bはトークンあたり約40億パラメータを活性化し、このファミリーに参入する最も安価な方法です。
そして、もし実際に手元にあるのが、長い文書が付いたスコアリング問題なら、これらのどちらも適切な道具ではない。それは、比較記事の衣をまとった検索問題だ。

