
Intern-Decision-2B vs MiniCPM5-2B:20日違いの2つの2Bチェックポイント、パラメータの使い方は正反対
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
internlm/Intern-Decision-2Bとopenbmb/MiniCPM5-2Bは同じサイズで、20日の間隔でリリースされ、同じライセンスで、同じ用途のために作られたものではありません。InternLMのチェックポイントは2,213,241,664パラメータの意思決定スコアラーです。状態と型付きの質問を受け取り、1回のフォワードパスを実行し、トークンを生成せずにキャリブレーションされた確率を返し、8,192トークンを超える入力は拒否します。OpenBMBのものは2,516,756,480パラメータの密な汎用モデルです。MiniCPM5のレシピから派生した42層のLlamaで、131,072トークンのコンテキストを取り扱い、コードを書き、ツールを呼び出し、数学を行い、Artificial Analysis Intelligence Indexは12.5で、先月のダウンロード数は726,518です。ダウンロードにかかるコストは同じですが、得られるものは全く異なります。
この組み合わせの面白いところは、ベンチマークの差ではない——比較できる共通のベンチマークがほとんどないのだ。面白いのは、22億と25億のパラメータ予算をそれぞれ何に使えるか、そしてその選択が、どちらが完成しているかについて何を教えてくれるかだ。MiniCPM5-2Bはこのシリーズの2番目のモデルで、5月のMiniCPM5-1Bに続くものであり、完全なリリースの仕組みを伴って登場した。Intern-Decision-2Bは、InternLMが2026年9月26日05:36 UTCに告知なしでHugging Faceに公開した3つのサイズの中央にあたり、そのリリースの仕組み——トレーニング用コードベース、ハッシュ検証済みの評価バンドル、96ケースのキャリブレーション・ベンチマーク——が公開されたのは、今朝08:58 UTCになってからだった。
2つの予算はどこへ消えたのか
どちらのモデルも他者のアーキテクチャをファインチューニングしたもので、どちらも約25億個のパラメータを抱えている。似ているのはそこまでだ。

MiniCPM5-2Bは、42層、隠れサイズ2,048、アテンションヘッド16、中間サイズ6,144、語彙数130,560トークン、コンテキスト長131,072トークンの密なTransformerであり、OpenBMBが同時に公開したオープンコーパスの混合データで学習されている。Web事前学習用のUltraX、L0~L3の段階的コード管理を備えたUltraData-Code、UltraData-Math、そしてUltraData-RL-2609内の80,000件超のRLサンプルとともに50万件のエージェントSFTサンプルが用いられている。そのポストトレーニングではSFTを実行し、続いて数学・コード・エージェントタスクに特化したRL教師を適用し、その後オンポリシー蒸留によって単一のモデルへと戻す。これは汎用モデルであり、そのパラメータ予算のすべてが、プロンプトで引き出せる能力としてそのまま露出している。
Intern-Decision-2B は Qwen3_5ForConditionalGeneration です。3つの線形アテンション層につき1つのフルアテンション層という繰り返しパターンを持ち、隠れサイズは 2,048、8個のクエリヘッドに対して2個のキー・バリューヘッド、ヘッド次元は 256、保持されたマルチトークン予測層、そして 262,144 位置の埋め込み上限を備えています。612.5 MB のビジョンタワーと 50.3 MB のプロジェクターを同梱しています。その予算のほとんどは、プロンプトとしてあなたが利用できるものではありません。モデルは固定された質問スキーマに回答し、そのアーキテクチャはテキスト生成器ではなく、ソフトマックスの伝達機構なのです。
InternLM が新たに公開したリポジトリの細部が一つ、取り上げる価値がある。なぜなら、それはモデルカード上のマルチモーダルというタグの捉え方を変えるからだ。decision tuning は「Qwen3.5 の言語バックボーンをファインチューニングしつつ、ビジョンタワーとプロジェクターを凍結する」。2B と 4B の decision チェックポイントはどちらも、正確に 612,517,440 バイトのビジョンシャードを保持している — 両者で同じサイズだ — これは、これらのコンポーネントがトレーニングされたのではなく Qwen ベースから継承されたものであることと整合している。画像パスは実在し、利用可能だが、InternLM の decision tuning が力を注いだ対象ではない。ワークロードがテキストのみの decision スコアリングなら、その 4.46 GB のダウンロードのうち約 660 MB はあなたにとって何の役にも立たない。
スコアボード

• パラメータ — Intern-Decision-2B は BF16 で 2,213,241,664、加えてビジョンタワーとプロジェクターが約 660 MB、リポジトリは約 4.46 GB。MiniCPM5-2B は BF16 で 2,516,756,480、5.03 GB の safetensors ファイル 1 つ。
• コンテキスト — Intern-Decision-2B は 8,192 トークン、それを超えると切り捨てなしで拒否;MiniCPM5-2B は 131,072 トークン。
• 出力 — フィールドごとの較正済み分布と argmax、テキストは一切なし;生成テキストはトークン単位で。
• 学習 — ビジョンタワーを凍結した Qwen3.5-2B バックボーンの意思決定チューニング。学習データは非公開。本格的な事前学習、中間学習、4000億トークンの深層思考 SFT パスに続いて RL とオンポリシー蒸留を実施し、コーパスも併せて公開。
公表されたエビデンス — 7スイートのベンダー表は平均84.68で、Brier 0.437、ECE 0.437、第三者による再現はなく、いいね1件、ダウンロード0件。OpenBMBのカードは独自の比較セット内で平均53.9、独立したArtificial Analysis Intelligence Indexは12.5で、過去1か月に726,518ダウンロード。
• ライセンス — Apache-2.0。上流のQwen条件はLICENSE-QWENとして保持されており、コードリポジトリにはライセンスが一切明記されていません。コードも含め、全体を通してApache-2.0です。
それぞれが実際に何をより得意としているのか、そしてその差は歴然としている。
その比較はカテゴリー錯誤と言えるほど非対称なので、むしろそれぞれの職務を具体的に挙げるほうが有益だ。
MiniCPM5-2Bは、答えを選ぶのではなく生成することを伴うあらゆる領域で勝利を収める。コードを書き、Intern-Decision-2Bにはコードパスがない。131,072トークンのコンテキストを扱えるが、Intern-Decision-2Bは8,192で止まり、大きな失敗をする。ツールを呼び出し、OpenBMB自身の表でBFCL v4スコア66.6を記録し、数学もこなし、MATH-500で94.6、GPQA-Diamondで70.2 — ベンダーのカードの数値で、GPQAの行にはカード自体が提供する脚注が付いている。MMLU-Proで70.8、MMLU-Reduxで84.7をサポートする。llama.cppとMLXで動作し、GGUF、GPTQ、DSparkの各バリアントで提供され、Hub上には公開のデモSpaceがあり、Intern-Decisionのカードが指し示す401とは異なる。
Intern-Decision-2B が勝ち取るものはちょうど2つだけであり、それらこそがこれが存在する理由である。第一に、自分で書いたスキーマを使うクローズドセット判定は、しきい値を設定できる確率を、単一のフォワードパスで、約33ミリ秒で、パーサーもサンプリングもなしに返す——MiniCPM5-2B が、テキストを生成して、その中の数値が期待どおりに振る舞うことを願う以外には生み出せない形式である。第二に、それは再現可能な成果物である。リポジトリは現在、学習目的関数、SHA-256 ハッシュとスイートごとの行数を付した7つの精度スイート、スコアリングコード、温度フィッティングおよびリプレイ用スクリプト、そして独自のジェネレータとオフラインスコアラーを備えた96ケースの分布キャリブレーションベンチマークを収めている。InternLM の評価ガイドは、リリースされたプリセットが XTuner バックエンドに紐付いていること、また HF の結果は別の実行設定として報告すべきであることを注記している——これはまさに、再現キットが検証可能にするために存在する種類の但し書きである。

誰がどれをダウンロードすべきか
長い文章を読む、何かを書く、あるいは事前に選択肢を列挙していなかった質問に答えるといったタスクがあるなら、MiniCPM5-2B がそのモデルであり、迷う必要はありません。これは完成された 2B クラスの汎用モデルで、実際のエコシステム、その背後にあるオープンデータ、独立した評価リストを備えており、試すのにお金はかかりません — GGUF と MLX ビルドはすでに Hub 上にあります。
タスクが本当に既知の答えの中からの選択である場合——チケットのルーティング、サポートメールの分類、候補者へのラベル付け、意図を順序尺度で採点するなど——生成モデルは間違った道具であり、Intern-Decision-2B は、ほとんど誰も実行したことがないにもかかわらず、二者のうちより興味深い方だ。しきい値を設定できる確率は、運用コストが低く、監査が容易で、ハルシネーションを起こしようがない。そして、そのチェックポイントがリーダーボード投稿ではなく再現キットとともに登場したという事実により、その選択を正当化しなければならないときに重要となる軸において、二者のうちより文書化が行き届いている方になる。
どちらのモデルもOrcaRouter上にはありません。当社のIntern-Decision-2Bのモデルページは404を返し、MiniCPM5-2Bのルートも存在しません。ここに書かれていることは可用性についての主張ではなく、どちらも自前で推論を実行することを意味します。現実的な代替手段があるのは、ホスト型のデシジョンモデルです:TypeSafeのJev 1.13は、InternLMがそのファミリー全体を比較対象にベンチマークしたモデルで、カタログ上では100万入力トークンあたり$0.042、コンテキスト65K、初回トークン生成までの時間のP50が178 msです。そして、本当に必要なのがMiniCPM5-2Bと同じサイズクラスの汎用モデルで、運用の手間をかけたくないという場合は、当社で最も小さいホスト型Qwenルートはサイズこそ数倍ですが、1つのキーで利用できる200以上のモデルの中の1つであり、その料金はマークアップなしでそのまま適用されるプロバイダー表示価格、そして自動フェイルオーバーがその背後にあります。
それを決めるたった一つの数字
それは84.68 対 53.9ではない。それら2つの平均は異なるスイートに由来し、異なるラボによって測定されており、しかも一方は、これまで一度も数値を検証されたことのないラボによるものだ。それを決める数字は8,192だ。あなたの状態が8千トークン以内に収まり、答えがすでにリストであるなら、Intern-Decision-2Bは再現キットを備えた精密な計器であり、注意すべきキャリブレーション異常がある——その期待キャリブレーション誤差0.100は、InternLMが公開した3つのサイズの中で最悪で、半分のサイズのモデルでは0.066である。したがって、信頼度の値を信頼する前に、自分でtemperatureをフィットさせるべきだ。あなたの状態が収まらないなら、ベンチマークが始まる前に問いは終わっており、答えはMiniCPM5-2Bだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
