
MiniCPM5-2B-DSpark vs Granite 4.2 3B:軽量・高速・セルフホスト推論のための静かなApache-2.0リリース2選
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年8月から9月初旬にかけて、同じ役割——自分で運用する小規模モデル——を狙った2つの静かなApache-2.0リリースが登場したが、そのアプローチは正反対だった。Granite 4.2 3Bは、IBMのノートPCサイズの推論モデルであり、そのウェイトは8月上旬にHugging Faceで公開され、モデルカードと技術ブログは2026年8月25日に公開された。MiniCPM5-2B-DSparkは同じ意味でのモデルではない。OpenBMBが2026年9月6日に何の告知もなく公開した323.8MパラメータのDSparkドラフトチェックポイントであり、ModelBestが2026年7月19日のWAICで発表した2.52B高密度オンデバイスモデルMiniCPM5-2Bが、投機的デコードを通じてより速くトークンを生成できるようにするために作られた。一方のリリースはスタンドアロンの小型推論モデルであり、もう一方は小型モデル向けの高速化アクセサリである。両者ともApache-2.0の下にあり、セルフホスト専用であり、どちらもまだ独立したベンチマークによる評価を受けていない。
マーケティングの飾りを取り除けば、チームが直面する実際の問いは単純だ。2026年後半の小規模なセルフホスト型サービスワークロードにおいて、IBMの3B推論特化モデルと、ModelBestの無料ドラフトを組み合わせた2Bエージェント指向スタックのどちらを選ぶのか。その根拠は、どちらのベンダーの仕様書が示唆するよりも薄い。そこで本稿では、リリースの事実、実際に存在する同一スイートでの唯一の数値、そして選択を左右するはずのワークロードの違いを見ていく。
2つのリリースについて、知り得ること
Granite 4.2 3B は、IBM の最小規模の推論モデルで、Granite-4.1-3B-Base をポストトレーニングして作られています。デンス(dense)かつテキスト専用のアーキテクチャを採用し、40レイヤー構成、グループ化クエリアテンション(GQA)、128Kのネイティブコンテキスト(5回目の事前学習フェーズで512Kまで拡張)を備えます。推論モードは、デフォルトのフル思考に加え、低労力モードと非思考パスの3つです。IBM のモデルカードでは、3B 版が大型の Granite 4.2 ファミリーが受けたエージェント型強化学習ブロックを意図的に省略したことが明記されており、SWE-Bench の結果は記載されていません。したがって、これはエージェントモデルではなく推論モデルとして位置づけられています。提供手段は vLLM、SGLang、Transformers、GGUF、Ollama(granite4.2:3b)で、ホスト型 API はありません。カードに掲載された主要スコア(AIME 2025 で 78.33、GPQA で 54.80、LiveCodeBench v6 で 69.71)はベンダー報告値であり、現時点では第三者による再現は確認されていません。

上記の ibm-granite/granite-4.2-3b カードは、そのリリースの公の顔です。つまり、推論チューニングされた3Bモデルであり、長いコンテキストを持つという特徴はありますが、エージェント機能に関する主張は一切ありません。
対照的に、MiniCPM5-2B-DSparkはその対象に奉仕するためにのみ存在する。ドラフトモデルは、323,776,001パラメータ、1フォワードパスあたり7つの候補トークンのブロックサイズを持つ5つのフルアテンション層で構成され、MiniCPM5-2Bが生成した70.5億トークンで6エポック学習されている。そのリポジトリは受理長——貪欲デコードで総合的に検証ステップあたり5.52トークン、コードでは6.11トークン——を報告しているが、1秒あたりのトークン数は示されていない。それが高速化する対象であるMiniCPM5-2Bの方が興味深い製品だ。高密度の2.52Bパラメータ、42層、128Kコンテキストのモデルであり、そのローンチ資料はエージェント能力を強調している。ModelBestの7月の発表によると、200B規模のエージェント中間学習、大規模なエージェントSFTセット、エージェントRLアライメントに加え、ネイティブな長文脈対応と高速/熟考モードのハイブリッドを備えている。ModelBest自身の比較スイートでは、対象モデルは同クラスのオープンモデルに対して平均53.9を獲得している。それらの数字はすべてベンダーによるものだ。

上記の openbmb/MiniCPM5-2B-DSpark カードが、リリースの全容です。モデルカード、設定、1つの Safetensors ファイルのみで、発表は一切ありません。
存在する唯一の同一スイート間での比較
クロスベンダーのスコアボードは、ほとんどがリンゴとオレンジを比べるようなものだ。しかし、Granite 4.2 3BとMiniCPM5-2Bが同じ条件で測定された場所が一つだけある。ModelBest自身がMiniCPM5-2B向けに公開した評価表で、そこにはgranite-4.2-3Bがベースラインの一つとして掲載されている。そのスイートでは、MiniCPM5-2Bが平均53.9、Granite 4.2 3Bが42.7だった。この数字は、それが実際に何であるかを正確に読むべきだ。すなわち、ある一社が自社モデルをよく見せるために選んだ一つのスイートで両モデルを実行しただけの、再現されていない結果だ。それは評価の結論ではない。それでも、この数字が示すことはある。ModelBestが、競合他社の3Bモデルをカードに載せるだけの自信を持っていたということだ。そして、同社が主張する差が最も大きいのは、まさに同社のトレーニングが投資された領域、つまりロングコンテキストとエージェント系の行だ。これは方向性を示す主張として捉え、自分のデータで検証し、それに基づいて何かを判断する前には、IBM自身が別途カード上で示す主張も比較衡量すべきだ。
スコアボード、正直に表示された
• 搭載モデル — MiniCPM5-2B-DSpark: MiniCPM5-2B(2.52Bの高密度ターゲット)向けの324Mドラフトであり、単体では動作しない。Granite 4.2 3B: 約3Bの高密度な単体推論モデル。
• 役割 — MiniCPM5-2Bスタック:ModelBestによるオンデバイスエージェントとツール使用に重点を置く。Granite 4.2 3B:推論特化型で、意図的に非エージェント型。
• コンテキスト — MiniCPM5-2B:ターゲットは128Kネイティブ。Granite 4.2 3B:128Kネイティブで、512Kまで拡張可能。
• 加速 — MiniCPM5-2B-DSpark: 外部DSparkドラフト、1パスあたり7トークン、貪欲法での受理はステップあたり約5.5(リポジトリ報告による)。Granite 4.2 3B: 本リリースには同梱なし。
• ライセンス — 両方ともApache-2.0です。
• 根拠 — MiniCPMの数値はModelBestのカード申告値です(そのスイート:53.9 vs Granite 42.7)。Graniteの数値はIBMのカード申告値です(AIME 2025 78.33、GPQA 54.80)。どちらについても、独立した実行は存在しません。

上記のスコアボードは、本文と同じ情報源を使用しています。記載されているすべての数値はベンダーが報告したものであり、いずれかのベンダーが公開した同一スイートの唯一の数値は、ModelBest自身のものです。
あらゆるベンチマークを凌駕する違い
スコアを見る前に、自分のワークロードに必要な小規模モデルの種類を決めておこう。この2つのリリースは異なる問いに答えているからだ。Granite 4.2 3Bは、制約のあるハードウェア上での推論と長いコンテキスト処理のために作られている。ネイティブ128Kで512Kまで拡張できるコンテキストウィンドウ、クエリごとに選べる3つの思考モード、ラップトップでも動作するフットプリント、そしてエージェント訓練をあえて行わないという明確な判断。長文ドキュメントの分析、リポジトリ規模のコンテキスト、小型マシン上での信頼できる推論が仕事なら、これは理にかなった組み合わせだ。 MiniCPM5-2Bは正反対の重点のために作られている。すなわち、デバイス上でのエージェント的行動とツール利用だ。そもそもドラフト版が存在していること自体が、ModelBestがこのターゲットを対話的に提供されるものと想定し、1秒あたりのトークン数を取り戻したいと考えていることを示している。ツールを呼び出し、長い会話を維持するオンデバイスのエージェントループが仕事なら、それはまさにあなたに向けて作られたスタックだ。
このドラフトは、Graniteのリリースでは対処されていない形で、その2番目の選択肢の経済性を変える。MiniCPM5-2Bはdenseモデルであり、投機的デコーディングが最も効果を発揮するのは、まさにdenseかつメモリ律速の領域、すなわち小さな固定モデルがわずかに大きな固定モデルに対してトークンを提案するという構図だ。約650MBのBF16重みを約5GBのターゲットに追加する外部ドラフターは、文書化されたSGLangサービングパスを備え、検証ステップあたり約5.5トークンの貪欲受理率を達成する。これは、単一リクエスト並行性で運用するモデルにとって、信頼できるスループット向上のレバーとなる。ただし、注意点は免れない。OpenBMBはエンドツーエンドの高速化を一切公表しておらず、したがってそのレバーは未較正のままである。IBMも今回のリリースでは、Granite 4.2 3B向けの同等の外部ドラフターを出荷していない。つまり、このモデルはdenseのまま実行することになり、その速度面の話は、単に3Bが小さいというだけだ。
誰がどれを実行すべきか
Granite 4.2 3Bを実行しましょう。ワークロードがラップトップクラスの環境での長文コンテキスト推論 — ドキュメント、リポジトリ、深いシングルスレッド分析 — であり、完全に制御可能なApache-2.0モデルで3つの思考モードと512Kの上限を求める場合に最適です。ただし、背後にエージェントトレーニングはなく、ホスト型APIもないことを理解しておいてください。
• ワークロードが、メモリ予算に収まる対象を扱う対話型・ツール呼び出し型のオンデバイスエージェントであり、ドラフトが取り戻せるスループットを求める場合には、DSpark ドラフトを備えた MiniCPM5-2B スタックを実行しましょう。ドラフトの実際の高速化を示す数値は公開されていないため、ご自身の SGLang ビルドで実際の高速化を測定する時間を確保してください。
• 本当に確信が持てない場合は、両方をルーティングレイヤーの背後で実行してください。今日の時点で、どちらのモデルもホステッドカタログには含まれていません。{{1}}OrcaRouterも例外ではありません{{/1}}。どちらもセルフホストが前提です。しかし、自動フェイルオーバーを備え、自前のエンドポイントの前に立つルーターを使えば、新しいドラフトスタックをテスト用経路に置いたまま、本番環境では実績のあるモデルを使い続けられます。しかも、その周辺のホステッドモデルに対する0%マークアップのパススルーにより、A/B比較が安価に済みます。重要なのは可逆性です。モデル名を入れ替えて測定し、その{{2}}1日しか経っていないチェックポイント{{/2}}が失速するようなら、元に戻せばいいのです。
次に見るもの
この対決を決着させるのは、どんな意見よりも速く、次の2つの要素だろう。第一に、MiniCPM5-2Bを独立に実行し、53.9の平均スコアとエージェント性能に関する主張を裏付けるか、否定するかである。SWE-Bench系タスクであれだけのスコアを叩き出す2Bは、オンデバイスクラスにとって真に新しいデータポイントとなるはずだ。第二に、IBM自身の推論モデルの数値が、コミュニティによる再現を乗り越えられるかだ。3BのAIME 2025スコア78.33は、他の誰かが実行すれば変化する類の主張である。そのどちらかが確定するまで、誠実な立場は明確だ。Granite 4.2 3Bは、今日においてより安全で、ドキュメントも充実した小型モデルであり、MiniCPM5-2Bスタックはより興味深い賭けである。主張が正しければ、より高速なオンデバイスエージェントになる一方、その見返りはベンダー自身さえまだ測定していないドラフト段階のものである。
