
MiniCPM5-2B-DSpark vs Gemma 4 12B:2つのドラフト手法、ローカルAIの2つの重量クラス
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniCPM5-2B-DSparkとGemma 4 12Bがなぜ同列に語られるべきなのかを最速で確かめるには、しばらくサイズのことは忘れて、それぞれが一文を書く様子を見るのが一番だ。両者はどちらも、ドラフターを使ってメモリバスを出し抜く。小さなモデルが次のトークンを複数まとめて提案し、本体のモデルがそのブロックを1回のパスで検証する。これにより、シリコンはウェイト読み込みのコストを、トークンごとではなくブロックごとに一度支払えば済む。MiniCPM5-2B-DSparkは、OpenBMBが2026年9月6日にHugging Faceへひっそりと公開したドラフトモデルだ。323.8Mパラメータのコンパニオンチェックポイントであり、ModelBestが2026年7月19日のWAICで発表した、2.52Bのdenseオンデバイスモデル「MiniCPM5-2B」を高速化する。一方、Gemma 4 12Bは、Googleの11.95Bパラメータのエンコーダーレス・マルチモーダル汎用モデルで、2026年6月3日にローンチされ、独自のドラフターを内蔵し、256Kコンテキストを備える。前者はドラフターをApache-2.0ライセンスの独立したチェックポイントとして提供し、ユーザーが自分でロードする方式だ。後者はそれと同様の仕掛けを、実行するだけの単一の大規模モデル内部に隠している。
この記事の形を決定づける正直な注記:MiniCPM5-2B-DSpark は、プロンプトで動かせるモデルではない。トークナイザーもチャットテンプレートもなく、単体での出力もない。モデルカードに並ぶのは model.safetensors、config、README だけだ。これは2Bクラスのモデル向けサービング層の付属モジュールであり、読者が実際に比較しているのは、2つのローカルAIウェイトクラスである。すなわち、スマホサイズの2Bスタックがトークンを書き出すか、16ギガバイトの12B汎用モデルがトークンを書き出すかという対比だ。以下に続くすべては、その選択を具現化したものである。
MiniCPM5-2B-DSparkの正体
今回のリリースで公開されている面はモデルカードだけであり、したがって、このモデルについて知り得るのは、このカードの記載内容だけです。MiniCPM5-2B-DSpark は DSpark のドラフトチェックポイントで、5つのフルアテンション層、323,776,001 個のパラメータ、16個のクエリヘッドと2個のKVヘッドからなるグループ化クエリアテンション(GQA)、およびブロックサイズ7を備えています。1回のフォワードパスにつき最大7個の候補トークンを提案し、ターゲットである MiniCPM5-2B がそれを検証できるようにします。設定は、DSparkDraftModel オートマップを伴う Qwen3DSparkModel アーキテクチャを宣言し、DSpark メソッド(arXiv 2607.05147、2026年7月の DeepSeek 論文)の confidence head と Markov head を有効にしたまま同梱しています。この confidence head と Markov head は、負荷を考慮してサフィックスをチェックする価値がないと判断する検証器です。このチェックポイントは、一般・数学・コードの各プロンプトに対する MiniCPM5-2B の生成応答テキスト(計70.5億トークン)を用いて6エポック学習されました。

上記のopenbmb/MiniCPM5-2B-DSparkカードが公開された内容のすべてです:モデルカード、コンフィグ、1つのSafetensorsファイルのみで、アナウンスもブログ記事もプレスリリースもありません——本稿執筆時点で公開から1日しか経っていない、静かなウェイト公開です。
このカードに含まれていない情報は、含まれている情報と同じくらい重要である。このカードは受理長を報告している。リポジトリ自身の評価によれば、貪欲復号における検証ステップあたりの受理トークン数は平均5.52で、数学は上限7トークンのうち6.05、コードは6.11である。しかし、実時間での高速化も、1秒あたりのトークン数も、独立したベンチマークも公開していない。文書化されたサービング経路はSGLangのDSPARKエンジンであり、ドラフトモデルはMiniCPM5-2Bターゲットモデルと並べてロードされる。言い換えれば、ドラフトの品質は定量化されているが、その効果はまだ定量化されておらず、採用するなら信じる前に測定すべきである。
Gemma 4 12B がもう一方の側にもたらすもの
Gemma 4 12Bは、GoogleのGemma 4ファミリーの真ん中の子であり、ローカルAIのカーブ上ではまったく異なる位置に立つモデルです。これは、テキスト・画像・音声・動画を個別のエンコーダなしで入力として受け取る、単一のDenseな11.95Bモデルです。ツール呼び出しにもそのまま対応し、ネイティブ256Kコンテキストとマルチトークン予測ドラフターを組み合わせます。このドラフターは、内部で同じメモリバストリックを実現しますが、それがチェックポイントの内側に組み込まれているため、ユーザーが追加でダウンロードしたり接続したりするものは一切ありません。ライセンスはApache 2.0で、現実的に16GBのノートPCで動作し、Googleの本格的な支援一式(ローンチ評価、ベースモデルと指示チューニング(instruction)モデルのモデルカード、Model Garden・LM Studio・Ollamaにわたるエコシステムサポート)を伴って登場しました。また、その背後には数か月にわたるコミュニティでの導入実績があり、これは、登場からわずか1日のMiniCPMドラフトにはない点です。

上記のGemma 4 12Bに関するGoogleのモデルカードは、その対比を一枚のフレームに収めている。すなわち、成熟したマルチモーダル汎用モデルであり、その起草者は別個のリポジトリではなく、リリースの一部として組み込まれている。
正直に表示されたスペック
情報源を考慮してこれらを読んでください:MiniCPM5-2Bの数値はModelBestのカード上の主張であり、未再現です。Gemma 4 12Bの数値はGoogle自身のもので、コミュニティでの使用に長くさらされてきました。
— 実行するもの — MiniCPM5-2B-DSpark:MiniCPM5-2B(2.52B dense、42層)と組み合わせてのみ動作する324Mドラフトモデル。 Gemma 4 12B:単体の11.95B denseモデル。
• コンテキスト — MiniCPM5-2Bはネイティブ128Kをターゲット。Gemma 4 12Bはネイティブ256K。
• モダリティ — MiniCPM5-2B スタック:テキストのみ。Gemma 4 12B:テキスト、画像、音声、動画の入力、エンコーダーレス。
• ドラフティング — MiniCPM5-2B-DSpark: 外部DSparkドラフト、1パスあたり7トークン、SGLang DSPARKエンジン。Gemma 4 12B: 内部マルチトークン予測ドラフター、インストール不要。
• フットプリント — MiniCPM5-2BはBF16で約5GBに加え、約650MBのドラフトファイルが必要。Gemma 4 12BはBF16で約18GBで、16GBクラスのハードウェアでは量子化すれば実用的です。
• 根拠 — MiniCPM5-2B-DSpark:リポジトリ受理時点の数値のみで、公開から1日。Gemma 4 12B:ローンチ時の評価に加え、数か月にわたるコミュニティ展開の実績。

上記のスコアボードは、6つの行に同じ肖像を示している。2つの列は、両者が速く書くために用いる戦略を除いて、ほぼすべての点で食い違っている。
実際に手元にあるシリコンに適合する重量クラスはどれですか
なぜなら{{1}}MiniCPM5-2B-DSparkはモデルそのものではなく、意味のある分岐は、対象モデルのパラメータ規模とGemma 4 12Bのそれとの比較にある{{/1}}——そして{{2}}その分岐は、ほぼハードウェアの問題である{{/2}}。{{3}}スマートフォンもスマートコックピットボードも、数GBのDRAMしか持たない小型エッジボックスも、11.95Bモデルを実用的な速度で動かすことはできない。メモリバスこそが、まさにそれを詰まらせるボトルネックなのだ{{/3}}。{{4}}MiniCPM5-2Bスタックが作られたのは、まさにそうした世界のためだ——オンデバイスメモリに収まる重みを持つdense 2Bモデルに、小さなdenseモデルがどうしても犠牲にしてしまうトークン/秒の一部を買い戻すためのドラフトを組み合わせた構成だ{{/4}}。{{5}}投機的デコードが最も効果を発揮するのは、まさにこのdenseかつメモリ律速の領域であり、だからこそドラフトは今回のリリースの興味深い部分なのであって、単なるギミックではない{{/5}}。
Gemma 4 12Bは、ワンランク上の答えです。マシンに16GB以上のメモリがあれば——ノートPCでも、ワークステーションでも、高性能なエッジサーバーでも——マルチモーダル汎用モデルを搭載でき、2B構成では得られない3つの利点があります:エンコーダーや別のパイプラインを必要としない画像・音声・ビデオ入力、リポジトリ規模やドキュメント規模の作業に対応する256Kウィンドウ、そして生まれたばかりのドラフトチェックポイントにはない成熟度です。その代わり、最小のデバイスで実行する能力を手放し、メモリフットプリントは約3倍を支払うことになります。
両者にとってのルーティングの現実
この対戦のどちらのモデルも、現時点ではホステッドカタログに含まれていません。OrcaRouterも同様です。MiniCPM5-2B-DSparkは、定義上、セルフホスト型サービングの付属品です。SGLangスタックを自分で実行し、ドラフトはローカルデプロイメント内にのみ存在します。Gemma 4 12Bはオープンウェイトなので、自前でサーブするか、既に利用可能な環境で使用します。まさにこのような状況こそ、ルーティングレイヤーが配信メカニズムではなくセーフティネットとして価値を発揮する場面です。既に運用中のワークロードに対して新しいドラフトビルドを試す際、テスト経路を自動フェイルオーバー付きの単一APIに通せば、未検証のスタックが停止しても本番環境を巻き込まずに済みます。そして、その周辺のプロバイダー掲載価格はマークアップ0%でパススルーされるため、比較対象となるホステッドモデルの価格変更は同じ日に反映されます。ただし、比較自体については、両モデルとも正直な計画は同じです。セルフホスティングしている以上、重要なベンチマークは自分のハードウェア上で実行するものです。
評決
MiniCPM5-2B-DSpark と Gemma 4 12B は、直接対決という意味での競合ではありません。どちらも同じトリックを共有するローカルAIの、異なる重量級にすぎません。デバイスが12Bモデルを扱えず、テキスト対応かつApache-2.0でエージェント指向、オンデバイスメモリに収まるモデルを求めるなら、DSparkドラフトを備えたMiniCPM5-2Bスタックを選んでください。そのドラフトは有望でコスト無しの高速化をもたらしますが、効果はまだ定量化されていないので、信頼する前に自分のSGLangビルドで測定してください。ハードウェアに余裕があり、256Kウィンドウと背後にエコシステムを持つ単一のマルチモーダルモデルを望むなら、Gemma 4 12Bを選んでください。問題はどちらのモデルが賢いかではなく、あなたのシリコンが実際にどちらをまかなえるかです。
