
MiniCPM5-2B-DSpark:OpenBMB、速度重視のドラフトモデルを備えたMiniCPM5-2Bの重みをひっそりと公開
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
6週間前、MiniCPM5-2Bは約束にすぎなかった。2026-07-19に上海で開催されたWAICカンファレンスで、Artificial Analysis Indexのトップに立つsub-4Bモデルとして発表された際、オープンウェイトが「間もなく」公開されるというロードマップのメモが添えられていた。そして今週、その「間もなく」が何の喧伝もなく訪れた。2026-09-06、OpenBMBはApache-2.0ライセンスの下で主力モデルMiniCPM5-2BのリポジトリをHugging Faceに公開し、その21分後にはMiniCPM5-2B-DSparkも公開した。これは3億2380万パラメータのドラフトチェックポイントであり、その唯一の役割はDSpark投機的デコーディングアルゴリズムの下でMiniCPM5-2Bのデコードを高速化することだ。2026-09-07にはGPTQビルドも続いた。本稿執筆時点では、発表もローンチ告知も、見つけられる限りのチェンジログの記載も存在しない。このリリースは、11日間にわたってリポジトリが静かに公開されるかたちで表面化した。
これは現時点で判明していることをまとめた記事であり、その枠組みが重要です。MiniCPM5-2B-DSparkは、単体のチャットボットでも新たなフラッグシップモデルでもありません。これはアクセラレータ、すなわちMiniCPM5-2Bに先駆けてトークンを提案し、その後MiniCPM5-2Bが並行して検証する、小型で高速なモデルです。対象となるモデルなしでは役に立たず、その対象こそが注目すべき理由です。OpenBMBが7月に約束したMiniCPM5-2Bのオープンウェイト版リリースが、現在実際にHugging Face上にあります。そして、それと一緒に提供されているドラフトモデルは、ベンダーが実用的な速度で実行するために推奨する仕組みです。以下の記事で明示的に引用されていない内容は、すべて2つのモデルカードとそのリポジトリから直接読み取ったものです。
何がリリースされたのか、そしていつか
2Bファミリーは、予告なしのローリングドロップとして公開され、新しいエントリーから順に表示されます:
• 2026-08-27 — MiniCPM5-2B-BaseとMiniCPM5-2B-SFTが登場。生の事前学習済みおよび教師ありファインチューニング済みチェックポイントです。
• 2026-09-01 — MiniCPM5-2B-Midtrain、エージェント型中間トレーニング段階。
• 2026-09-05 — MiniCPM5-2B-MLX と MiniCPM5-2B-GGUF(Apple-Silicon 用と llama.cpp 用のフォーマット)
• 2026-09-06 — フラッグシップのMiniCPM5-2Bリポジトリ、その21分後にMiniCPM5-2B-DSpark。
• 2026-09-07 — MiniCPM5-2B-GPTQ、量子化されたサービング形式。
これらはすべて、ModelBest が5月に MiniCPM5-1B ファミリー向けに使用した Apache-2.0 ライセンスを保持しており、このシーケンス内の初期チェックポイントは、今もなおコミュニティからの反響が実質ゼロです。それぞれのダウンロード数や「いいね」の数もごくわずかです。これは、計画的なローンチではなく、進行中のウェイト公開の兆候です。アーティファクトは依存関係の順序で公開されており(まずベースとSFT、最後に量子化済みおよびドラフト形式)、どの特定の日もリリース日として機能していません。
MiniCPM5-2B-DSparkの正体
投機的デコーディングは、生成を低コストの提案器と高コストの検証器に分割します。小さなドラフトモデルが次の数トークンを推測し、大きなモデルが1回のフォワードパスでその推測をすべて検証し、自身が同意したものを採用します。ドラフトのキャリブレーションが適切であれば、大きなモデルの出力をわずかなコストで得られます。推測が外れた場合も、検証ステップを1回無駄にするだけです。DSparkは、2026年7月6日に投稿された論文(arXiv 2607.05147、タイトルは"Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation")で示された、このアイデアを具体化する手法です。この手法を特徴づける設計上の選択は2つあります。1つは、並列的なドラフターバックボーンと軽量な逐次モジュールを組み合わせることで、提案ブロック内のトークン同士が互いに依存するようにし、ブロックの終端に向かって精度が低下するのを防ぐことです。もう1つは、常に固定長ブロックを検証するのではなく、信頼度の推定値とエンジンのスループットに基づいて、リクエストごとに各検証実行のサイズを決定することです。
OpenBMBが公開したDSparkドラフトは、BF16で323.8Mパラメータ(約648MB)の5層Transformerです。これはQwen3アーキテクチャファミリーに属しつつ、DSpark固有の追加要素を備えています:MiniCPM5-2Bの隠れ状態をターゲットの5つのレイヤー(1、10、20、30、39)から読み取るプロジェクタ、信頼度ヘッド、そして次のトークン分布をモデル化する小さなマルコフヘッドです。その構成では、1回のフォワードパスあたり7トークンのブロックを提案しています。およそMiniCPM5-2Bの2.5Bパラメータの8分の1の規模であり、メインストリームのオープンチェックポイント向けに公開されたドラフトモデルの中でも最小級の一つです——これこそがエッジ指向モデルにおける要点であり、ドラフトモデルは、1つのデバイスで2つのモデルを動かしても1つだけで動かす場合に勝るだけの十分な低コストが求められるのです。

上記のリポジトリは、ドラフトモデルの公開情報の全体です。すなわち、README、設定ファイル、単一のsafetensorsファイル、およびモデルカードで構成されています。モデルカードのトレーニング説明によると、MiniCPM5-2Bによって一般・数学・コードのプロンプトから生成された1,959,525シーケンス(70.5億トークン)を使用し、クロスエントロピー、L1、および信頼度の目的関数を組み合わせて6エポック訓練されています。このチェックポイントは、単体で生成モデルとして使用されることはありません。
OpenBMBが発表した数字は、正直に表示されている
ドラフトモデルのカードには、重要な数値が1つ報告されている——受理長、すなわち対象モデルが各7トークンブロックのうち受け入れる提案トークンの平均数である。評価はMiniCPM5-2Bの出力に対し、3つのドメインにわたり、最大4,096生成トークンまで実施された:
• Math — グリーディー(T=0)で平均6.05トークンが受理され、T=1.0サンプリングでは4.61。
• Code — グリーディ法: 6.11、サンプリング法: 4.44
• 一般 — 4.16(グリーディ)、3.10(サンプリング)
• 総合 — グリーディ法5.52、サンプリング法4.05(最大7点中)
Those figures are vendor-reported from the model card and have not been independently reproduced. They also describe the draft's hit rate, not a wall-clock speedup: speed is a serving measurement that depends on what the target's verification pass costs against the draft's proposal pass, on batch occupancy, and on DSpark's confidence scheduler trimming verification length. OpenBMB published no tokens-per-second number for the pair. For a sense of where the method's ceiling sits, the DSpark paper reports 60–85% faster per-user generation at matched throughput versus the MTP-1 baseline in DeepSeek's live serving system — a useful reference point for what the algorithm has done elsewhere, not a claim about MiniCPM5-2B on your hardware. これらの数値はモデルカードにおけるベンダー報告値であり、第三者による独立した再現は行われていません。また、これらが示すのはドラフトのヒット率であり、実時間での高速化率ではありません。速度はサービング環境での測定値であり、検証パスがドラフトの提案パスに対してどれだけコストを要するか、バッチ占有率、そしてDSparkの信頼度スケジューラが検証長をどの程度削るかに依存します。OpenBMBはこの組み合わせについてトークン/秒の数値を公表していません。本手法の上限がどこにあるかを把握するための参考として、DSpark論文では、DeepSeekの本番サービングシステムにおけるMTP-1ベースラインと比較して、同一スループット時にユーザーあたりの生成が60〜85%高速だったと報告されています。これは、このアルゴリズムが他環境でどのような成果を挙げたかを示す有用な参照点であり、お使いのハードウェア上のMiniCPM5-2Bに関する主張ではありません。

上記のスコアボードはリリース自身の仕様シートです。受理値はドラフトのヒット率として解釈してください。実際のスループットに対する倍率は、独立したSGLang実行がまだ測定すべきものです。
草案が加速するモデル
MiniCPM5-2Bは、高密度(dense)2.5BパラメータのTransformer(合計2,516,756,480パラメータ)で、42レイヤー、16クエリヘッド、2 KVヘッド、130,560トークンの語彙、131,072トークンのコンテキストウィンドウを備え、BF16で約5GBです。アーキテクチャ的には意図的に目新しさを排しており、カスタムカーネルもモデルコードのフォークもない標準的なLlamaForCausalLMです。それがまさに、これほど多くのランタイムやチップターゲットに移植できる理由です。OpenBMB社内のベンチマークスイートでは、モデルカード上で推論、指示追従、知識、ロングコンテキスト、ツール使用、コーディング、検索エージェントタスクの平均が53.9とされており、同じ表のQwen3.5-4B(51.1)やgranite-4.2-3B(42.7)を上回っています。ただし、いくつかのセル(GPQA-Diamond 70.2、HLE 8.9、および各種ロングコンテキスト・エージェント系の行)は社内で再現されたものではなく、Artificial Analysis由来とフラグされています。主要なタスク別スコアには、MATH-500が94.6、AIME 2025および2026が86.5、IFEvalが86.7、MMLU-Proが70.8、SWE-bench Verifiedが46.4などがあります。これらはベンダーが自社スイートで計測した数値であり、モデルカードには一部の行が第三者ソース由来であることが明記されています。その混在を踏まえて解釈してください。

7月のお披露目時、ModelBestの発表資料にはArtificial Analysis Index 17が引用されており(4Bパラメータ未満のモデルの中で首位)、7月の報道は512Kトークンのウィンドウに言及していた。しかし実際に出荷されたチェックポイントは、131,072トークンのコンテキストを構成している。発表当日のマーケティング上の数値と出荷済みの構成が一致しない場合、何を実行できるかを決めるのは構成側の数値であり、そのギャップは、マーケティング上の数値に基づいて長いコンテキストのワークロードを計画する前に把握しておく価値がある。
MiniCPM5-2B をドラフト付きで実行
意図された経路はSGLangです。SGLangは、モデルカードが要求するバージョン下限であるv0.5.16以降、上流でDSparkアルゴリズムをサポートしています。カード記載の完全なサーブコマンドは次のとおりです:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
グリーディーデコーディング(T=0)では、DSparkの検証はロスレスです。出力はMiniCPM5-2B単体でのサーブと同一であり、そのためドラフトは純粋にレイテンシ削減のためのものとなります。サンプリングを有効にすると、SGLangのDSparkはデフォルトでターゲットのみのサンプリングを使用し、オプションでリジェクションサンプリングにも対応します。OpenBMBはまた、ターゲットを単独で動作させる場合の通常のTransformers読み込み(transformers ≥ 5.6)とvLLM ≥ 0.21でのサーブを文書化しており、さらにエージェント型ワークロード向けのminicpm5ツール呼び出しパーサーも提供しています。DSPARKの投機的パスは、具体的にはSGLangのものです。
ハードウェアの演算量こそが、エッジクラスのペアにとっての本題です。MiniCPM5-2BはBF16で約5GB、ドラフトは約0.65GBです。ドラフト+ターゲットの組み合わせは、2Bモデル単体がすでに動作可能だったあらゆる環境に余裕を持って収まります。これこそが、より大きな2つ目のモデルではなく、これほど小さなドラフトを出荷する理由のすべてなのです。
何が確認されていないのですか
• 私たちが見つけられる限り、発表は存在しない — OpenBMBやModelBestのブログも、英語や中国語のソーシャル投稿もない。「静かにリリースされた」という表現は文字通りの意味であり、唯一の公開窓口はHugging Faceのコレクションだ。
• 独立した評価はありません。本ドラフトの受理長(acceptance lengths)および MiniCPM5-2B のスイート平均 53.9 はベンダー報告によるものであり、第三者による再現はされていません。AAフラグ付きセルは第三者によるスナップショット値ですが、これらの正確な重みを用いた実行結果ではありません。
• ホスト型APIはどこにも見つからないため、現時点で採用するにはチェックポイントを自分で実行する必要がある。7月の発表取材で約束されたModelScopeミラーは、執筆時点では確認できなかった。
{{1}}DSPARKペアについては、ウォールクロック時間での高速化数値が示されていない。{{/1}}{{2}}受け入れ長5.52は高いヒット率を示しているものの、特定のGPU上で「何倍高速か」という数値こそが、OpenBMBが公表しなかった点である。{{/2}}
• 上記のコンテキストウィンドウのあいまいさ:マーケティング資料では512Kとされていたが、出荷時の設定は131,072であり、リポジトリ内にはこの両者の隔たりを埋めるものは何もない。
控えめなオープンウェイト・リリースがスタック内のどこに位置するか
今日のMiniCPM5-2Bを率直に評価するなら、それは賭けである:ベンダー発表の好成績はあるが、独立した実行実績はゼロ、サービスの運用履歴もなく、実環境での高速化が未測定のドラフトモデルだ。まさにそうした状況のために、ルーティングレイヤーは存在する。すでに呼び出しているホスト型モデルを、小規模なオープンモデルの出力が置き換えられるかテストしたいチームは、その比較を単一のAPIから実行できる。OrcaRouterは200以上のホスト型モデルをプロバイダーの定価で仲介し、マークアップなしだから、評価週間の立ち上げコストはゼロだ。さらに自動フェイルオーバーにより、作成から数日しか経っていないチェックポイントが、実績を証明するまでの間、本番パスを人質に取る必要はない。そのいずれもMiniCPM5-2Bをどこかにホストする必要はない。MiniCPM5-2Bは、自己ホスト型の2BがGPUに見合う価値があるかを判断する間、すでに依存しているモデルを保護するセーフティネットなのである。
重要度の順に注目してください。つまり、ペアの実トークン/秒を報告する独立したSGLang DSPARK実行(受理長はベンチマークではなく代理指標にすぎないため)、リリースが最終版であることを確認する正式なアナウンスまたはModelScopeミラー、そしてMiniCPM5-2Bを取り扱うホスティングプロバイダーの3つです。もし取り扱うプロバイダーが現れた場合、当社経由でお支払いいただく価格は、その日のプロバイダー自身のリスト価格です。それがパススルーの意味だからです。それまでの間、2つのうちでより興味深い成果物はドラフトモデルのほうです。ターゲットが7トークン中5.5トークンを受理する5層のプロポーザーは、小さなエッジモデルが「小ささを感じさせる」ものになるのか、それとも同じデバイス上でより大きなモデルが動いているかのように感じさせるものになるのか、その違いを生みます。
