
MiniCPM5-2B-DSpark vs Qwen3-8B:新世代2.5Bオンデバイススタック vs オープンウェイトの主力モデル
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
どのモデル比較の裏にもハードウェアの問題が潜んでいる。MiniCPM5-2B-DSpark 対 Qwen3-8B は、その問題がベンチマークという衣装をまとった姿だ。Qwen3-8B は、アリババが2025年4月に公開したオープンウェイトの頼れる主力モデルであり、約8.2Bのデンス・パラメータ、119言語、131Kまで拡張可能な32Kのネイティブコンテキスト、ハイブリッド思考モード、そしてその背後には16か月分のコミュニティによる実証がある。MiniCPM5-2B-DSpark は、それと並べて比較できる独立したモデルではない。これは、ModelBest が2026年7月19日の WAIC で発表したデバイス上のデンス2.52Bモデル MiniCPM5-2B を高速化するために、OpenBMB が2026年9月6日に Hugging Face へひっそりと投稿した、323.8Mパラメータの DSpark ドラフトチェックポイントである。この二つを並べると、本当の問いが浮かび上がる。現在8Bで動いているワークロードを、2Bしか扱えないハードウェア上で動かすべきなのか? そして、無料のドラフトを備えた2.5Bは、移行するのに十分なのか?
短い答えは、ほとんどのワークロードではまだ「ノー」だ。しかし、その理由はサイズギャップが示唆するよりも限定的であり、8Bではまったく答えが出せない展開のクラスがひとつ存在する。この記事の定量的な内容はすべてベンダー報告によるものだ。MiniCPMの数値はModelBest自身によるもので再現されておらず、Qwen3-8Bの数値はAlibabaによるもので、コミュニティでの使用に長くさらされてきた。つまり、数字よりもラベルのほうが重要なのである。
メモリカーブ上の異なる位置にある2つのモデル
MiniCPM5-2Bは、8Bモデルの3分の1の規模を持つDense型Causal Transformerである。42層、グループ化クエリアテンション(GQA)、Apache-2.0ライセンスを特徴とし、大規模モデルではリーチできないデバイスのクラス——スマートフォン、スマートコックピット、80億の重みをメモリバスが捌ききれない小型エッジボックス——向けに構築されている。発表資料の主眼は、性能の広さそのものよりも、エージェントワークと長いコンテキスト処理に置かれており、その具体例が、ネイティブ128Kコンテキストと、自社の評価スイートで平均53.9を記録したというModelBestの主張だ。ベンダーによれば、これは2BクラスのオープンソースSOTAであり、ベンダー実施のSWE-bench Verifiedでの46.4もその実績に含まれる。この46.4は、独立した検証に耐えられれば、2Bモデルとしては驚異的な数字となる。 DSparkドラフトは、小さなDenseモデルはロードが速いが生成が遅い——トークンを1つ生成するたびに、その重み一式をメモリバス経由で引き込まなければならないため——という当然の反論に対する、スループット面での回答である。このドラフトは、ターゲットモデルに検証させるトークンを一度に最大7つ提案する。リポジトリの報告によれば、検証ステップあたりのグリーディ(貪欲)受理トークン数は、全体平均で5.52、コードでは6.11である。この数字はドラフトの品質を示すものだが、高速化効果はまだ測定されておらず、秒間トークン数の公表値もない。

上記のopenbmb/MiniCPM5-2B-DSparkカードは、9月6日にひっそりと行われたリリースの公開された全容である。つまり、受理長を報告するサービング用アクセサリであり、アナウンスもなく、実時間での高速化もない。
Qwen3-8Bは、同じアーキテクチャファミリーに属し、3倍の規模を持ち、16か月前に登場したモデルです。グループ化クエリ注意機構(GQA)を備えたDense構造の因果トランスフォーマーであり、36兆トークンの多言語コーパスでトレーニングされ、Apache-2.0ライセンスで公開されています。また、オープンウェイトの世界で最も広くセルフホスティングされ、配信されている8Bモデルの1つです。その特徴はQwen3ハイブリッド推論モード——リクエストごとに思考をオンまたはオフにできる——で、性能プロファイルは意図的に幅広く設定されています。MMLUは70点台後半、GSM8Kとコーディングの結果は優秀で、119言語に対応しています。実行には本格的なGPUまたは高性能なエッジデバイスが必要です。実用的な量子化では必要メモリは数ギガバイト程度で、ミッドレンジのカード1枚で快適に動作しますが、スマートフォンでは動作しません。

上記のQwen3-8Bに関するAlibabaのモデルカードは、既存モデルの顔である。119言語で文書化され、コミュニティでテストされた16か月分の挙動だ。
8Bがまだ勝てる領域
より軽量なモデルクラスに移行すると、具体的な3つのものを失うことになる。第一に言語対応だ。Qwen3-8Bは119言語をカバーしている。一方、MiniCPM5-2Bのモデルカードとデータセットは英語と中国語に集中しており、多言語の広がりは謳われていない。多言語のロングテールにサービスを提供するプロダクトにとって、これはソフトな壁ではなく、ハードな壁である。第二に、実績だ。Qwen3-8Bの数値は、16か月にわたって検証され、量子化され、ファインチューニングされ、大規模にサービス提供されてきた。その障害モードは既知であり、量子化版も存在し、エコシステムは至る所にある。MiniCPM5-2Bは2026年7月のリリースで、ベンダー運営のスコアボードがあるだけで、独立した再現はされておらず、ドラフトが登場してからまだ1日しか経っていない。第三に、サービングスタックだ。すでにQwen3-8Bと連携しているすべてのもの——vLLM、SGLang、llama.cpp、無数のファインチューン——は、成熟したターゲットと連携している。一方、MiniCPMドラフトは、投機的デコードエンジンのビルド(SGLangのDSPARKアルゴリズム)が必要であり、これはリポジトリには文書化されているものの、広範なエコシステムにはまだ取り込まれていない。
2Bスタックが唯一の選択肢となる場合
8Bがそもそも収まらないデバイスクラスでは、そうした話は何の意味も持たない。数ギガバイトのDRAMしか載らないスマートフォンやエッジボードでは、Qwen3-8BはMiniCPM5-2Bと競合できない——実用的な速度でのデプロイがまったく不可能なのだ。2Bスタックが存在する理由はまさにそこにあり、ドラフトが今回のリリースの添え物ではなく構造を支える柱である理由もそこにある。投機的デコードの効果が最も高いのは、小型シリコン上の小規模モデルが置かれる、まさにあの高密度・メモリ律速の領域である。コンパクトなドラフターがブロックを提案し、ターゲットがそれを1パスで検証する。そうすることで、ウェイトの読み込みコストはトークンごとではなく、ブロックごとに一度だけ支払えば済む。DeepSeek由来のDSpark手法(arXiv 2607.05147)は高並行処理の推論サーバー向けに設計されたものだが、その仕組み——そして本リポジトリに示された受理率の数値——は、制約のあるハードウェア上でインタラクティブな応答を求められる2Bモデルにとってこそ、有効なテコとなる。ただし、正直な但し書きを頭の片隅に置いておくこと。OpenBMBが測定したのはドラフトの受理率であり、高速化率ではない。つまり、あなたのターゲットデバイスで実際にトークン/秒がどれだけ向上するかを測るのは、依然としてあなた自身の仕事である。
スコアボード、正直に表示された
リリース — MiniCPM5-2B: 2026年7月19日(発表); MiniCPM5-2B-DSpark: 2026年9月6日、静かに。Qwen3-8B: 2025年4月、発表。
• サイズ — MiniCPM5-2B: 2.52Bのdense+324Mのドラフト。Qwen3-8B: 約8.2Bのdense。
• コンテキスト — MiniCPM5-2B: 128K ネイティブ。Qwen3-8B: 32K ネイティブ、YaRN 経由で 131K。
• 言語 — MiniCPM5-2B: 英語/中国語中心。Qwen3-8B: 119。
• 推論 — MiniCPM5-2B: 発表資料によると、高速モードと熟考モードのハイブリッド。Qwen3-8B: リクエストごとに思考のオン/オフを切り替え。
• 根拠 — MiniCPMの数値はModelBestのモデルカード上の主張(自社スイートでの平均53.9点、独立した実行なし)。Qwen3-8Bの数値はAlibabaの報告によるもので、16か月間コミュニティに晒されている。

上記のスコアボードは、不一致を正直に描いたものです。列は、オープンなApache-2.0ライセンスを除くほぼすべての点で異なっており、出荷先のデバイスクラスによって、どの列を選ぶことさえ許されるかが決まります。
ルーティングの現実
現在、どちらのモデルもOrcaRouterのホステッドカタログには存在しません。したがって、この比較は完全にセルフホストの世界の話ですが、まさにそこでこそルーティングレイヤーはその存在意義を発揮するのです。Qwen3-8Bはベンダーおよび複数のサードパーティ製プラットフォームで提供されています。一方、MiniCPM5-2Bとそのドラフトモデルは自前で実行するものです。チームが2.5Bスタックで8Bワークロードの一部を担えるかどうかを検証したい場合、可逆的な方法は、自動フェイルオーバー付きの単一APIを通じて、セルフホストのMiniCPM5-2B+ドラフト構成のSGLangビルドにテストパスを向けることです。本番は従来モデルに置いたまま、新しいスタックが停止しても何も巻き込まずに済み、比較全体にわたるプロバイダーのリスト価格は0%マークアップで透過的に渡されるため、このA/Bテストは賭けではなく、低コストで元に戻せます。このレイヤーはどちらのモデルもホストしません。実験を安全に実行可能にするだけです。
誰が動くべきで、誰が待つべきか
多言語が必要な場合、16か月分の既知の動作が必要な場合、または8Bを快適に扱えるハードウェア上で既に稼働しているワークロードについては、Qwen3-8Bを使い続けてください。サイズの差は移行理由にはならず、エビデンスの不足も移行に反対しています。MiniCPM5-2BスタックをそのDSparkドラフトと一緒に真剣にテストすべきなのは、対象デバイスが8Bをまったく実行できない場合か、エージェント業務や長文コンテキスト処理で遅れを取らない2.5Bがあれば、出荷済みハードウェアのメモリと電力を削減できる場合だけです。そしてドラフト採用を決める前に、OpenBMBが公開しなかった測定を行ってください。受容長はレイテンシではなく、あなたのデバイスでの毎秒トークン数の向上こそが、Hugging Face上のおとなしい小さなチェックポイントをダウンロードする価値があったかを実際に決める数字なのです。
