
MiniCPM5-2B vs Qwen 3 8B:8Bワークロードは2.5Bに移行すべきか?
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
あらゆるモデル比較の背後にはハードウェアの問いが潜んでおり、MiniCPM5-2B 対 Qwen 3 8B は、その問いがベンチマークの衣をまとった姿にほかならない。Qwen 3 8B は、Alibaba が2025年4月に公開したオープンウェイトの実用主力モデルで、約82億の高密度パラメータ、119言語、リクエストごとに思考モードのオン/オフを切り替えられるハイブリッド推論、そして16か月分のコミュニティでの実績を背後に持つ。MiniCPM5-2B は、ModelBest と OpenBMB が7月19日の世界人工知能会議で、Artificial Analysis のリーダーボードにおいて4B未満モデルで最上位にランクインしたモデルとして発表したもので、そのオープンウェイトは9月6日と7日に Hugging Face で静かに公開された。この2つを同じ土俵に引き寄せる本当の問いは、オープンな8Bモデルを運用しているほとんどのチームがどこかの時点で自問するものだ——「自分が8Bで処理しているワークロードを2.5Bに移せるだろうか? 移せたとして、何を犠牲にすることになるのか?」と。
ほとんどのワークロードに対する短い答えは、まだ「ノー」だ。しかし、その理由は4倍のサイズ差が示唆するよりも狭い範囲にあり、8Bがまったく答えを持たないデプロイ形態が一つある。以下に示す定量的な情報はすべてベンダー報告であり、そのように明記しておく。MiniCPM5-2Bの数値はModelBest自身のカードの主張で、公開から1週間しか経っておらず、ラボの外では誰も再現していない。Qwen 3 8Bの数値はAlibabaのもので、ずっと前に検証され、量子化され、大規模なコミュニティによって再実行されている。この証拠の非対称性こそが、この対決の本当の見出しである。
Qwen 3 8Bの16ヶ月
Qwen 3 8Bは、対抗モデルよりもパラメータ数が3倍多く、16か月前に登場した、同じアーキテクチャファミリーに属するモデルです。グループ化クエリ注意(GQA)を備えた高密度(dense)因果トランスフォーマーであり、約36兆トークンの多言語コーパスで事前学習され、Apache-2.0ライセンスで公開されています。オープンウェイト界隈で最も広くセルフホスト・サーブされている8Bモデルの1つです。その特徴はQwen3のハイブリッド推論モード、つまりリクエストごとに思考(thinking)をオン/オフできる点にあり、単一のデプロイメントで簡単な質問には素早く答え、数学やコードの問題には熟考を重ねる思考連鎖(chain-of-thought)へと切り替えることができます。ネイティブのModel Context Protocol(MCP)と関数呼び出しに対応し、ネイティブコンテキストは32K。AlibabaはYaRNスケーリングにより131Kまで有効であると検証しています。また、119の言語と方言をカバーしています。登場から16か月が経ち、その障害モードは文書化され、量子化版はどこにでも存在し、vLLM、SGLang、llama.cpp、数多くのファインチューニングなど、周辺のサービングスタックは成熟しています。実用的な量子化では数ギガバイト台のメモリで動作し、ミッドレンジGPU1枚で快適に稼働します。スマートフォンでは動作しません。

MiniCPM5-2Bがその世界にもたらす主張
MiniCPM5-2Bは、主流とは逆方向から登場する。設計上は小型、訓練によってエージェント型——。総パラメータ25.2億(非埋め込みは19.8億)、隠れ次元2048、42層の高密度(dense)トランスフォーマーであり、グループ化クエリ注意機構を備え、カスタムカーネルを一切使わない標準的なLlamaForCausalLMアーキテクチャを採用。出荷時の設定におけるコンテキストウィンドウは131,072トークンである(7月の発表資料では512Kを謳っていたが、実際にリリースされた設定には含まれていない)。Qwen 3 8Bが36兆トークンの多言語事前学習によってその“広さ”を獲得したのに対し、MiniCPM5-2Bは、事後訓練によってその“かたち”を獲得している。すなわち、深い思考を伴うデータ(deep-thinking data)を400Bトークン用いたSFTを実施し、続いて16体のRLエキスパートモデル(うち5体はエージェント型)を1つの小型の高密度ネットワークに折り畳むOn-Policy蒸留を適用したのである。発表時の売りは、オンデバイスのエージェント基盤——XML形式の呼び出しによるネイティブなツール呼び出し、9つのチップファミリー+ARMへのデイゼロ対応、高速/熟考モードのハイブリッド——である。モデルカードの主張によれば、開発元が選定した2B〜4B比較セットにおける内部平均は53.9、AIME 2025/2026は86.5、開発元が実施したSWE-bench Verifiedでは46.4を記録した。この46.4は、独立した検証を生き延びれば、2.5Bモデルとしては驚異的な数字だ。

不一致、次元ごとに
• リリース — MiniCPM5-2B:2026年7月19日に発表、ウェイトは9月6〜7日に公開。Qwen 3 8B:2025年4月に発表。
• サイズ — MiniCPM5-2B: 合計2.52B(非埋め込み1.98B)のdenseモデル。Qwen 3 8B: ~8.2Bのdenseモデル。
• コンテキスト — MiniCPM5-2B: 出荷時構成では131,072トークン。Qwen 3 8B: ネイティブ32K、YaRNにより131K検証済み。
• 言語 — MiniCPM5-2B:英語と中国語中心。Qwen 3 8B:119の言語と方言。
• 推論 — MiniCPM5-2B: ローンチ資料によると、高速/熟考のハイブリッドモード。Qwen 3 8B: リクエストに応じてQwen3のthinkingをオン/オフ。
{{1}}エビデンス — MiniCPM5-2B:{{/1}} ベンダーカード、独立した実行なし。{{2}}Qwen 3 8B:{{/2}} Alibaba報告、{{3}}16か月にわたるコミュニティでの再現とデプロイ。{{/3}}

上記のスコアボードは、不一致を正直に描いたものです。列は、オープンなApache-2.0ライセンスを除くほぼすべての点で異なっており、出荷先のデバイスクラスによって、どの列を選ぶことさえ許されるかが決まります。
8Bがまだ勝てる領域
モデルクラスをひとつ下げると、具体的な3つのものを手放すことになる。まず言語だ。Qwen 3 8Bは119言語をカバーする。一方、MiniCPM5-2Bのカードとデータは英語と中国語を中心としており、多言語の広がりは謳われていない。言語のロングテールに応えるプロダクトにとって、これは柔らかい壁ではなく、硬い壁である。第二に、実績だ。16ヶ月にわたるコミュニティテストにより、Qwen 3 8Bの挙動はよく知られ、そのエコシステムはどこにでも存在する。一方、MiniCPM5-2Bは生後1週間のリポジトリで、カードは未検証のままである。そしてその目玉の数値は、独立した実行に耐えられなければ、まさに静かに修正される類の数字だ。第三に、サービングスタックである。すでにQwen 3 8Bとやり取りしているものはすべて、成熟した対象とやり取りしていることになる。一方、まったく新しい2Bクラスのチェックポイントは、量子化、サービング設定、ツール呼び出しの挙動をゼロから再検証することを意味する。これらのいずれも、2Bが特定のベンチマークで勝てない理由ではない。8Bが収まる場所ならどこでも、8Bの方がリスクの低いデフォルトである理由なのである。
2Bだけが唯一の答えである場所
そうしたことはすべて、8Bがそもそも収まらないデバイスクラスでは意味を持ちません。数ギガバイトのDRAMしかないスマートフォンやスマートコックピットボード、小型エッジボックスでは、Qwen 3 8BはMiniCPM5-2Bと競合することすらありません。実用的な速度ではまったくデプロイできないからです。2Bが存在する理由はまさにそこにあり、したがってこの対決を正直に組み立てるなら、問いは「2Bは8Bと同じくらい優れているのか」ではなく、「自分のデプロイのうち、どちらか一方にしか対応できないのはどれか」です。80億の重みでメモリバスが詰まるようなオンデバイスエージェントを出荷するのであれば、MiniCPM5-2Bは、入手可能な2Bクラスの選択肢の中でも最も積極的にトレーニングされたものの一つであり、問う価値のある唯一の疑問は、そのエージェント能力に関する主張があなた自身による再現を生き延びるかどうかです。ワークロードがすでに8Bを余裕で載せられるハードウェアで動いているなら、サイズの差だけでは移行の理由になりません。むしろエビデンスのギャップが移行に反対しています。
もし切り替えをお考えなら
この切り替えをテストする安全な方法は、移行ではなく実験として扱うことです。自社ハードウェア上でMiniCPM5-2Bを運用し、自動フェイルオーバー付きの単一API経由で実際のトラフィックの一部をそこに流し、同じリクエストで8Bと比較測定します。ここでルーティング層が存在価値を発揮するのは、1週間前に作成されたチェックポイントがストールやループを起こしても、本番環境を停止させずにすむからです。また、比較対象となるホステッドモデルに関しては、プロバイダーのリスト価格が0%のマークアップでそのまま透過されます。実際に検証しているのは次の3点です。2Bの精度が自社データで維持されるか、自社のデバイスクラスにおける2Bのレイテンシが、購入を検討しているハードウェア上の8Bを上回るか、そして英語-中国語の言語プロファイルが実際に抱えているユーザーをカバーしているかです。最初にSWE-benchか自社評価セットの一部を再現してください。それに費やす2時間は、この比較が提供する中で最も安価な保険です。
評決
多言語対応、16か月分の既知の動作が必要なもの、あるいは8Bを快適に載せられるハードウェア上で既に稼働しているワークロードには、Qwen 3 8Bを使い続けてください。MiniCPM5-2Bを真剣にテストすべきなのは、対象デバイスが8Bをまったく扱えない場合か、あるいはエージェント型処理や長文コンテキスト処理で互角に渡り合える2.5Bがあれば、現在出荷中のハードウェアでメモリと消費電力を削減できるという場合だけです。サブ4Bランキングの首位は確かな功績であり、オープンウェイトで公開されたことで今日からテスト可能ですが、入手可能な証拠に照らすと、それはまだ、すでに実績を積んだ8Bの主力モデルを引退させる理由にはなりません。
