
MiniCPM5-2B vs Granite 4.2 3B:3B推論スペシャリスト vs 新型2.5Bエージェントスタック
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBestは、誰に頼まれるでもなく、Granite 4.2 3BをMiniCPM5-2B自身のスコアボードに載せた。重みがHugging Face上でひっそり公開された際にOpenBMBが発行したMiniCPM5-2Bのモデルカードには、比較ベースラインとしてIBM最小の推論モデルが掲載されており、そのスイート上でMiniCPM5-2Bは平均53.9、Granite 4.2 3Bは42.7を示している。この組み合わせについて両ベンダーが公表している直接対決の数値はこれだけであり、したがってここが自然な出発点——そして注意を要する場所でもある。両モデルはどちらも小型で、Apache-2.0ライセンス、セルフホスト型のオープンウェイト公開であり、同じ2026年後半の役割を狙っている。ただ、そのアプローチは正反対で、一方は推論するよう訓練され、もう一方は行動するよう訓練されている。
この2つのリリースは、各ベンダーのマーケティングが示唆する以上に似ている。MiniCPM5-2Bは、7月19日の世界人工知能会議で、ModelBestとOpenBMBのオンデバイス向けフラッグシップとして発表された。2Bクラスのデンスモデルであり、スマートフォン、PC、スマートコックピット向けのエージェント基盤と位置づけられている。そのウェイトは9月6日と7日に、ローンチイベントもなしにApache-2.0の下で公開され、GGUF、MLX、GPTQ、ベース、SFT、ドラフトの各チェックポイントと、それらの背後にあるトレーニングデータも併せて登場した。Granite 4.2 3Bは、IBMのノートPC向け推論モデルで、そのウェイトは8月上旬にHugging Faceで公開され、モデルカードと技術ブログは8月25日に発信された。どちらもまだ独立したベンチマークにはかけられていないため、以下のソーシングラベルが数字よりも重要なのである。
韻を踏む二つのリリース
Granite 4.2 3B は、Granite-4.1-3B-Base からポストトレーニングされた、スタンドアロンの高密度(dense)推論モデルです。40層と grouped-query attention(GQA)を備え、128K のネイティブコンテキストを IBM が第5段階の事前学習で512K に拡張しています。また、クエリごとに3つの思考モード(デフォルトのフル思考、低負荷モード、非思考経路)が用意されています。モデルカードには、このモデルが「何ではないか」が明確に記載されています。8B および30B の Granite 4.2 兄弟モデルとは異なり、3B は SWE-agent、ターミナル、検索環境で訓練された特化型エージェント強化学習ブロックを意図的に省略したため、IBM は SWE-bench の結果を掲載せず、このモデルをエージェントではなく推論特化モデルと位置づけています。vLLM、SGLang、Transformers、GGUF、Ollama(granite4.2:3b)で利用でき、bfloat16 ではおよそ6〜8GB、量子化では2GB未満で動作し、ホスト型 API は提供されていません。主要スコア(AIME 2025:78.33、GPQA:54.80、LiveCodeBench v6:69.71、MMLU-Pro:67.84)は IBM の報告によるもので、現時点では第三者による再現はされていません。

MiniCPM5-2Bは、完成されたエージェント指向モデルである。モデルカードには、総パラメータ数2.52B(非埋め込みパラメータ1.98B)の高密度トランスフォーマー、隠れ層サイズ2048・42層、16個のクエリヘッドと2個のKVヘッドを備えたグループ化クエリ注意機構、カスタムカーネルを必要としない標準的なLlamaForCausalLMアーキテクチャが記載されている。発表時の売りはエージェント能力にあり、200B規模のエージェント中間トレーニング、大規模なエージェントSFTデータセット、エージェントRLアライメントを経て、16個のRLエキスパートモデルを単一の小型高密度ネットワークに融合するオン方策蒸留(On-Policy Distillation)で仕上げるとされた。さらに、ネイティブな長文脈対応と、高速応答モードと熟慮応答モードのハイブリッドも謳われている。出荷時の設定ではコンテキストウィンドウは131,072トークン(7月の資料では512Kと宣伝されていたが、リリース版の設定には含まれていない)で、カードには組み込みのSGLangパーサーによるXML形式のツール呼び出し対応と記載されている。独自の評価表では、ベンダーが選定した比較セット全体での内部平均53.9、AIME 2025/2026で86.5、MATH-500で94.6、SWE-bench Verifiedではベンダー実行による46.4を報告しており、この46.4は独立した検証を経れば2.5Bの高密度モデルとしては驚異的な数字となるだろう。

誰かがすでに印刷した直接対決
クロスベンダーのスコアボードは、ほとんどがリンゴとオレンジを比べるようなものなので、この対決で最も実用的な資料は、ModelBest自身が公開したもの、すなわちMiniCPM5-2Bのカードである。MiniCPM5-2Bのカードには、ベースラインとしてgranite-4.2-3Bが挙げられ、そのスイートでMiniCPM5-2Bが平均53.9、Graniteが平均42.7だったと報告されている。これを、それが実際に何であるかとして正確に読むべきだ——つまり、あるベンダーが自ら選んだ一つのスイートで両モデルを実行し、再現もされておらず、自社モデルを勝たせるあらゆる動機がある中での数字だ。それは判定ではない。この数字が示すのは、ModelBestが競合他社の3Bモデルを自社のカードに載せるだけの自信を持っていたこと、そして同社が主張する差が最も大きいのは、まさに同社のトレーニングが投資した領域、すなわちエージェント系とロングコンテキストの行だということだ。これは方向性を示す主張として扱い、それに基づいて何かを判断する前に、IBM自身が別途公開しているカードの主張も比較考量すべきだ。
スコアボード、正直に表示された
• リリース — MiniCPM5-2B:2026年7月19日発表。重みは9月6〜7日に静かに公開。Granite 4.2 3B:重みは8月初旬に公開、モデルカードと技術ブログは2026年8月25日。
• 役割 — MiniCPM5-2B:ModelBestによると、オンデバイスエージェントとツール使用を重視。Granite 4.2 3B:IBMによると、推論特化型であり、意図的にエージェント的ではない。
• サイズ — MiniCPM5-2B: 合計2.52B / 非埋め込み1.98B、42レイヤー。Granite 4.2 3B: デンス約3B、40レイヤー。
MiniCPM5-2B:出荷時設定で131,072トークン。Granite 4.2 3B:ネイティブ128K、512Kまで拡張可能。
• ポストトレーニング — MiniCPM5-2B: 深層思考SFT、特化型RL、オンポリシー蒸留。Granite 4.2 3B: 推論SFT、GRPO RLおよびRLHF。エージェンティックRLブロックなし。
• 証拠 — MiniCPM5-2B: ModelBestのカードの主張であり、独立した実行はなし。Granite 4.2 3B: IBMのカードの主張であり、未再現。AIME 2025 78.33、GPQA 54.80、LiveCodeBench v6 69.71。

上のスコアボードは、本文と同じ出典に基づいています。そこに載っているすべての数字はベンダーが報告したものであり、どちらかのベンダーが公開した同一スイート内での比較は、ModelBest自身のカードに記載されているものだけです。
推論スペシャリスト vs エージェントスタック
スコアを見る前に、自分のワークロードに必要な小規模モデルの種類を決めておこう。この2つは異なる問いに答えているからだ。Granite 4.2 3Bは、制約のあるハードウェア上での推論と長いコンテキスト処理向けに作られている。512Kまで拡張可能な128Kのネイティブコンテキストウィンドウ、3つの思考モード、ノートPCに収まるフットプリント、そしてエージェント型トレーニングをあえて見送るという明確な判断を備える。仕事が長文ドキュメントの分析、リポジトリ規模のコンテキスト処理、小型マシン上での信頼できる多段階推論であれば、それは理にかなった選択だ。IBMが3Bにエージェント型の能力を謳わなかったのは、モデルカードの欠落ではなく、むしろそのカードを信頼する理由だ。MiniCPM5-2Bは、その正反対の重点で作られている。デバイス上でのエージェント型の振る舞いとツール使用だ。そのトレーニングパイプラインは、Granite 4.2 3Bが意図的に除外した項目のリストのように読める。あなたの仕事が、ツールを呼び出し、長い会話を維持し、高速な応答と熟考した応答を切り替えるオンデバイスのエージェントループなら、そのスタックこそがあなた向けだ。ただし、そこには、公開から1週間しか経っておらず、モデルカードも未検証のチェックポイントという、追加の不確実性が伴う。
OpenBMBが公開したデータ、IBMは公開しなかった
最も華やかさに欠ける違いこそ、ファインチューニングをしたいチームにとっては最も重要だ。OpenBMBはMiniCPM5-2Bのトレーニングコーパスを重みとともに公開した。UltraDataファミリー — Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math、そしてエージェント向けSFT・RLセット — はすべてApache-2.0ライセンスである。これにより、2Bモデルはブラックボックスから再現可能なレシピへと変わる。エージェント型ポストトレーニングが何に基づいて構築されたのかを確認でき、自社のドメインでそれを続行することもできる。IBMはGranite 4.2 3Bの重みをオープンソース化し、その構築方法について詳細な技術的説明を行ったが、トレーニングデータは公開していない。モデルをレンタルするのではなく所有したい組織にとって、この非対称性は現実のものだ。さらにMiniCPM5-2Bには、このサイズ帯ではGraniteが及ばないデプロイメント面での強みがある。ModelBestのFlagOSコミュニティを通じて、Huawei AscendからNVIDIA、さまざまな国産アクセラレータ、さらにARMまで、9つのチップファミリーへのデイゼロ対応が提供されている。これはModelBestが2BモデルをNVIDIA GPU以外の環境でも動作させることを想定していることの表れだ。
ルーティングの現実
どちらのモデルも現在ホステッドカタログには載っていないため、この比較はセルフホスト環境で行われます——しかし、まさにそここそが、ルーティングレイヤーが配信メカニズムではなくセーフティネットとして価値を発揮する場面です。チームが、既に運用中のワークロードに対して、1週間前に生まれたエージェント型2Bを推論型3Bと比較試験したい場合、元に戻せる施策とは、1つのAPIを経由して自動フェイルオーバー付きでセルフホストのMiniCPM5-2Bビルドにテスト経路を向けつつ、本番環境は実績のあるモデルに据え置くことです——新しいスタックが停止しても何も巻き込まずに済み、比較対象となるホステッドモデル周りのプロバイダーリスト価格は0%マークアップで素通しされるため、A/Bテストは低コストに保たれます。このレイヤーはどちらのモデルもホストしません。ただ、実験を安全に実行し、簡単に元に戻せるようにするだけです。
実際に実行すべき小さなモデルはどれか
ノートパソコン級のマシンで長文脈推論を行うワークロードがあり、3つの思考モード、512Kの上限、そして3Bがトレーニングされていないことを正確に示す正直なカードが欲しいなら、Granite 4.2 3Bを実行してください。ワークロードがインタラクティブなツール呼び出し型オンデバイスエージェントで、2.5Bがメモリ予算に収まるならMiniCPM5-2Bを実行してください。ただし、その見出しの数値を信頼する前に再現する時間を確保してください。53.9の平均と46.4のSWE-benchの主張はベンダーのものであり、まだ他の誰のものでもないからです。この対決をどの意見よりも早く決着させるものは2つあります。MiniCPM5-2Bの独立した実行によってエージェントの主張が確認されるか覆されるか、そしてIBMの推論数値がコミュニティによる再現を生き残ることです。それらのいずれかが実現するまで、Granite 4.2 3Bは今日のより安全で文書化が充実した小規模モデルであり、MiniCPM5-2Bはより興味深い賭けです。
