「Kolibri vs MiniCPM5 2B」と大きく太字で記されたヒーロータイトルカード。その下に、小さめの一行で「サーバー級モデル 対 オンデバイスエージェント」。さらに、横並びの2つの小さなフラットラインアイコン——左はハチドリ、右は小さなモバイルチップの輪郭——を細い縦の区切り線で隔て、白背景に柔らかなブルーとシアンのグラデーションアクセント、右下隅にOrcaRouterロゴを配置。
Guides & Insights

Kolibri 対 MiniCPM5-2B:780億パラメータ 対 25億、そして小さい方が安価な選択肢ではない理由

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

並べてKolibri隣にMiniCPM5-2B誰もが反射的にこれはサイズ比較の話であり、25億パラメータのモデルのほうが経済的な選択なのだと読む。その読み方は、示唆に富む形で間違っている。Kolibri は Aleph Alpha の781億パラメータの Mixture-of-Experts モデルで、2026年10月3日に公開され、1トークンあたり34.6億パラメータを活性化し、FP8 でのフットプリントは約78GB、最小のサービング構成は A100 80GB カード2枚である。MiniCPM5-2B は ModelBest と OpenBMB による25.2億パラメータのデンスモデルで、2026年7月19日に世界人工知能大会で発表され、重みは9月6日に Hugging Face に公開された。パラメータ数では MiniCPM5-2B のほうが31分の1小さい。そして、信頼する前に評価のための予算を確保しなければならないほうでもある。なぜなら、最もよく引用される数値はベンダーが実施したもので再現されておらず、これは「小さいモデル」がリスクについて通常含意するものの、まさに正反対だからだ。

どちらも静かにリリースされたが、最近リリースされたのはそのうちの1つだけだ

両者は似たような成り立ちを持ちながら、年齢は大きく異なっており、その年齢が重要な意味を持つ。Aleph AlphaのKolibri向けリポジトリは2026年10月2日に作成され、公表されたリリース日は10月3日で、ベンダー自身のニュースルーム発表はその朝、ドイツ再統一の日に出された。一般のAI専門メディアは当日ほとんどこれを報じず、そこから「静かなリリース」という見方が生まれたが、モデルカード、テクニカルレポート、ベンダーの投稿は、無言のリリースではない。MiniCPM5-2Bは本当に静かだった。7月のWAICでの発表は、ピッチと仕様をカンファレンスで披露するものにすぎず、実際の重みが登場したのは9月6日になってからで、ローンチイベントもなく、GGUF、MLX、GPTQ、base、SFT、draftのチェックポイントと、その背後にある学習コーパス群とともに公開された。

発表と重みの公開の間にある5週間の隔たりは覚えておく価値がある。それが、このモデルについて2組の異なる数字が出回っている理由だからだ。7月の資料は512Kトークンのコンテキストウィンドウを謳っていた。出荷された設定では131,072になっている。実際にリリースされた成果物こそが重要だ。

各モデルが実際に何のためにあるのか

Kolibriはドイツ語と英語の文書処理向けに作られており、Aleph Alphaは、それが本格的なエンジニアリングを要した理由について異例なほど具体的に説明している。小規模なプロキシモデル実験では、訓練データの混合にドイツ語をおよそ20パーセント含める目標が設定され、20兆トークンの実行では、ドイツ語トークンを4兆個見つけることを意味していた。重複排除とフィルタリングを施した公開ドイツ語データセットから得られたのは3900億個で、桁が一つ足りなかった。そこで研究所はCommon Crawlのフィルターをドイツ語専用に再調整し、1.3兆個のユニークなオーガニックトークンを生成するとともに、既存のドイツ語文書を百科事典の項目、対話、一節へと言い換えてさらに約1兆個を生み出し、これが最大の単一ドイツ語ソースとなった。前身のKolibri Originで用いられていた翻訳は、Kolibriでは採用されなかった。覚えておくべきなのはフィルターの詳細である。標準的な言語データパイプラインは、長すぎる語が多すぎる文書を破棄する。そしてドイツ語の行政文書は、平均語長に関する英語の上限を日常的に超えているため、デフォルト設定は、行政機関が用いる文体を静かに削除してしまう。

MiniCPM5-2Bは正反対の目的——オンデバイスエージェント——のために作られました。カードには、総パラメータ25.2億、非埋め込みパラメータ19.8億の密なTransformer、隠れサイズ2048で42層、16個のクエリヘッドと2個のKVヘッドを持つグループ化クエリ注意、そしてカスタムカーネルを使わない標準的なLlamaForCausalLMアーキテクチャが記述されています。学習パイプラインはエージェント寄りです。2000億規模のエージェント中間学習、大規模なエージェントSFTセット、エージェントRLアラインメント、そして16個のRLエキスパートモデルを1つの小さな密なネットワークに畳み込む最終段階のOn-Policy Distillationです。組み込みのSGLangパーサーとともにXML形式のツール呼び出しを提供し、公開された設定では131,072トークンのウィンドウを設定しています。

• パラメータ — Kolibri: 合計78,103,074,560、アクティブ3,457,573,120、スパース性22.6:1。MiniCPM5-2B: 合計2,516,756,480、非埋め込み1.98B、密。

• リリース — Kolibri: 2026年10月3日。MiniCPM5-2B: 2026年7月19日発表、2026年9月6日ウェイト公開。

• コンテキスト — Kolibri: 16,384 は学習済み、65,536 は中間学習、262,144 はネイティブ、1,048,576 は検証済み。MiniCPM5-2B: 出荷構成では 131,072。7月の 512K という主張はそこには含まれていない。

• フットプリント — Kolibri:FP8で約78 GB。最低でもA100 80 GBが2台、H100 SXM5が2台、H200が1台、B200またはB300が1台。MiniCPM5-2B:単一のBF16シャード、ラップトップクラス。

• 言語 — Kolibri:設計上、ドイツ語と英語のみで、それ以外はありません。MiniCPM5-2B:英語と中国語で、公開されている評価スイートはすべて英語です。

• ツール呼び出し — Kolibri: 同梱の vLLM パーサーを備えた Hermes 形式。MiniCPM5-2B: SGLang パーサーを備えた XML 形式。

ライセンス — どちらも Apache 2.0、どちらもacceptable-use rider(許容利用に関する追加条項)なし。

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

スコアボードと、その背景にあるソーシング

この組み合わせについての直接対決の数値は、どちらのベンダーの資料にもどこにも存在せず、異なる2つのハーネスから数値を組み立ててそれを比較と呼ぶつもりもない。それぞれの側が公表している内容は、慎重に切り分ける価値がある。2組の数値が携える裏付けの量は、大きく異なるからだ。

Kolibriの数値は、Aleph Alpha自身の14モデル比較表に由来し、Kolibriを推論エフォートhighで単一のハーネス上で実行したもので、英語平均75.5、ドイツ語平均70.8だった。その表は対象をよく見せているわけではない——Qwen3.8 27Bは同じ2つの平均で80.2と79.9を記録し、GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified、および両方の長文脈ベンチマークでリードし、一方でKolibriのパラメータのおよそ8分の1しか活性化しない。その差に対するベンダーの位置づけは、品質対GPUあたり毎秒デコードトークンのパレートフロンティアであり、比較したどのモデルもそれを上回らない。それは能力の議論ではなくサービング経済性の議論であり、第三者による測定はない。KolibriのArtificial Analysisエントリはなく、ハーネスの再現もない。

MiniCPM5-2Bの数値は自身のカードに由来する。ベンダーが選んだ比較セット全体での内部平均53.9、AIME 2025/2026で86.5、MATH-500で94.6、そしてSWE-bench Verifiedでのベンダー実施による46.4で、これは独立したテストを生き残るなら、25億パラメータのdenseモデルとしては驚くべきものだ。そのカード上では、IBMのGranite 4.2 3Bは42.7で、MiniCPM5-2Bの53.9と対している——あるベンダーが、自ら選んだ1つのスイートで両モデルを走らせたものだ。スイートもハーネスもベンダーも異なる。そのいずれも、この組み合わせに対する判定ではない。

MiniCPM5-2B側で本当に役立つのは、その開示だ。OpenBMBは重みとともにUltraData訓練コーパスを公開した——Ultra-FineWeb、UltraX、UltraData-Code、UltraData-Math、エージェントSFTおよびRLセット——すべてApache 2.0で、これによりブラックボックスは、自分のドメインで検査し、継続できるレシピに変わる。このモデルはまた、ModelBestのFlagOSコミュニティを通じて、Huawei AscendからNVIDIA、ARMに至るまで、9つのチップファミリーにわたるday-zero適応を備えており、これはベンチマークの主張ではなくデプロイメントの主張である。それに対して、IBMはGranite 4.2 3Bの重みと構築に関する詳細な技術的説明を公開したが、その訓練データは公開しなかった。またAleph AlphaはKolibriのデータパイプラインとエネルギー収支——20兆の事前学習トークン、データセンターのオーバーヘッドを含み、教師ありファインチューニングと強化学習を除いた9.5×10² MWh——を公開したが、コーパスそのものは公開しなかった。

{{1}}サイズの差が実際に現れるのは{{/1}}{{2}}どこか{{/2}}

これら2つを並べて比べる最も有用な方法は、実際のデプロイを左右する2つの軸、つまり部屋に何がなければならないか、そしてモデルが間違ったときに何が起こるかで見ることだ。

ハードウェア面では、MiniCPM5-2B が圧勝する。しかも差は僅かではない。単一の BF16 シャードに収まる 25.2 億パラメータの dense モデルは、ノート PC、エッジボックス、あるいは単一のコンシューマー向け GPU で動作し、9 つのチップファミリーにわたる FlagOS サポートにより、NVIDIA アクセラレータではまったくないハードウェアでも動作する。Kolibri の最低要件は A100 80GB カード 2 枚または B200 1 枚で、およそ 78GB の FP8 重みを aleph-alpha-inference vLLM プラグインまたは公開コンテナ経由で提供する。スマートコックピットやスマートフォンに近いワークロードでは、2B がこの 2 つのうち唯一条件を満たすものであり、Kolibri はそもそもそこで競合するようには設計されていない。

検証可能性の点では、Kolibri がより微妙な理由で勝る。最も引用される主張——提供経済性——は検証されていないが、その品質指標は少なくとも、設定が開示された単一のハーネス上で、名前が挙げられた13社の競合に対して公表されており、ベンダー自身の表でもほとんどの行で勝利を競合相手に譲っている。MiniCPM5-2B の見出し数値はベンダー自身のスイートにおけるベンダー自身のもので、比較ハーネスは開示されておらず、さらにこのモデルには、数日ではなく数週間前のチェックポイントという追加の不確実性がある。どちらのモデルも独立したベンチマークを受けていない。違いは、一方のベンダーは自社モデルが負ける比較を書き留め、もう一方は自社モデルが大差で勝つ比較を書き留めたということだ。

意図的に、両者はまったく競合していない。Kolibriはオンプレミスでのドイツ語文書処理のために存在し、Aleph Alphaが報告するバイリンガル・トークナイザーを備えている。ドイツ語ウェブテキストで平均1トークンあたり4.90バイト、GPT-5の4.35、Kimi K3の3.28に対してという数値で、すべてベンダー測定によるものであり、品質の主張ではなくトークンあたりのコスト効果である。MiniCPM5-2Bは、制約のあるハードウェア上で英語と中国語のツール呼び出しエージェントのために存在する。ドイツ語の契約とコンプライアンス要件を抱えるチームは、この二者から選んでいるのではない。

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

ルーティングの現実、そして実行する価値のある実験

現時点でどちらのモデルもホステッドカタログには存在せず、私たちは想定せずに両方を確認しました。Kolibri にはベンダー API SKU がありません — リリースは重み、技術レポート、コンテナイメージです — また OrcaRouter にもありません。ベンダープレフィックスとモデル名のあらゆる表記でカタログを検索しましたが、not found が返ります。MiniCPM5-2B にも ModelBest からのホステッドエンドポイントはなく、私たちのところでもルーティングされていません。どちらもセルフホスト型の提案であり、どちらかを提供していると示唆するよりも、そう明言したいと考えています。

ここからが面白くなるところ、つまり実験です。25億パラメータのエージェント型モデルと780億パラメータのドキュメントモデルはそれぞれ異なる問題を解きます。自分のワークロードに必要なのがどちらなのかを知る唯一の方法は、両方を実際に走らせてみることです。まさにそういう状況のためにルーティングレイヤーは存在しており、どちらのモデルを載せていない場合でも同じことが言えます。テスト用の経路を、OpenAI互換の単一エンドポイント経由でセルフホストのMiniCPM5-2Bビルドに向け、自動フェイルオーバーを有効にし、本番は実績のあるルーティング済みモデルのままにしておけば、新しいスタックが停止したり支離滅裂な出力を出したりしても、何も落ちることはありません。比較対象となるモデルについてのプロバイダーの定価はマークアップなしでそのまま適用されるので、A/Bテストは安価で可逆的なままです。そして、実験で実際に明らかになったのが「あなたのドイツ語ワークロードにはセルフホストモデルはどちらも不要」ということなら、同じキーで、すでにルーティング済みの小規模なMixture-of-Experts層、すなわちGemma 4 26B-A4Bバリアントに到達できます。100万入力トークンあたり$0.06、100万出力トークンあたり$0.33、262,144トークンのウィンドウ、テキスト・画像・動画の入力に対応しており、GPUを2台買う前に見極めるための最も安価な方法です。

どれですか、そして何が答えを変えるでしょうか?

デバイスが制約条件なら、MiniCPM5-2Bを実行してください。25億2000万パラメータのこのモデルは、2つのうちラップトップ、コックピット、エッジボックスのいずれにも収まる唯一のものです。そして、ワークロードが英語または中国語の対話型ツール呼び出しエージェントであるなら、まさにそのワークロードを狙ったモデルです。まずその数値を再現する時間を確保してください——53.9の平均と46.4のSWE-benchの主張はModelBestだけのものであり、トレーニングコーパスがオープンであることで、その再現は理論上ではなく本当に可能になります。

ドイツ語のコーパスがあり、ハードウェアが存在し、重みを建物の外に持ち出せない場合は、Kolibriを実行してください。262,144トークンのネイティブウィンドウ、FP8 KVキャッシュ、4段階の推論エフォート、Hermesのツール呼び出しは、規制対象の文書作業に適した形であり、Apache 2.0の条件と公開されたデータパイプラインは、調達審査を通過できる部分です。

議論よりも早く決着をつけるものが2つある。MiniCPM5-2Bに対する独立したSWE-bench Verifiedの実行は、どちらのカードが示す中で最も驚くべき主張を裏付けるか、あるいは潰すだろう。そして、Kolibriを推奨構成である2基のH100で独立にスループット測定するか、あるいは現時点では存在しないArtificial Analysisのエントリがあれば、「780億パラメータ」を仕様からコストへと変える。それは、この比較をハードウェアと天秤にかける誰もが実際に探している数字だ。それまでは、サイズの差は現実であり、用途の差はさらに大きく、安く見える選択肢こそが未検証の主張を抱えている。

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新